내 CLI가 데스크탑 전체를 제어하는데, 성능을 제대로 테스트할 방법이 있을까?
My CLI now controls my entire desktop, whats a good test to see if it works really good.
핵심 요약
CLI 기반 데스크탑 제어 AI의 성능을 극한으로 시험해 볼 수 있는 테스트 케이스를 찾는 중.
- 데스크탑 제어 자동화 — 마우스, 키보드, 스크린샷을 조합해 CLI로 PC 환경을 완벽하게 제어함.
- 성능 테스트 고민 — 단순한 작업은 성공했지만, AI가 한계를 느낄만한 고난도 테스트를 찾고 있음.
- 모델 성능 비교 — 스크린샷 분석 능력에서 Opus 4.7보다 GPT-5.5가 더 뛰어난 성능을 보임.
- 테스트 목적 — 프론트엔드 UI의 견고함을 검증하기 위해 AI가 스스로 오류를 극복하게 만들고 싶음.
내 CLI는 마우스 제어, 키보드 입력, 스크린샷 촬영을 조합한 하이브리드 방식을 통해 모든 앱을 제어할 수 있어. 나는 이 녀석에게 Perplexity를 열고, 메시지를 보내고, 그 메시지를 스크린샷으로 찍은 뒤, Gmail을 열어 나 자신에게 이메일로 해당 스크린샷을 보내라는 작업을 시켰어. 참고로 Playwright는 사용하지 않았어. 하지만 이 녀석은 언제 Playwright를 써야 할지 스스로 판단할 수 있어. 무슨 말이냐면, 웹사이트가 캡차(captcha)에 민감하면 Playwright를 쓰지 않고 사람처럼 보이게 마우스를 움직인다는 뜻이야.
다음 작업은 더 어려울 거라고 생각했는데, Chrome 원격 데스크탑을 통해 내 다른 Windows PC에 연결해서 똑같은 작업을 시켜봤더니 성공했어. 궁금한 건, 이 녀석을 정말 제대로 테스트해서 성능을 확실히 검증할 수 있는 방법이 뭐가 있을까? 그리고 놀랍게도 Opus 4.7은 GPT-5.5만큼 스크린샷을 잘 분석하지 못하더라고. Opus는 자꾸 엉뚱한 버튼을 클릭해.
지금 이 프로젝트의 목적은 프론트엔드를 확인하고, 직접 클릭해서 테스트를 실행함으로써 프론트엔드가 완벽하게 작동하는지 확인하는 거야. 그렇다면 이 녀석이 작업을 수행하면서 정말 애를 먹을 만한 테스트에는 어떤 게 있을까?
