동찰 Beating AI 속보, 오픈소스 Computer Use 도구 Cua가 Cua Driver에 선택적 Perception 비전 확장을 추가했다. Driver는 원래 웹페이지 구조와 시스템 접근성 트리를 통해 버튼을 우선적으로 찾았다. Canvas, 게임, 원격 데스크톱 또는 자체 렌더링 앱을 만나면 이러한 구조가 비어 있을 수 있다. Perception은 스크린샷을 직접 읽어 화면을 텍스트, 유형, 위치가 포함된 영역으로 분할하여 Agent가 계속 작업할 수 있도록 한다.
첫 버전은 OmniParser로 아이콘과 컨트롤을 인식하고, PP-OCR로 텍스트를 읽는다. 전체 파싱 과정은 로컬 CPU에서 완료되며 GPU가 필요 없고 스크린샷을 네트워크로 전송하지도 않는다. 공식 실측 기준 단일 스크린샷은 macOS에서 약 2~2.5초, Linux는 3.5~4초, Windows는 8~9초가 소요된다. 주로 페이지 구조와 접근성 트리가失效할 때 보완하는 역할이며, 기본적으로 매 단계마다 비전 파싱을 실행하지는 않는다.
Cua는 또한 비전 작업이 이전 스크린샷을 재사용하는 것을 제한한다. 매번 비전 인식은 현재 스크린샷의 `capture_id`에 바인딩되며, 이후 클릭은 반드시 동일한 스크린샷에서 비롯되어야 한다. 스크린샷이 60초를 초과하거나 이미 한 번 작업이 실행된 경우, Driver는 계속 사용을 거부하여 인터페이스 변경 후 이전 좌표로 잘못 클릭하는 것을 방지한다.
Cua는 사실 과거에 이미 `cua-som`과 OmniParser를 통해 비전 위치 지정을 할 수 있었다. 이제 이 기능이 Cua Driver에 직접 통합되어 상위 Agent가 통합 인터페이스를 통해 인식 결과를 얻을 수 있다. 모델 자체가 이미지를 볼 수 없더라도 이러한 텍스트와 영역 정보를 기반으로 다음 작업을 결정할 수 있다.
Perception은 기본 구성 요소가 아니며, 그중 OmniParser 감지기는 AGPL-3.0을 채택하고, Cua Driver는 여전히 MIT 라이선스를 유지한다.