동찰 Beating AI 속보, 독립 평가 프로젝트 Assistant Benchmark가 실제 작업으로 개인 AI 어시스턴트를 비교 평가하기 시작했다. 에이전트에게 직접 호텔 예약, 레스토랑 선택, 쇼핑, 이메일 답장, 제3자 서비스 연동을 시키고 실제 완료 상황에 따라 점수를 매긴다. 각 평가 차원에는 공개된 고정 작업이 하나씩 있으며, 실제 실행 기록이 있어야만 점수를 준다.
현재 Muse는 완료된 7개 평가 차원에서 평균 9.1점으로 잠정 1위다. Instinct는 11개 차원을测试 완료해 평균 8.4점, Grok Bot은 7개 차원을测试 완료해 평균 7.3점을 받았다. Muse는 쇼핑, 이메일, 제3자 앱 연동에서 모두 10점을 받았다.
다만 이는 지속적으로 업데이트되는 실제 경험 순위표로 보는 것이 더 적절하다. Muse의 9.1점은 현재까지测试된 7개 차원의 평균일 뿐 완전한 성적이 아니다. 각 차원은 현재 고정 작업 하나로만 테스트되며, 추후 추가 테스트 후 점수와 순위가 모두 바뀔 수 있다.
