AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

개인 에이전트에도 실전 순위표가 생겼다: Muse가 현재 1위, Instinct와 Grok Bot을 앞서고 있다

동찰 Beating AI 속보, 독립 평가 프로젝트 Assistant Benchmark가 실제 작업으로 개인 AI 어시스턴트를 비교 평가하기 시작했다. 에이전트에게 직접 호텔 예약, 레스토랑 선택, 쇼핑, 이메일 답장, 제3자 서비스 연동을 시키고 실제 완료 상황에 따라 점수를 매긴다. 각 평가 차원에는 공개된 고정 작업이 하나씩 있으며, 실제 실행 기록이 있어야만 점수를 준다.


현재 Muse는 완료된 7개 평가 차원에서 평균 9.1점으로 잠정 1위다. Instinct는 11개 차원을测试 완료해 평균 8.4점, Grok Bot은 7개 차원을测试 완료해 평균 7.3점을 받았다. Muse는 쇼핑, 이메일, 제3자 앱 연동에서 모두 10점을 받았다.


다만 이는 지속적으로 업데이트되는 실제 경험 순위표로 보는 것이 더 적절하다. Muse의 9.1점은 현재까지测试된 7개 차원의 평균일 뿐 완전한 성적이 아니다. 각 차원은 현재 고정 작업 하나로만 테스트되며, 추후 추가 테스트 후 점수와 순위가 모두 바뀔 수 있다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료