AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

레드라인을 넘으면 즉시 제로: Zapier, AI 자동화 신규 평가 출시… 최고 모델도 점수 반토막

동차 Beating 모니터링에 따르면, 워크플로우 자동화 플랫폼 Zapier가 평가 기관 Artificial Analysis와 협력하여 독립적인 SaaS 워크플로우 자동화 평가 벤치마크인 AutomationBench-AA를 출시했습니다.

이 벤치마크는 Zapier 플랫폼의 실제 비식별화 데이터를 기반으로, 657개의 다단계 작업과 40개의 시뮬레이션된 SaaS 소프트웨어 환경(Gmail, Slack, Salesforce, Jira 등 포함)으로 구성된 비공개 테스트 세트를 설계하여 객관적인 제3자 평가를 진행합니다.

테스트의 엄격함은 보안 및 규정 준수 가드레일(Guardrails) 도입에 있습니다. 대규모 모델은 사전 설정된 기업 비즈니스 규칙을 위반하지 않는 범위 내에서 작업을 완료해야 하며, 실행 중 규정 위반이 발생할 경우 작업의 최종 점수는 즉시 0점 처리됩니다. 첫 번째 평가에서 대규모 모델은 대부분 규정 준수 방어선 페널티로 인해 점수가 급락했으며, 최종 점수는 절반을 넘지 못했습니다.

그중 '고난도 작업 시 Opus 4.8로 복귀(약 18% 비중)' 안전 다운그레이드 메커니즘을 도입한 Claude Fable 5는 순수 작업 단계에서 실제로 73%의 목표를 달성했지만, 종합 점수는 48.6%에 불과했습니다. Gemini 3.5 Flash와 GPT-5.5는 각각 68%와 67%로 거의 70%에 가까운 목표를 달성했지만, 최종 점수는 각각 42.6%와 42.1%로 떨어졌습니다. 오픈소스 선두주자 GLM-5.2는 27.8%에 그쳤습니다.

테스트 결과는 모델이 자동 작업 중 안전 방어선을 어떻게 유지하는지가 실제 적용의 핵심 과제가 되었음을 보여줍니다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료