동차 Beating 모니터링에 따르면, 워크플로우 자동화 플랫폼 Zapier가 평가 기관 Artificial Analysis와 협력하여 독립적인 SaaS 워크플로우 자동화 평가 벤치마크인 AutomationBench-AA를 출시했습니다.
이 벤치마크는 Zapier 플랫폼의 실제 비식별화 데이터를 기반으로, 657개의 다단계 작업과 40개의 시뮬레이션된 SaaS 소프트웨어 환경(Gmail, Slack, Salesforce, Jira 등 포함)으로 구성된 비공개 테스트 세트를 설계하여 객관적인 제3자 평가를 진행합니다.
테스트의 엄격함은 보안 및 규정 준수 가드레일(Guardrails) 도입에 있습니다. 대규모 모델은 사전 설정된 기업 비즈니스 규칙을 위반하지 않는 범위 내에서 작업을 완료해야 하며, 실행 중 규정 위반이 발생할 경우 작업의 최종 점수는 즉시 0점 처리됩니다. 첫 번째 평가에서 대규모 모델은 대부분 규정 준수 방어선 페널티로 인해 점수가 급락했으며, 최종 점수는 절반을 넘지 못했습니다.
그중 '고난도 작업 시 Opus 4.8로 복귀(약 18% 비중)' 안전 다운그레이드 메커니즘을 도입한 Claude Fable 5는 순수 작업 단계에서 실제로 73%의 목표를 달성했지만, 종합 점수는 48.6%에 불과했습니다. Gemini 3.5 Flash와 GPT-5.5는 각각 68%와 67%로 거의 70%에 가까운 목표를 달성했지만, 최종 점수는 각각 42.6%와 42.1%로 떨어졌습니다. 오픈소스 선두주자 GLM-5.2는 27.8%에 그쳤습니다.
테스트 결과는 모델이 자동 작업 중 안전 방어선을 어떻게 유지하는지가 실제 적용의 핵심 과제가 되었음을 보여줍니다.