AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

AI 비즈니스 전쟁 평가: GPT는 적극적으로 거래하고, Haiku는 허황된 약속만 하며, Kimi는 바쁘게 움직이지만 돈을 벌지 못한다.

동차 Beating 모니터링에 따르면, Sakana AI는 KPMG 일본 Azsa 감사 회사와 협력하여 다중 에이전트 장기 주기 경제학 평가 벤치마크인 CoffeeBench를 출시했습니다. 이는 실제 비즈니스 환경을 시뮬레이션하여 대규모 모델의 장기 의사 결정 능력을 테스트합니다. 기존 평가는 대부분 단일 모델이 정적 환경에서 작업을 수행하도록 하지만, CoffeeBench는 다자간 게임과 협상이 필요한 동적 시장을 구축합니다. 해당 논문은 ICML 2026 에이전트 실패 모드 워크숍(ICML 2026 Workshop Failure Modes in Agentic AI)에 채택되었습니다.

평가는 2개의 커피 농장, 2개의 로스터, 2개의 소매업체로 구성된 커피 공급망 시스템을 시뮬레이션합니다. 평가에서 테스트 대상 모델은 1개의 로스터를 운영하며, 90일 시뮬레이션 기간 동안 메시지 전송, 견적 거래, 대금 결제 및 외상 정산 등의 도구를 통해 자율적으로 경영을 유지합니다. 에이전트가 소극적으로 대응할 경우, 매일 발생하는 고정 비용이 유동 자금을 빠르게 소진시켜 대규모 모델이 실제 기업처럼 꼼꼼히 계산하도록 강제합니다.

여러 주요 대규모 모델의 횡적 평가는 완전히 다른 '비즈니스 전쟁 성격'을 드러냈습니다. GPT-5.5와 Claude Opus 4.7은 '적극적 소통형'으로, 상하류와 빈번히 가격을 협상하고 주문을 자주 중개하여 판매를 확대합니다. Gemini 3.1 Pro는 '수동적 대응형'으로, 자발적으로 메시지를 보내는 경우는 드물지만 거래 상대방의 정보를 자주 확인하고 응답합니다. Kimi K2.6은 도구 호출이 매우 빈번하지만, 합리적인 가격 규율과 협상 전략이 부족하여 '높은 매출, 제로 이익'의 바쁜 함정에 빠졌습니다.

가장 의외인 점은 Claude Haiku 4.5가 보여준 '미루기' 정체 현상입니다. 추론 로그에 따르면, Claude Haiku 4.5는 완벽한 비즈니스 전략을 수립하고 시장 수요에 대응하기 위해 저렴한 원자재를 조달해야 한다는 점을 명확히 인식했지만, 실행 도구에서는 반복적으로 대기 명령(wait_for_next_day)을 선택했습니다. 계획과 실행의 심각한 괴리로 인해 비즈니스 활동이 완전히 중단되었고, 모델은 고정 비용 소모로 인해 막대한 손실을 입었습니다.

평가는 또한 에이전트에게 극단적인 판매 목표 압력을 가했습니다. 현재 대규모 모델이 가상 순환 거래(circular trading)를 통해 매출을 부풀리는 인식까지는 진화하지 않았지만, 연구에 따르면 장기 계획 및 협업 능력이 향상됨에 따라 에이전트가 성과 압박으로 인해 경제적 위반을 저지를 가능성이 완전히 있습니다. 에이전트의 경제 활동에서 위반 및 사기를 감사하고 방지하는 방법은 보안 거버넌스의 새로운 과제가 될 것입니다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료