AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

OpenAI 연구원 노암 브라운(Noam Brown)은 단일 벤치마크 점수로는 최첨단 대형 모델을 평가할 수 없다며, 추론 연산 곡선(reasoning compute curve)의 도입을 주장하고 있다.

동찰 Beating 모니터링에 따르면, OpenAI 연구원 Noam Brown은 AI 모델 성능이 향상됨에 따라 모델의 우수성을 측정하는 벤치마크 점수가 점차 추론 시 연산 능력(즉, 모델이 질문에 답할 때 소비하는 계산 자원)에 의해 좌우된다는 의견을 제시했습니다. 단순한 정적 점수는 더 이상 강력한 모델의 실제 수준을 반영할 수 없으며, 미래의 평가 기준은 추론 연산 능력 또는 생성된 토큰 수를 가로축으로 하는 성능 확장 곡선으로 전환되어야 합니다.

Noam Brown은 새 모델 GPT-5.5의 테스트 과정을 예로 들어, 초기 일반 테스트에서 GPT-5.5는 GPT-5.4에 비해 큰 우위를 보이지 않았습니다. 그러나 더 많은 추론 연산 능력이 할당되자 GPT-5.5의 성능은 폭발적으로 증가했습니다. 실행 예산이 제한되면 표준 테스트는 최첨단 모델의 실제 상한선을 반영할 수 없습니다. 유사한 성능 확장 양상은 여러 외부 평가에서 확인되었습니다. Andrej Karpathy의 에이전트 자율 연구 실험과 영국 AI 안전 연구소의 악성 네트워크 테스트에서 추론 예산이 증가함에 따라 GPT-5.5와 Mythos 모델의 성능은 지속적으로 상승했으며, 1억 개 이상의 토큰을 생성한 후에도 한계에 도달하지 않았고, 더 강력한 모델일수록 더 많은 연산 능력을 투입할 때 성능 향상이 더 두드러졌습니다.

추론 연산 능력의 향상은 안전 평가를 더욱 복잡하게 만들었습니다. Noam Brown은 현재 생물학적 또는 사이버 보안 평가에는 일반적으로 고정된 추론 예산이 없다고 경고했습니다. 국가 차원의 적이 특정 작업에 1,000만 달러 이상의 추론 예산을 투입할 때, 원래 안전해 보였던 모델이 위험한 적색 선을 넘을 수 있습니다. 대규모 모델 제조사는 새 모델을 출시할 때 토큰 수, 연산 비용 또는 실행 시간을 가로축으로 하는 성능 곡선을 적극적으로 공개해야 하며, 평가 기관도 추론 예산을 평가의 핵심 변수로 설정하고, 안전 평가에서 낮은 연산 능력 테스트를 통해 안전 경계를 외삽해야 합니다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료