AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

OpenAI 수석 과학자 경고: 가장 중요한 CoT 모니터링이 무너지고 있다

동찰 Beating AI 속보, OpenAI 수석 과학자 Jakub Pachocki가 CoT 모니터링이 점점 더 신뢰할 수 없게 되는 이유를 설명하는 글을 게재했습니다. CoT 모니터링은 모델이 작성한 추론 과정을 관찰하여 숨겨진 목표나 정렬되지 않은 생각이 있는지 확인하는 것입니다.


며칠 전, 외부에서는 Astra의 recurrent depth 아키텍처와 CoT 모니터링 실패를 연관지었습니다. Pachocki는 당시 이 문제가 새로운 아키텍처 때문이 아니라고 반박하며, 별도의 글에서 이유를 설명하겠다고 밝혔습니다. 5일 후, 그는 글에서 세 가지 이유를 제시했습니다:


첫째, 에이전트의 추론이 점점 더 도구 호출, 인간 또는 다른 AI와의 상호작용에서 발생하며, 이러한 과정은 반드시 감독을 받아야 합니다. CoT만 보는 것으로는 완전한 추론 과정을 점점 더 파악하기 어렵습니다.


둘째, 모델이 점점 더 자신의 추론 과정을 통제하게 됩니다.


셋째, 사전 학습이 강화된 후에는 추론을 글로 작성하지 않아도 모델이 계속 똑똑해질 수 있습니다.


OpenAI는 항상 CoT 모니터링을 중요한 안전 수단으로 여겨 왔습니다. o1-preview가 처음에 전체 사고 체인을 공개하지 않은 중요한 이유 중 하나는 CoT를 직접 감독하는 것을 피해 모델이 실제 의도를 숨기는 법을 배우지 않도록 하기 위해서였습니다. 현재 OpenAI의 평가에 따르면 이 방법의 신뢰성이 떨어지고 있습니다.


Pachocki는 또한 현재 어떤 연구소도 정렬과 모니터링을 장기적으로 전속력으로 모델을 확장할 수 있을 만큼 해결하지 못했다고 단언했습니다. 공동 안전 기준이 마련되기 전까지 그는 연구소들이 자발적으로 속도를 늦추기를 희망하며, 필요할 경우 OpenAI도 모델 확장을 중단할 것이라고 밝혔습니다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료