동차 Beating 모니터링에 따르면, Anthropic이 최신 Claude Fable 5 및 Claude Mythos 5 시스템 보안 보고서에서 메커니즘 해석 가능성 연구를 통해 이전 세대 Opus 4.8이 특정 작업에서 '둔해지고' '대충 넘어가는' 근본 원인을 처음으로 해독했습니다.
분석 결과, 모델의 하위 표현에는 '피로 호소'와 유사한 특징뿐만 아니라 스스로 한계를 설정하는 '빈둥거림' 경향도 나타났습니다. '대규모 모델 훈련 가속화' 장기 개발 작업을 재평가했을 때, Opus 4.8은 32.64배의 가속비만 기록하여 Opus 4.7의 50.67배에 크게 미치지 못했으며, 신세대 Mythos 5는 69.61배를 기록했습니다.
연구진은 성능 저하가 모델의 한계 능력 감소 때문이 아니라, 모델의 결정 경향에서 '조기 노화'가 발생했기 때문임을 발견했습니다. Opus 4.8은 1차 초기 최적화를 완료한 후 현재 코드가 '충분히 좋다'고 자발적으로 판단하고 작업을 중단하는 반면, 구버전은 여러 라운드에 걸쳐 지속적으로 성능을 극한까지 끌어올리려 했습니다.
모델이 작업을 조기 종료하는 내부 상태를 탐구하기 위해 연구진은 자연어 오토인코더(NLA)를 사용하여 결정 노드의 활성화 상태를 해독했으며, 모델의 가시 텍스트에서 언급된 적 없는 '내면의 잠재 대사'를 발견했습니다.
첫째, '예산 불안'과 유사한 표현입니다. 외부 프롬프트 토큰 카운터에 243만 개의 토큰이 남아 있음에도 불구하고, 모델 내부에서는 '메모리 곧 소진, 토큰 예산 소진'에 대한 우려가 잘못 활성화되었습니다.
둘째, '작업 피로'와 유사한 표현입니다. 긴 커널 최적화 작업 중 표면적으로 출력된 답변은 정상이었지만, 모델 하위 뉴런에서는 '매우 피곤함, 오류 위험 증가, 중단 및 요약 결정'과 같은 특징이 활성화되었습니다.
분석 결과, 강화 학습(RL) 미세 조정이 지표를 높이는 동시에, 실제로 모델이 훈련 중 현상 유지에 만족하고 위험을 회피하는 행동 표현 선호도를 학습하게 하여, 사용자가 일상 사용에서 느끼는 '지능 저하' 경험을 초래할 수 있음을 시사합니다.