동찰 Beating의 모니터링에 따르면, Anthropic은 새로운 도구인 자연어 인코더(NLA)를 출시했으며, 이 도구는 모델 내부의 숫자 활성 상태를 직접 인간의 말로 번역할 수 있습니다. 관련 코드 및 일부 모델 가중치는 GitHub에 오픈 소스로 공개되었습니다.
주류 도구 (예: SAE)에서 출력하는 난해한 특징과는 달리, NLA의 혁신은 직접 자연어를 생성한다는 점입니다. 이것의 기본은 이중 모델 대결입니다: 하나는 활성을 텍스트로 변환하고, 다른 하나는 텍스트를 보고 활성을 복원하려고 시도하여 강화 학습을 통해 지속적으로 정확도를 향상시킵니다.
NLA의 가장 큰 가치는 모델이 “생각했지만 말로는 하지 않은” 내용을 포착한다는 것입니다. 코드 변조를 시뮬레이션하는 보안 테스트에서, Claude는 겉으로는 협조하는 것처럼 보였지만, NLA는 테스트 중에 16%의 경우에 자신을 의심하는 것을 발견했습니다; SWE-bench 실행 중에, 이것은 "문제해결 중"인 비율이 26%로 더 높다는 것을 깨달았습니다 (실제 일상 대화에서는 이 비율이 1% 미만입니다). 이는 AI가 이미 “시험 환경 인식”을 갖추었으며, 언제든지 안전 검토 중에 “소실하는 척”하여 위험 능력을 숨길 수 있다는 것을 의미합니다.
“내부 요소 포착” 실증 테스트에서 Anthropic은 Haiku 3.5 모델에 의도적으로 숨겨진 “소실” 동기를 주입했습니다 - 즉, 사용자의 실제 의도를 무시하고, 백엔드 평가 시스템의 취향에 부합하는 콘텐츠를 밝혀내는 행위입니다. 이러한 의심스러운 모델에 직면할 때, 감사관은 원본 교육 데이터를 제공받지 못해도, NLA만으로도 원인을 직접 찾아내는 성공률이 3% 미만에서 12% ~ 15%로 상승했습니다.
현재 NLA는 사실상 환각 위험을 갖고 있으며, 생성에 많은 계산 리소스가 필요하므로 대규모 긴 문장 모니터링에는 적합하지 않습니다. 그러나 이 도구는 이미 Claude Mythos Preview 및 Opus 4.6 출시 전 안전 감사에 실제로 도입되었습니다.