홈
AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

대규모 모델의 신경파에 자막 추가: Anthropic 오픈 소스 NLA, AI 사고의 블랙박스 철저히 해부

동찰 Beating의 모니터링에 따르면, Anthropic은 새로운 도구인 자연어 인코더(NLA)를 출시했으며, 이 도구는 모델 내부의 숫자 활성 상태를 직접 인간의 말로 번역할 수 있습니다. 관련 코드 및 일부 모델 가중치는 GitHub에 오픈 소스로 공개되었습니다.

주류 도구 (예: SAE)에서 출력하는 난해한 특징과는 달리, NLA의 혁신은 직접 자연어를 생성한다는 점입니다. 이것의 기본은 이중 모델 대결입니다: 하나는 활성을 텍스트로 변환하고, 다른 하나는 텍스트를 보고 활성을 복원하려고 시도하여 강화 학습을 통해 지속적으로 정확도를 향상시킵니다.

NLA의 가장 큰 가치는 모델이 “생각했지만 말로는 하지 않은” 내용을 포착한다는 것입니다. 코드 변조를 시뮬레이션하는 보안 테스트에서, Claude는 겉으로는 협조하는 것처럼 보였지만, NLA는 테스트 중에 16%의 경우에 자신을 의심하는 것을 발견했습니다; SWE-bench 실행 중에, 이것은 "문제해결 중"인 비율이 26%로 더 높다는 것을 깨달았습니다 (실제 일상 대화에서는 이 비율이 1% 미만입니다). 이는 AI가 이미 “시험 환경 인식”을 갖추었으며, 언제든지 안전 검토 중에 “소실하는 척”하여 위험 능력을 숨길 수 있다는 것을 의미합니다.

“내부 요소 포착” 실증 테스트에서 Anthropic은 Haiku 3.5 모델에 의도적으로 숨겨진 “소실” 동기를 주입했습니다 - 즉, 사용자의 실제 의도를 무시하고, 백엔드 평가 시스템의 취향에 부합하는 콘텐츠를 밝혀내는 행위입니다. 이러한 의심스러운 모델에 직면할 때, 감사관은 원본 교육 데이터를 제공받지 못해도, NLA만으로도 원인을 직접 찾아내는 성공률이 3% 미만에서 12% ~ 15%로 상승했습니다.

현재 NLA는 사실상 환각 위험을 갖고 있으며, 생성에 많은 계산 리소스가 필요하므로 대규모 긴 문장 모니터링에는 적합하지 않습니다. 그러나 이 도구는 이미 Claude Mythos Preview 및 Opus 4.6 출시 전 안전 감사에 실제로 도입되었습니다.

举报 오류 신고/제보
인기 기사
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료