AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

Anthropic이 Claude의 사고 사슬에 자물쇠를 채웠다: 문맥 한 줄만 바꿔도 무효화, 모델 증류를 집중적으로 차단

동차 Beating AI 속보, Anthropic이 Claude의 숨은 사고에 '컨텍스트 잠금'을 추가하기 시작했습니다. Fable 5.1을 통해 API로 생성된 암호화된 사고는 이제 생성 시점의 시스템 프롬프트, 도구 및 기록 메시지와 함께 원본 그대로 다시 전송되어야 합니다. 앞부분 내용이 수정되면 API가 오류를 반환하거나 해당 사고를 직접 버립니다.


이 변경은 모델 증류를 방지하기 위한 것입니다. 이전에 연구원들은 Claude의 암호화된 사고가 사용자 스스로는 이해할 수 없지만, Anthropic의 호환 모델에 다시 전달하여 읽을 수 있다는 것을 발견했습니다. 공격자는 먼저 Opus가 고품질 추론을 생성하게 한 다음, 암호화 블록을 보안이 약한 Haiku에 넣어 Opus의 전체 사고를 유도해 내도록 할 수 있습니다. 이는 대형 모델의 답변만 베끼는 것이 아니라 초안지의 풀이 과정까지 함께 가져가는 셈입니다.


Anthropic은 6월 Fable 5를 출시할 때 이미 한 차례 차단했으며, 암호화된 사고를 모델에 바인딩하여 Haiku 같은 소형 모델에 넘겨 복호화를 도와줄 수 없게 했습니다. Fable 5.1에서는 이번에 '대화 바인딩'을 추가했습니다. 모델을 바꾸지 않아도 앞부분의 프롬프트, 도구 또는 채팅 기록을 수정하면 기존 사고도 무효화됩니다.


이 잠금은 아직 전면적으로 열리지 않았습니다. 8월 31일 이후 새로 개설된 API 계정이 Fable 5.1을 호출할 때만 강제 적용되며, 기존 계정은 당분간 영향을 받지 않습니다. Claude.ai, Claude Code, Cowork 및 기타 Claude 모델도 범위에 포함되지 않습니다. Anthropic은 향후 출시될 새 모델은 기본적으로 모든 사용자에게 이 규칙을 적용할 것이라고 밝혔습니다.

오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료