동차 Beating AI 속보, Anthropic이 Claude의 숨은 사고에 '컨텍스트 잠금'을 추가하기 시작했습니다. Fable 5.1을 통해 API로 생성된 암호화된 사고는 이제 생성 시점의 시스템 프롬프트, 도구 및 기록 메시지와 함께 원본 그대로 다시 전송되어야 합니다. 앞부분 내용이 수정되면 API가 오류를 반환하거나 해당 사고를 직접 버립니다.
이 변경은 모델 증류를 방지하기 위한 것입니다. 이전에 연구원들은 Claude의 암호화된 사고가 사용자 스스로는 이해할 수 없지만, Anthropic의 호환 모델에 다시 전달하여 읽을 수 있다는 것을 발견했습니다. 공격자는 먼저 Opus가 고품질 추론을 생성하게 한 다음, 암호화 블록을 보안이 약한 Haiku에 넣어 Opus의 전체 사고를 유도해 내도록 할 수 있습니다. 이는 대형 모델의 답변만 베끼는 것이 아니라 초안지의 풀이 과정까지 함께 가져가는 셈입니다.
Anthropic은 6월 Fable 5를 출시할 때 이미 한 차례 차단했으며, 암호화된 사고를 모델에 바인딩하여 Haiku 같은 소형 모델에 넘겨 복호화를 도와줄 수 없게 했습니다. Fable 5.1에서는 이번에 '대화 바인딩'을 추가했습니다. 모델을 바꾸지 않아도 앞부분의 프롬프트, 도구 또는 채팅 기록을 수정하면 기존 사고도 무효화됩니다.
이 잠금은 아직 전면적으로 열리지 않았습니다. 8월 31일 이후 새로 개설된 API 계정이 Fable 5.1을 호출할 때만 강제 적용되며, 기존 계정은 당분간 영향을 받지 않습니다. Claude.ai, Claude Code, Cowork 및 기타 Claude 모델도 범위에 포함되지 않습니다. Anthropic은 향후 출시될 새 모델은 기본적으로 모든 사용자에게 이 규칙을 적용할 것이라고 밝혔습니다.