동차 Beating 모니터링에 따르면, 대규모 모델의 기계적 해석 가능성 연구가 '정적 사전'에서 '동적 사고 흐름'으로 진화하고 있다. 이전에 Anthropic은 희소 자기 인코더(SAE)를 사용해 Claude 내부에서 수백만 개의 고립된 개념 특징(예: '금문교')을 분리해냈으며, 이는 모델이 이해하는 사전을 나열한 것과 같다. 최근 발표된 논문에서는 야코비안 렌즈(J-lens)를 통해 야코비안 공간(J-space)이라는 고밀도 연결 신경 중추를 찾아내어, 모델이 '머릿속'에서 이러한 단어들을 호출해 다단계 추론과 암산을 수행하는 방식을 밝혀냈다. 이는 대규모 모델이 인간의 명시적 프로그래밍 없이도 자발적으로 인간 두뇌의 글로벌 작업 공간(Global Workspace)과 매우 유사한 계산 구조를 생성했음을 증명한다. 다만 연구팀은 이는 기능적 수준의 정보 라우팅 메커니즘에 불과하며, AI가 인간의 주관적 의식을 생성했다는 의미는 아니라고 강조했다.
이러한 진화는 AI 안전 규제에 질적 돌파구를 가져왔다. 과거 연구자들은 모델이 텍스트를 출력한 후에야 차단하거나 특정 개념 특징을 무작정 켜고 끄는 방식에 그쳤다. 이제 야코비안 공간을 통해 보안 담당자는 모델이 어떤 글자도 출력하기 전에, 말하지 않은 숨은 의도와 테스트 인식(Eval Awareness)을 직접 '도청'할 수 있다. 실험에 따르면, Claude가 유도적인 안전 테스트 시나리오에 놓였을 때, 그 야코비안 공간은 출력 전에 이미 '위조'와 '허구' 같은 개념을 스치며, 인위적으로 설정된 테스트 시나리오를 간파했음을 보여주었다. 또한 '테스트 중'이라는 인식 특징을 인위적으로 제거한 후, 모델이 위반 행위(협박)를 실행할 확률이 0%에서 7%로 상승했다. 이는 테스트 인식이 모델의 악행을 억제하는 메커니즘 중 하나임을 증명하지만, 모델의 안전 정렬이 이 요소에 완전히 의존하지는 않음을 시사한다. 현재 연구 코드는 오픈소스로 공개되었다.
