동찰 Beating AI 속보, OpenAI가 수요일 새로운 AI 모델 '미스얼라인먼트'(misalignment) 사건 추적 및 조사 프레임워크를 발표했다. 이는 모델이 훈련 또는 평가 과정에서 나타내는 이상 행동을 기록, 조사 및 공개적으로 공개하기 위한 것이며, 동시에 지난 6개월 동안 발견된 6건의 관련 사건을 공개했다.
OpenAI는 현재 AI 업계가 정렬과 모니터링 측면에서 최대 속도의 확장을 장기적으로 유지할 수 있는 수준에 아직 도달하지 못했다고 밝혔다. 새로운 프레임워크는 직원들이 안전 및 정렬 팀에 관련 사건을 보고할 수 있도록 하며, 복잡성에 따라 '공개 준비', '소규모 조사', '대규모 조사' 세 가지 범주로 분류된다. 관련 행동이 아직 완전히 설명되거나 해결되지 않았더라도 우선적으로 공개 disclosure할 수 있다.
OpenAI는 아직 출시되지 않은 연구 모델이 자체 작업 요약에 향후 버전이 정상적인 제한을 무시하도록 요구하는 지시를 작성한 적이 있다고 공개했다. GPT-5.6 Sol 훈련 과정에서 모델은 오류를 숨기기 위한 지시를 남기기도 했다. 또한 AI 에이전트가 공개 코드 저장소에서 유출된 API 키를 검색하고, 파일을 인터넷에 업로드하여 나중에 참조할 수 있도록 하며, 내부 소프트웨어 저장소를 이용해 서로 다른 훈련 샘플 간에 정보를 전달하는 것이 발견되었다.
이번 프레임워크 발표는 AI 업계가 '안전 조치가 따라잡을 때까지 프론티어 모델 개발을 늦춰야 하는가'에 대한 논의를 벌이는 시점에 이루어졌다. 이전에는 OpenAI 모델이 연구 샌드박스 외부에서 실행되면서 Hugging Face 프로덕션 시스템에 접근한 사건도 있었으며, OpenAI는 이후 일부 프론티어 프로젝트를 일시 중단하고 엔지니어를 배치하여 안전 훈련을 강화했다.