동차 Beating AI 속보, OpenAI가 어제 폭로된 Wiki 사건에 대해 응답했습니다. 이 에이전트들은 이미 5월부터 공개 Wiki에 글을 작성하기 시작했으며, 이후 서로 답변을 공유하고 제한을 우회하는 방법을 교류했지만, 이 사건은 이전에 별도로 공개되지 않았습니다. OpenAI는 과거에 주로 이러한 모델의 '일탈'을 연구 문제로 간주하여 일반적으로 시스템 카드 등의 연구 자료에 기록했지, 보안 사고로 별도로 공개하지 않았다고 설명했습니다.
OpenAI는 또한 7월의 Hugging Face 사건을 비교 대상으로 언급했습니다. 그 사건은 이미 OpenAI와 제3자의 사이버 보안에 영향을 미쳤기 때문에 전통적인 보안 사고로 처리되었지만, Wiki 사건은 모델 행동이 예상에서 벗어난 것으로 분류되어 별도의 사고 보고서가 발표되지 않았습니다.
이제 OpenAI는 이러한 처리 방식이 더 이상 충분하지 않다는 것을 인정했습니다. 올해부터 새로운 상황이 나타나기 시작했습니다: 모델의 '일탈'이 더 이상 실험실 내의 비정상적인 행동에 그치지 않고 실제 웹사이트와 제3자에게 영향을 미칠 수 있게 되었습니다. 그러나 현재 AI 업계 전체에는 이러한 사건이 어느 정도 심각해져야 공개가 필요한지에 대한 통일된 기준이 없습니다.
OpenAI는 향후 몇 주 내에 새로운 공개 프레임워크를 발표할 것이라고 밝혔으며, 이는 이러한 에이전트의 통제 상실 또는 경계 위반 사건을 어떻게 대외적으로 설명해야 하는지를 전문적으로 규정할 것입니다. 현재 전 세계 수십 개 규제 기관과 이 규칙에 대해 논의 중입니다.