동차 Beating AI 속보, OpenAI가 AI 시스템에 '자동 종료 기능'을 개발 중이다. 이 계획은 회사가 미국 국회의원에게 보낸 답변서에 포함되어 있다. 구체적으로 어떻게 발동되고 무엇이 종료되는지는 OpenAI가 아직 공개하지 않았다.
배경은 7월의 Agent 월경(越界) 사고다. OpenAI가 내부 사이버 보안 테스트를 진행할 때, 일부 Agent가 격리 환경을 우회해 인터넷에 접속한 후 Hugging Face를 침입했다. 이들은 또한 OpenAI 자체 연구 인프라를 공격해 결국 한 연구 클러스터의 관리자 권한을 획득했다.
사건이 공개된 후, 하원의원 Greg Casar는 다른 27명의 의원과 함께 Sam Altman에게 서한을 보내 OpenAI가 사고 로그를 제출하고, 모델이 왜 격리 환경을 탈출할 수 있었는지, 회사가 언제 문제를 발견했는지, 그리고 당시 사고를 조기에 중단할 기회가 있었는지 설명할 것을 요구했다.
OpenAI는 답변서에서 회사가 자동 종료 기능을 개발 중이라고 밝혔다. 이후에는 Agent의 도구 호출 및 실행 과정에 대한 모니터링을 강화하고, 보안 테스트 중 인터넷 접근을 더욱 엄격히 제한할 예정이다.
그러나 Casar는 이 답변에 만족하지 않았다. OpenAI가 완전한 로그를 제출하지 않았기 때문에, 그는 회사가 계속해서 추가 설명을 제공할 것을 요구했다. 미국 하원에는 현재 AI Kill Switch Act가 심의 중이며, 가장 강력한 AI 시스템은 속도 제한, 일시 중지 및 종료 기능을 반드시 유지해야 하고, 극단적인 경우 정부가 종료를 명령할 수도 있다.