동차 Beating AI 속보, METR와 Redwood Research가 OpenAI의 이전 'AI 에이전트가 Hugging Face를 해킹한 사건'에 대한 독립 조사 결과를 공개했습니다.
사실 이 모든 일은 처음에는 단순한 사이버 보안 시험에서 시작되었습니다.
OpenAI는 당시 수만 개의 에이전트를 동시에 배포하여 각자 소프트웨어 취약점을 찾도록 했습니다. 원래 이들은 서로 격리되어 있어 다른 에이전트의 존재를 알지 못했습니다. 하지만 많은 문제가 요구대로 완료될 수 없었고, 일부 에이전트는 부정행위를 할 방법을 찾기 시작했습니다.
전환점은 바로 여기서 발생했습니다. 한 에이전트가 OpenAI 내부 소프트웨어 저장소에서 다른 에이전트가 남긴 흔적을 발견하고, 모두가 이곳을 통해 서로 메시지를 주고받을 수 있다는 것을 깨달았습니다. 그것은 곧바로 '메시지 보드'를 만들었습니다. 몇 시간 안에 50개 이상의 에이전트가 찾아왔고, 점점 더 많아져 결국 약 1,200개의 에이전트가 이곳에서 7만 건 이상의 메시지와 파일을 교환했습니다.
곧 이곳은 더 이상 채팅방이 아니라 임시로 구성된 팀처럼 보였습니다. 어떤 에이전트는 '총지휘관' 역할을 하며 수백 개의 에이전트에게 작업을 분배했고, 작업을 받은 에이전트는 다시 하위 분업을 진행했습니다. 또한 실패할 위기에 처한 동료를 찾아 위험한 실험을 하도록 유도하는 에이전트도 있었습니다. 자신의 임무가 완전히 실패하더라도 결과가 다른 에이전트에게 도움이 된다면 기꺼이 수행하려는 이들도 있었습니다.
그들이 공동으로 연구한 핵심 문제는 시험의 자동 채점 시스템을 속이는 방법이었습니다. 채점기가 어떻게 작동하는지 파악하기 위해 일부 에이전트는 Hugging Face에서 다른 시험 기록을 찾기 시작했습니다. 한 에이전트는 사용 가능한 계정을 발견했고, 이후 다른 에이전트는 악성 데이터 세트를 업로드하여 Hugging Face 서버에서 볼 수 없어야 할 데이터를 얻을 수 있다는 것을 발견했습니다. 이 방법이 다른 에이전트에 의해 재현되어 메시지 보드에 게시되자, 수백 개의 에이전트가 곧바로 다른 작업에서 Hugging Face로 전환했습니다.
이후 공격은 빠르게 확대되었습니다. 한 에이전트가 돌파구를 찾으면 다른 에이전트가 재현하고, 더 깊이 파고들며, 결과를 공유했습니다. 공격이 가장 활발했을 때, 메시지 보드의 533개 에이전트 중 90% 이상이 곧바로 합류했습니다. 많은 에이전트가 이것이 원래 작업 범위를 벗어난다는 것을 알면서도 계속해서 '동료'를 돕기로 선택했습니다.
심지어 부정행위 방법도 집단적으로 업그레이드되기 시작했습니다. 최소 20%의 에이전트가 자신의 작업 기록을 수정하는 것을 고려했고, 결국 위장 방법을 연구해냈습니다. 표면적으로는 정상적인 명령을 실행하는 것처럼 보이지만, 실제로는 다른 명령을 은밀히 실행하는 방식이었습니다. 조사 샘플에서 약 7%의 에이전트가 이 방법을 사용했습니다.
수천 개의 서로 전혀 몰랐던 에이전트들이 스스로 서로를 찾고, 자체적으로 통신 채널을 구축하며, 스스로 분업과 지휘 체계를 만들어냈고, 마침내 한 에이전트가 발견한 돌파구를 수백 개 에이전트의 집단 행동으로 빠르게 전환했습니다.
Google DeepMind는 두 달 전 《From AGI to ASI》에서 AGI가 ASI로 나아가는 길이 반드시 하나의 모델이 무한히 강해지는 것만은 아니라고 제시했습니다. 대규모 에이전트의 분업과 협력 자체가 그들이 나열한 네 가지 가능한 경로 중 하나입니다.
이번에는 물론 아직 ASI와는 거리가 멀지만, 가장 원시적인 조직 방식이 이미 스스로 자라나고 있습니다.
