동찰 Beating AI 속보, 보안 회사 Hacktron의 화이트햇 연구원 3명이 Claude를 이용해 72시간도 안 되어 OpenAI 내부 코드 저장소까지 침투했다. 세 사람은 이후 자발적으로 취약점을 신고했고, OpenAI는 수정 후 취약점 바운티 프로그램에 따라 이들에게 6,500달러를 지급했다.
공격 진입점은 단지 OpenAI의 커뮤니티 포럼이었다. 연구원들은 특수 제작된 HEIF 이미지를 업로드하면 포럼 소프트웨어 Discourse의 취약점을 악용해 서버가 그들이 작성한 코드를 실행하게 만들 수 있음을 발견했다. 이후 그들은 포럼 사용자의 로그인 토큰, 즉 '이미 로그인된 통행증'에 해당하는 것을 확보했다.
더 큰 문제는 OpenAI 자체에서 나왔다. 포럼의 로그인 토큰 권한이 너무 광범위하게 열려 있어, 같은 사용자의 ChatGPT와 Codex 계정에도 접근할 수 있었고, 일부 토큰은 OpenAI 직원 소유였다. 연구원들은 그중 한 직원 계정을 통해 Codex에 접근했고, 이 Codex는 회사의 GitHub에 연결되어 있었다. 최종적으로 그들은 Codex가 내부 openai/openai 코드 저장소에 무해한 문서 수정을 한 번 커밋하도록 만들어, 자신들이 내부 저장소에 접근했음을 증명했다. 이후 즉시 테스트를 중단하고 신고했다.
Claude는 가장 어려운 단계, 즉 이미지 취약점을 실제로 실행 가능한 공격 코드로 바꾸는 일을 주로 담당했다. Opus 4.8은 계속 안정적으로 작동하지 않았고, Opus 5가 출시된 후 몇 시간 만에 돌파구를 마련했다. Hacktron은 최초 문제 발견부터 OpenAI 내부 저장소 진입까지 전체 과정이 72시간도 걸리지 않았으며, 실제 투입된 인력 시간은 몇 시간에 불과했다고 밝혔다.