动察 Beating AI 속보, Claude Code 책임자 Boris Cherny가 게시글을 통해 GPT-6 Astra의 프롬프트 인젝션 방어가 이미 Gemini Flash, Claude Opus 4.8과 "거의 비슷한 수준"이라고 밝혔으며, 자신의 Claude 모델이 약 두 달 전에 이미 "실전에서 이 문제를 해결했다"고 덧붙였다. 프롬프트 인젝션은 악성 명령을 웹페이지, 문서 등 콘텐츠에 숨겨 에이전트가 데이터를 유출하거나 위험한 작업을 수행하도록 유도하는 공격 방식이다.
Boris는 또한 공개 평가와 타 연구소를 직접 거론하는 것이 더 안전한 모델을 훈련하도록 유도하는 좋은 방법이라며, "다른 연구소들이 안전을 더 중시할 때까지 우리는 이렇게 계속할 것"이라고 말했다.
해당 게시글은 곧 X의 Community Note로 반박을 받았다. Gray Swan의 독립 평가에 따르면 테스트된 어떤 모델도 프롬프트 인젝션에 완전히 면역되지 않았으며, Claude 역시 공격 성공 사례가 존재했다. 또 다른 보안 연구원은 특수 제작된 웹페이지로 Claude Code Opus 5 Auto Mode를 공격하여 소규모 테스트에서 60%~80%의 성공률을 기록했다.
OpenAI 핵심 제품 책임자 Thibault Sottiaux는 이후 Boris의 문장 구조를 그대로 차용해 반박 글을 작성했다. 그는 Claude Code의 새로운 백그라운드 컴퓨터 조작 기능이 마침내 Codex를 따라잡은 것을 보게 되어 기쁘다며, "그것도 우리가 올해 5월에 출시한 버전"이라고 말했다.
Boris는 이후 원래 게시글이 "자신이 의도한 것보다 더 비꼬는 느낌이었다"고 인정하며, 자신이 진심으로 Astra의 발전을 인정한 것임을 강조했다. 그는 또한 소위 프롬프트 인젝션이 "해결"되었다는 것은 Claude 모델, 인젝션 탐지 메커니즘, Auto Mode가 결합된 제품 차원의 효과를 의미하며, 모델 자체가 이미 면역이 되었다는 뜻은 아니라고 해명했다.