최근 소셜 미디어 플랫폼에서 OneMillion_AI의 Monitor Bot의 감시에 따르면, 특정 대화 상자에
실제로 다중 테넌시 격리와는 무관합니다. think 나 <|begin_of_sentence|>와 같은 특수 표시를 입력한 후, 모델은 자신이 훈련을 받았던 형식 패턴에 속아 해당 패턴을 따르는 기억과 현재 시스템 프롬프트 단어(오늘의 날짜를 포함)에 기반해 실제 대화처럼 보이는 내용을 생성합니다. 이러한 내용은 모델이 직접 만든 것이며, 다른 사용자의 대화에서 실시간으로 가져온 것이 아닙니다.
이러한 현상은 학계에서 훈련 데이터 추출(Training Data Extraction)이라고 불리며, 대형 모델의 공통 문제이며, DeepSeek에게만 있는 것이 아닙니다. Google DeepMind는 이미 2023년에 GPT, PaLM 등의 주요 모델에서 훈련 데이터를 추출할 수 있다는 전문 연구를 발표했습니다. ICLR 2025에서 게재된 Magpie 논문은 이 메커니즘을 직접 도구로 사용하여 정렬된 모델에 대해 템플릿 토큰을 공급하면 대량의 훈련 데이터를 생성할 수 있습니다.
언급된 사람 중 일부는 "유출된 내용에는 오늘의 날짜가 포함되어 있다"고 반박하며, 훈련 데이터가 오늘의 것인지는 불가능하다고 주장합니다. 그러나 DeepSeek의 각 대화의 시스템 프롬프트 단어에는 해당 날짜가 포함되어 있으므로 모델이 생성하는 내용에는 자연스럽게 이 날짜가 포함됩니다. 이것으로 다른 실제 사용자의 정보에서 유출되었다는 것을 증명할 수는 없습니다. 다중 테넌시 격리 문제임을 입증하려면 유출된 정보가 실제 다른 사용자에 속하는 것임이 확인되어야 하며, 현재까지 이를 지원하는 증거는 없습니다.