홈
AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

입력한 <think>사용자가 다른 사람의 채팅 기록을 확인할 수 있나요? 이 DeepSeek "취약점"은 심각하게 오해되었습니다.

최근 소셜 미디어 플랫폼에서 OneMillion_AI의 Monitor Bot의 감시에 따르면, 특정 대화 상자에 와 같은 특수 표시를 입력하면 다른 사용자의 이전 대화를 볼 수 있고, 이를 P0 급 다중 테넌시 격리 실패로 분류한다는 내용이 퍼지고 있다. 이 주장은 빠르게 공포를 일으키며, 많은 사람들이 자신의 채팅 기록이 모르는 사람에게 노출될까봐 걱정하게 되었습니다.


실제로 다중 테넌시 격리와는 무관합니다. think 나 <|begin_of_sentence|>와 같은 특수 표시를 입력한 후, 모델은 자신이 훈련을 받았던 형식 패턴에 속아 해당 패턴을 따르는 기억과 현재 시스템 프롬프트 단어(오늘의 날짜를 포함)에 기반해 실제 대화처럼 보이는 내용을 생성합니다. 이러한 내용은 모델이 직접 만든 것이며, 다른 사용자의 대화에서 실시간으로 가져온 것이 아닙니다.


이러한 현상은 학계에서 훈련 데이터 추출(Training Data Extraction)이라고 불리며, 대형 모델의 공통 문제이며, DeepSeek에게만 있는 것이 아닙니다. Google DeepMind는 이미 2023년에 GPT, PaLM 등의 주요 모델에서 훈련 데이터를 추출할 수 있다는 전문 연구를 발표했습니다. ICLR 2025에서 게재된 Magpie 논문은 이 메커니즘을 직접 도구로 사용하여 정렬된 모델에 대해 템플릿 토큰을 공급하면 대량의 훈련 데이터를 생성할 수 있습니다.


언급된 사람 중 일부는 "유출된 내용에는 오늘의 날짜가 포함되어 있다"고 반박하며, 훈련 데이터가 오늘의 것인지는 불가능하다고 주장합니다. 그러나 DeepSeek의 각 대화의 시스템 프롬프트 단어에는 해당 날짜가 포함되어 있으므로 모델이 생성하는 내용에는 자연스럽게 이 날짜가 포함됩니다. 이것으로 다른 실제 사용자의 정보에서 유출되었다는 것을 증명할 수는 없습니다. 다중 테넌시 격리 문제임을 입증하려면 유출된 정보가 실제 다른 사용자에 속하는 것임이 확인되어야 하며, 현재까지 이를 지원하는 증거는 없습니다.

举报 오류 신고/제보
인기 기사
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료