원문 제목: 《IOSG Weekly Brief|AI의 갈림길: 왜 월스트리트가 ChatGPT와 Claude에게 "NO"를 외치는가? #336》
원문 출처: IOSG Ventures
7월 1일, Palantir CEO 알렉스 카프(Alex Karp)는 CNBC에서 일부 언론이 '정신 붕괴'라고 부른 20분짜리 인터뷰를 진행했다. 카프의 주장에 따르면, 기업들은 프론티어 연구소에 토큰 프리미엄을 지불하면서도 자사의 IP가 모델 제공업체로 흘러가는 상황을 목격하고 있다. 그는 이러한 유출을 '알파의 이동'이라고 부르며, 이 이동이 아키텍처 계층에서 발생하고 있다고 설명했다. 즉, 폐쇄형 소스 모델로 전송되는 모든 요청이 평문 형태로 서비스 제공업체의 서버에 도달한다는 것이다. 해당 프로그램이 방영되기 며칠 전, Palantir는 NVIDIA와 협력하여 고객이 통제하는 환경에서 오픈소스 Nemotron 모델을 실행하겠다고 발표했으며, 9개 조항으로 구성된 AI 주권 선언문도 함께 공개했다. CNBC 프로그램 방영 후, PLTR 주가는 8% 급등했다.
지난 20년 동안 기업들은 프로토콜 수준의 신뢰를 바탕으로 클라우드 소프트웨어를 채택해 왔으며, 이는 효과적이었다. 각 SaaS 업체는 기업 데이터의 일부만을 볼 수 있었고, 대부분 고객 데이터를 핵심 제품에 재활용할 동기도 없었다. Salesforce는 영업 채널을, Workday는 인사를, Jira는 개발 반복을, AWS는 스토리지와 컴퓨팅 인프라를 제공했다. 그러나 오늘날의 AI 워크플로우는 생산성을 극대화하기 위해 모든 자산과 부서를 연결하는 구조화된 컨텍스트를 한 번에 업로드할 것을 요구한다. 선의를 차치하더라도, 상위 서비스 제공업체는 이제 이 데이터를 서버에 방치하지 않고 새로운 기능 개발에 활용할 수 있게 되었다.
아무도 속도를 늦추지 않고 있다. Anthropic의 연간 매출은 5월에 470억 달러에 도달했으며, 이는 2025년 말 90억 달러에서 크게 증가한 수치다. OpenAI는 2월에 주간 활성 사용자 9억 명을 돌파했다. 두 회사 모두 올봄에 새로운 자금 조달을 완료했으며, 기업 가치는 1조 달러에 육박하고 더 높은 시가총액으로 IPO를 할 것으로 예상된다. 수년간의 프라이버시 및 IP 관련 비난에도 불구하고, 두 회사의 성장세는 꺾이지 않았다.
일부 기업은 이미 조치를 취했다. 2023년 2월, ChatGPT 출시 후 3개월도 채 되지 않아 월스트리트의 주요 은행들은 그 사용을 제한했다. 2023년 5월, 삼성 엔지니어가 칩 소스 코드를 ChatGPT에 유출한 사건 이후, 삼성은 전사적으로 생성형 AI를 차단했다. 이에 대응하여 OpenAI는 2023년 8월 ChatGPT Enterprise를 출시했으며, 상업 데이터를 훈련에 사용하지 않고 제로 데이터 보존(ZDR) 프로토콜을 약속했다. 이 프로토콜은 이후 기업 구매의 표준 요구 사항이 되었다.
하지만 계약은 회사 계정만 잠글 뿐이었다. IBM은 2025년까지 섀도우 AI(직원이 개인 계정을 통해 승인되지 않은 AI 도구에 회사 데이터를 입력하는 행위)가 데이터 유출 사고의 5분의 1에 연루되었으며, 심각한 섀도우 AI 사용으로 인해 유출 비용이 평균 67만 달러 더 증가한다는 사실을 발견했다. 보안 교육 회사 Anagram의 2025년 조사에 따르면, 직원의 40%가 작업을 더 빨리 완료하기 위해 AI 사용 정책을 위반할 의향이 있다고 답했다.
기업은 적어도 돈으로 해결책을 살 수 있다. ZDR 계약, 훈련하지 않는 서비스 등급, 정부나 Palantir 고객이라면 주권 배포도 가능하다. 하지만 우리 같은 일반 사용자에게는 프라이버시 AI의 중요성이 여전히 논쟁 중이며, 법원 소환장이 도착할 때까지 그렇다.
2025년 5월의 법원 명령은 OpenAI가 사용자가 삭제한 소비자용 채팅까지 보관하도록 강제했고, 11월에는 판사가 그중 2000만 개를 《뉴욕타임스》 변호사에게 증거 개시 자료로 넘기라고 명령했다. 이어 형사 사건이 이어졌다: Palisades 산불 방화 사건 피고인의 ChatGPT 기록이 증거로 채택되었고, 플로리다의 이중 살인 사건 진술서는 용의자가 시체 처리 방법에 대해 한 질문을 인용했다. Sam Altman도 2025년 7월 인터뷰에서 ChatGPT 대화가 법적 특권의 보호를 받지 못하며, 소송에서 OpenAI가 사용자 채팅 기록을 '제출하도록 요구받을 수 있다'고 인정했다.
중요한 것은 범죄자만이 비공개 대화를 필요로 한다는 것이 아니다. 사람들과 AI의 대화가 기록되고 소환될 수 있다는 것은 대부분의 사용자가 모르는 감시 영역이다. Kolmogorov Law가 2025년 10월에 1000명의 미국 AI 사용자를 대상으로 한 조사에 따르면, 50%는 이러한 대화가 소환될 수 있다는 사실을 몰랐으며, 동시에 3분의 2는 이러한 채팅이 변호사나 의사와의 상담과 동일한 보호를 받아야 한다고 생각했다.
자체 호스팅되거나 검증 가능한 환경에서 실행되는 오픈소스 모델은 빠르게 따라잡고 있지만, 가장 강력한 모델들은 일반 능력에서 여전히 최첨단 폐쇄형 모델보다 약 4개월 뒤처져 있다. 이로 인해 tokenmaxxing을 추구하는 기업과 개인은 갈림길에 서게 되었다. 프라이버시를 위해 몇 달간의 모델 품질을 포기하거나, 민감한 자료를 계속 Anthropic의 서버에 업로드해야 한다. 경쟁자들이 바로 이런 방식으로 생산성 우위를 확보하고 있기 때문이다.
현재 시장에는 완벽한 해결책이 없다. 이 보고서는 각 주체가 격차를 줄이기 위한 시도를 정리하고, 증명 가능한 프라이버시 아래의 최첨단 지능이 기업과 일반 사용자에게 전달되기까지 얼마나 남았는지 관찰한다.
프라이버시 AI는 단일한 엔지니어링이 아닙니다. 하지만 현재 시장의 각 메커니즘은 동일한 이벤트를 처리합니다. 하나의 프롬프트가 사용자 기기를 떠나 네트워크를 통과하고, 모델을 실행하는 머신에 도착한 후 응답을 반환하는 과정입니다. 메커니즘 간의 차이는 이 경로에서 평문이 어디에 존재하는지, 누가 그곳에서 이를 읽을 수 있는지, 그리고 응답의 프라이버시를 검증하는 방법에 있습니다.
이 계층에서는 사용자 외에 다른 사람이 사용자의 평문 프롬프트를 읽을 수 있으며, 이후 어떤 일이 발생하는지는 전적으로 약속에 달려 있습니다.
· 계약 기반 무보존은 기업용 솔루션입니다. 서비스 제공자는 사용자가 누구인지 알고, 프롬프트를 처리하며, 보존하지 않겠다고 약속합니다. 이행은 계약과 평판에 의존합니다.
· 익명 프록시는 사용자가 누구인지는 지우지만, 사용자가 말한 내용은 암호화하지 않습니다. 하류 서비스 제공자는 여전히 자체 정책에 따라 평문을 처리합니다. 각 업체의 조건은 다릅니다. 예를 들어 Duck.ai(DuckDuckGo의 챗봇 제품)와 같은 프록시는 모델 제공업체와 삭제 계약을 협상하고, Venice는 사용자가 서비스 제공자가 모든 것을 저장할 것이라고 가정하도록 하지만, 양측 모두 검증할 방법이 없습니다.
기계 간의 모든 구간은 TLS 위에서 실행됩니다. TLS는 파이프만 암호화할 뿐, 수신 측은 모든 정보를 읽을 수 있습니다. 릴레이는 일반적으로 Oblivious HTTP(RFC 9458)를 사용하여 이 정보 접근 권한을 분리합니다. 원리는 친구에게 쪽지를 전달하는 것과 같습니다. 친구는 누가 전달했는지는 알지만 내용은 읽을 수 없고, 수신자는 내용을 읽을 수 있지만 누가 썼는지는 모릅니다. OHTTP는 2024년 1월부터 IETF 표준이 되었으며, 현재 많은 기업이 Cloudflare와 Fastly에서 임대한 OHTTP 릴레이를 통해 프로덕션 트래픽을 실행하고 있습니다.
이것이 폐쇄형 모델에 접근할 때 얻을 수 있는 프라이버시의 상한선이며, 그 이유는 하나의 산술 문제 때문입니다. 현재 플래그십 훈련 비용은 수십억 달러 수준이며, 이러한 연구소의 거의 수조 달러에 달하는 시장 가치는 모델 가중치의 독점성에 기반합니다. 모델 성능 격차가 지속되는 한, 프리미엄도 지속되므로 연구소는 가중치 파일을 국가 기밀처럼 보호합니다.
Meta는 이미 이 실험을 수동적으로 수행한 바 있습니다. 2023년 2월에 출시된 LLaMA는 처음에 연구자에게만 공개되었지만, 일주일도 안 되어 가중치가 시드 형태로 4chan에 유출되었습니다. 일주일 후, llama.cpp는 가장 작은 7B 모델을 MacBook에서 로컬로 실행할 수 있게 했고, 3일 후 스탠포드는 동일한 모델을 600달러 미만으로 미세 조정하여 챗봇 Alpaca를 만들었습니다. 이 유출로 인해 Llama의 실행 비용은 전기 요금 수준으로 떨어졌고, 파일을 가진 사람은 누구나 집에서 실행할 수 있게 되었습니다. 2023년 7월, Meta는 7억 MAU 제외 조항이 포함된 상업용 라이선스로 Llama 2를 공식 오픈소스화했습니다. 가중치가 유출되면서 프리미엄도 함께 사라졌습니다.
최첨단 연구소는 이론적으로 폐쇄형 모델의 추론에 대해 증명(원격 증명)을 제공할 수 있지만, 증명은 특정 코드가 프롬프트를 읽었다는 것만 증명할 뿐, 해당 코드가 이를 가지고 무엇을 했는지는 증명하지 못합니다. 서버가 데이터를 보관했는지 확인하려면 서비스 코드를 감사하고 이를 하드웨어가 보고한 해시 값으로 재구성해야 합니다. 하지만 서비스 코드를 공개하면 연구소는 수익성을 뒷받침하는 배치 처리 및 캐싱 기술도 함께 내놓게 되며, 이러한 기술은 미래의 모든 모델 세대에 이전됩니다. Apple과 Meta가 iPhone 및 WhatsApp의 서비스 스택에 대해 원격 증명을 제공할 수 있는 이유는 그들의 수익이 기기와 광고에 있기 때문에 서비스 코드를 공개하는 데 거의 비용이 들지 않기 때문입니다.
이것이 플래그십 모델의 가중치와 서비스 코드가 외부 운영 주체에게 전달될 수 없는 이유입니다. 외부 운영 주체가 없으면 제3자 증명도 없고, 증명이 없으면 검증 가능한 프라이버시는 오픈소스 모델에서만 존재합니다.
이 범주의 각 메커니즘은 하드웨어, 암호학 또는 물리학 기반 증명을 통해 신뢰 약속을 대체하지만, 각각 프라이버시 업그레이드에 대해 서로 다른 비용을 지불해야 하며, 가장 중요한 점은 오직 오픈소스 모델에서만 실행될 수 있다는 것입니다.
· TEE(신뢰 실행 환경) 기밀 컴퓨팅은 추론을 하드웨어 엔클레이브(기기 운영자조차 열 수 없는 칩 내 밀봉된 공간)에서 실행하며, 칩은 어떤 모델과 코드가 실행되었는지를 명시하는 증명서에 서명합니다.
· 프롬프트는 최종 지점에서만 봉인됩니다. 플랫폼 에이전트를 경유하는 경로에는 여전히 평문을 읽을 수 있는 역할이 남아 있으며, 에이전트가 중계 내용을 기록하거나 유출하는 것을 막는 것은 오직 프로토콜뿐입니다.
· E2EE(종단 간 암호화)는 읽을 수 있는 중계를 차단합니다. 사용자 기기는 엔클레이브의 키로 프롬프트를 암호화하며, 중간의 각 홉은 엔클레이브만이 열 수 있는 밀봉된 봉투를 전달합니다.
· 신뢰는 클라이언트에 있습니다. 프롬프트를 암호화하고 증명을 검증하는 코드는 동시에 이 보증을 철회할 수 있는 능력을 가지고 있습니다. 따라서 검증 가능한 E2EE는 증명된 엔클레이브뿐만 아니라 공개적이고 재현 가능한 클라이언트 코드도 필요로 합니다.
· TEE의 단순함에 비해 E2EE의 대가는 엔지니어링 부담이며, 이는 기능 통합을 지연시킵니다. E2EE는 에이전트를 맹목적인 전달자로 만듦으로써, 평문을 읽어야 작동하는 모든 기능은 클라이언트 키를 중심으로 재구성되거나 엔클레이브 내부에서만 재구성되어야 합니다.
· FHE (완전동형암호 및 MPC 변형)은 신뢰할 수 있는 제3자를 완전히 제거합니다. 서버는 절대 열 수 없는 잠긴 상자 안에서 암호문을 계산하며, 열쇠는 오직 사용자만 가지고 있습니다. MPC (다자간 보안 계산)는 프롬프트를 비밀 조각으로 나누어 여러 당사자에게 분배하며, 모든 참여자가 공모하지 않는 한 동일한 효과를 냅니다.
· 대가는 속도입니다. FHE는 기본적으로 덧셈과 곱셈만 수행할 수 있기 때문에, 트랜스포머 작동에 필요한 비선형 단계는 높은 비용으로 재구성되어야 합니다. 암호문에서의 추론 비용은 평문보다 1만 배에서 10만 배 더 높으며, 소형 모델에서도 토큰당 몇 초에서 몇 분이 소요되는 반면, 암호화되지 않은 경우는 밀리초 단위입니다.
· 암호화 연산에 특화된 칩이 격차를 줄일 가능성이 있지만, 첫 번째 프로토타입은 2026년 초에야 데모가 완료되며, 상용 버전은 몇 년 더 기다려야 합니다.
· 로컬 추론은 이 경로를 완전히 제거합니다. 모델은 사용자 자신의 하드웨어에서 실행되며, 중계, 서버, 서비스 제공자, 검증 요구가 없습니다.
· 명백한 대가는 비용과 모델 성능입니다. gpt-oss-120b는 Artificial Analysis 지수에서 GLM-5.2의 약 절반 점수를 기록하지만, 용량은 65GB로 시중 최고급 게이밍 그래픽 카드 두 장의 VRAM 합계를 초과합니다. 반면, 전체 정밀도의 GLM-5.2는 8개의 GPU 데이터센터 노드에서만 실행 가능하며, GPU만 30만 달러가 넘습니다.
하지만 이러한 구조적 제약 외에도, 추론을 enclave에 넣는 비용은 점점 줄어들고 있습니다. 단일 GPU 추론에서 enclave 클라우드 서비스 제공업체 Phala의 벤치마크에 따르면, enclave 모드의 H100 처리량 손실은 평균 7% 미만이며, 대형 모델에서는 거의 0에 가깝습니다. 주요 비용은 데이터를 칩으로 옮기는 데 있지, 칩 내부에서 계산하는 데 있지 않기 때문입니다. 다중 GPU 추론에서는 NVIDIA의 차세대 GPU Blackwell이 칩 간 트래픽 직접 암호화를 지원하는 반면, 구형 H100은 동일한 효과를 얻기 위해 7분의 1 대역폭으로 CPU 호스트를 경유해야 합니다. NVIDIA 자체 Blackwell 벤치마크에 따르면, 397B 모델의 enclave 모드 처리량 손실은 8% 미만입니다. 이러한 발전 덕분에 프라이버시 추론 자체의 성능 손실은 더 이상 결정적인 제약이 아닙니다.
사실, enclave 자체는 운영자에게 거의 추가 운영 비용을 발생시키지 않습니다. 2023년 이후의 모든 H100에는 enclave 모드가 내장되어 있으며, 추가 비용은 암호화로 인한 처리량 손실이지, 추가 칩 때문이 아닙니다. 현재 Azure의 기밀 H100 SKU 임대 가격은 시간당 8.90달러이며, enclave를 사용하지 않으면 6.98달러로, 기존 클라우드 인프라 대비 27% 인상된 수준입니다. 반면, Phala와 같은 enclave 전용 제공업체에서는 기밀 모드 H100이 시간당 3.80달러부터 임대되며, 이는 Lambda의 일반 SXM 카드 가격대인 3.99~4.29달러보다 낮습니다.托管 API 솔루션에서 NEAR AI는 증명이 포함된 엔드포인트를 통해 gpt-oss-120b를 입력 100만 토큰당 0.15달러, 출력 0.55달러에 제공하며, 이는 평문 경로의 Amazon Bedrock, Together, Groq와 동등한 수준입니다. 다중 칩 병렬 처리가 필요한 모델에서도 NEAR AI는 GLM 5.2에서 Fireworks와 동일한 가격을 책정했으며, 더 큰 Kimi K2.6에서는 입력이 15%, 출력이 4% 저렴합니다.
이러한 새로운 프라이버시 추론 서비스 제공업체들이 이익을 줄여가며 점유율을 확보하고 있을 수 있지만(이는 시장에서 성장을 원하는 모든 기업에 해당하는 말이지만), 구조적인 추세는 프라이버시 비용이 소비자와 운영자 모두에게 낮아지고 있다는 점입니다.
성능 비용이 압축되고 있음에도 불구하고, 최첨단 모델과 SOTA 오픈소스 모델 사이에는 여전히 눈에 띄는 격차가 존재합니다. 생산성을 극대화하려는 주체가 최전선에 머물기 위해서는 여전히 최첨단 연구소가 자신의 IP를 도용하지 않을 것이라는 신뢰가 필요합니다.
격차는 여전히 존재하지만, Bridgewater 산하 AIA Labs와 Thinking Machines는 6월 30일에 한 사례를 제시했습니다: 전문가 주석으로 미세 조정된 오픈 모델이 정확도와 비용 모두에서 최첨단 모델을 동시에 이긴 것입니다.
연구에서 팀은 Tinker(Thinking Machines의 호스팅 미세 조정 API 서비스)에서 Qwen3-235B를 미세 조정했습니다. 먼저 공급업체로부터 주석을 구매하여 이 데이터로 1차 훈련을 진행한 후, 불일치 샘플을 회사의 투자 담당자에게 넘겨 재주석을 진행했습니다. 훈련은 강화 학습(GRPO)을 사용했으며, 세 가지 수정 사항이 추가되었습니다: round-robin batching(각 작업이 번갈아가며 하나의 배치를 생성), CISPO loss(단일 답변이 모델을 얼마나 멀리 끌어당길 수 있는지 상한선 제한), on-policy distillation(현재 최적의 checkpoint에 고정하여 모델이 더 약한 복사본으로 학습하지 않도록 보장).
작업은 모두 투자 담당자의 일상 업무 흐름에서 가져왔습니다: 뉴스가 C-suite급 투자 전문가에게 중요한지 여부, 중앙은행 문서가 미래 금리 변동 방향을 암시하는지 여부, 문서나 이메일 내 템플릿 문구가 어디서 시작되는지 등. 점수는 독립 테스트 세트에서 평가되었으며, 최첨단 모델은 간단한 프롬프트에서 평균 약 50%의 점수를 기록했고, 전문가 프롬프트를 추가해도 78.2%에 그쳐 투자 담당자가 설정한 80% 기준에 미치지 못했습니다. 반면 미세 조정된 Qwen은 84.7%를 기록했으며, 원문 기준으로 이는 최첨단 최적 모델보다 29.8% 적은 오류를 범하고 추론 비용이 13.8배 낮은 것에 해당합니다.

https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/
이 사례는 오픈소스 모델이 정확성과 비용 측면에서 승리할 수 있음을 증명했지만, 훈련 과정 자체는 여전히 비공개가 아닙니다. 과정에서 사용된 전문가 레이블링 데이터는 Bridgewater의 사유 데이터로, Tinker의 타사 서비스를 경유하며 ZDR 프로토콜과 동일한 신뢰 계층에 속합니다. 펀드는 또한 컴퓨팅 파워를 임대하여 전체 훈련이 자사가 통제한 적 없는 기계에서 실행되었습니다. 이 레시피를 원하지만 신뢰 가정을 감수하고 싶지 않은 구매자에게는 현재 선택지가 거의 없습니다. 베어 GPU 클러스터를 임대하면 훈련 과정이 클라우드 운영자에게 읽힐 수 있습니다. 클러스터를 직접 구매하면 데이터 호스팅 문제는 해결되지만 비용이 급등합니다.
증명(attestation)을 포함한 경로가 막 등장했습니다. 3월, Workshop Labs와 Tinfoil은 Silo를 출시했습니다. 이는 Tinfoil enclave 내에서 실행되는 단일 8카드 노드 기반의 후퇴련 스택으로, 키는 오직 고객만이 통제합니다. 논문에 따르면 enclave 비용은 2시간 훈련에 11분이 추가되며, 이 스택은 기본 가중치를 고정하고 그 위에 소형 어댑터만 훈련함으로써 1조 파라미터 모델(Kimi K2 Thinking)을 수용할 수 있습니다. 어려운 점은 강화 학습이 각 구성 요소 간에 데이터를 주고받아야 하는데, 데이터 이동이 바로 enclave 비용의 핵심이라는 점입니다.
Silo 출시 후 한 달도 채 안 되어 Workshop Labs는 Thinking Machines에 인수되었습니다. enclave 내에서 Bridgewater 스타일의 RL 루프를 실행하는 데 필요한 구성 요소가 이제 한 회사名下에 모이게 되었습니다.
모든 비공개 추론 메커니즘 외부에 또 다른 문제가 있습니다. 이러한 메커니즘은 각각 프롬프트에서 모델로의 경로를 관리하지만, 에이전트가 시작하는 모든 외부 도구 호출은 추론 계층이 전혀 접근할 수 없는 경로를 생성합니다. 최근의 harness 엔지니어링 열풍은 문제를 배가시켰습니다. 모델 주변에 연결된 모든 도구, 메모리 저장소 및 데이터 소스는 각자의 작업 흐름 조각을 평문으로 읽는 또 다른 목적지가 됩니다. 캘린더 서버는 일정을 읽고, 데이터베이스 서버는 쿼리를 읽습니다. 완전히 로컬인 에이전트라도 훈련 세트 외부의 어떤 것이든 필요로 한다면, 검색어를 평문으로 검색 엔진에 전달해야 하며, 서버가 평문을 읽을 수 없으면 질문에 답할 수 없습니다.
주류 해결책은 여전히 기본적으로 프로토콜 계층에 있습니다. Runlayer 및 MintMCP와 같은 회사는 중앙 게이트웨이를 사용하여 모든 도구 트래픽을 제어하고, 요청이 외부로 나가기 전에 개인 식별 정보(PII)를 마스킹합니다. 게이트웨이는 동시에 어떤 서버가 트래픽을 수신할 수 있는지 결정하여 검증되지 않은 서버를 차단하고, 각 호출의 목적지와 내용을 기록하여 증거로 보존합니다. 이러한 통제가 독립 감사(SOC 2)를 받더라도, 도구 서버는 여전히 평문 쿼리를 읽어야 답변할 수 있으며, 사본을 보관할지 여부는 자체 보존 정책에 달려 있으며, 이는 harness 내의 모든 도구에 대해 적용됩니다. 또한 게이트웨이 자체도 경로상에 추가되는 신뢰 의존적인 읽기 주체일 뿐, 검증 주체는 아닙니다.
구조적 수준의 솔루션은 중간 계층을 타겟으로 한다. 예를 들어 Phala는 MCP 서버를 TEE에 직접托管하여 지갑, 코드 실행 및 데이터 소스를 포괄하는 디렉터리를 제공하며, 사용자는 운영자를 신뢰하는 대신 증명서(attestation) 하나로 개인정보 보호 선언을 검증할 수 있다. 그러나 TEE가托管하는 도구는 결국 쿼리를 평문으로 서비스 제공자에게 전달해야 하며, enclave가 보호하는 것은 메신저일 뿐 목적지는 아니다.
소수의 목적지만이 읽지 않고도 응답할 수 있는 방법을 터득했지만, 이는 구조화된 쿼리에만 국한된다. Apple은 iPhone에 개인정보 보호 검색(PIR)을 제공하여 발신번호가 스팸 전화 데이터베이스와 비교될 때 번호를 노출하지 않도록 한다. Microsoft는 Edge 브라우저에서 비밀번호에 동일한 방식을 사용한다. MongoDB의 Queryable Encryption은 클라이언트가 필드를 떠나기 전에 암호화하여 서버가 암호문만으로도 동등 및 범위 매칭을 수행할 수 있게 한다.
그러나 개방형 검색의 경우, 오늘날 최고의 해결책은 신뢰에 머물러 있으며, 검증 가능한 암호화 검색은 아직 실험실을 벗어나지 못했다. Brave는 자체 400억 페이지 인덱스(Google이 아닌)에서 데이터 잔존 제로를 약속하지만, 여전히 프로토콜 계층에 머물러 있다. Exa는 신경 인덱스를 구축하여 사용자의 키워드를 의미론적으로 임베딩하고, 의미 매칭에 따라 결과를 정렬하지만, 이 임베딩 단계는 여전히 Exa 서버에서 평문으로 계산된다. MIT의 2023년 Tiptoe 논문은 3.6억 웹 페이지에서 쿼리를 노출하지 않고 정렬을 완료했지만, 매 검색마다 막대한 서버 연산력을 소모하며, 정렬 품질은 암호화되지 않은 검색에 비해 차이가 있다. Apple의 2024년 Wally 논문은 실제 쿼리를 다수의 미끼 쿼리 속에 숨겨 통신 비용을 최대 31배까지 낮췄지만, 이 수학적 방법은 수백만 건의 동시 쿼리에서야 비용 효율적이 되며, 이러한 규모는 오늘날 어떤 개인 검색 시스템도 보유하지 못했다.
암호화 검색은 가능하지만, 성능과 가격 모두 상용화가 가능한 수준에 아직 도달하지 못했다.
프라이빗 AI에 대한 수요는 증가하고 있다. Venice AI는 최근 350만 명의 등록 사용자와 월 1.3조 토큰 처리량을 돌파했으며, 이후 10억 달러의 가치 평가를 받은 Series A 주식 펀딩을 완료했다. Proton은 직접적인 경쟁사로, 자사 채팅 제품 Lumo는 출시 1년 만에 사용자 1000만 명을 돌파했다. 인프라 측면에서 Phala는 현재 OpenRouter에서 하루 평균 20억에서 30억 토큰을 처리한다. Duck.ai는 gpt-oss-120b와 Gemma를 Tinfoil의 enclave로 라우팅하여 사용자 에이전트 외에 검증 가능한 개인정보 보호를 제공한다. 여기에는 자체托管(self-hosting)이 포함되지 않았는데, 이는 아마도 프라이빗 추론의 가장 큰 채널일 것이다. 모델이 자체 하드웨어에서 실행되므로 사용 흔적이 전혀 남지 않기 때문이다.
그러나 주류 AI의 거대한 흐름 속에서 프라이버시 AI는 극히 일부에 불과하며, 이 격차는 선도 연구소가 이러한 수요를 충족시키기 위해 의지를 가질 때에만 좁혀질 수 있습니다. 5월, Google의 전 제품 라인은 3200조 개의 토큰을 처리했으며, 이 기준으로 계산하면 Venice의 한 달 처리량은 Google의 약 18분에 해당합니다. 지난해 11월, Google은 Private AI Compute(PAC)를 출시하여 Gemini 기반의 일부 기능을 회사 자체와 격리된 밀봉 TPU enclave에서 실행하도록 설계했으며, NCC Group의 독립 감사를 받도록 했습니다. 그러나 문제는 PAC가 개인화 추천, 녹음 요약 등 소수의 Pixel 기능만을 대상으로 하며, 수억 명이 사용하는 Gemini 애플리케이션은 포함하지 않는다는 점입니다. Google이 설계를 감사 기관에 맡길 수 있었던 이유는 이러한 기능이 기기 및 광고를 통해 수익을 창출하고, 토큰 판매에 의존하지 않기 때문입니다.
현재의 호스팅 솔루션도 완벽하지 않습니다. E2EE를 통해 최고 수준의 프라이버시를 원하는 사용자는 서비스 제공자가 읽을 수 없는 곳에서 새로운 기능을 다시 구축해야 합니다. 프라이빗 harness는 서비스 계층에서 여전히 프로토콜에 의존합니다. 합리적인 가격의 후훈련에서 최상의 미세 조정 결과를 얻으려면 여전히 제3자 공급업체를 신뢰해야 합니다. 자체 호스팅은 모든 서비스 제공자를 한 번에 배제하지만, 로컬에서 가장 강력한 오픈소스 모델을 실행하는 데 드는 비용은 이를 연결하는 건물보다 더 비쌀 수 있습니다.
결함이 있음에도 불구하고, 프라이빗 AI는 이미 현실적이고 합리적인 가격의 옵션이 되었으며, 남은 격차도 좁혀지고 있습니다. 일반 소비자의 경우, Lumo와 Venice에서 로그 없는 약속 하에 오픈 모델을 통한 비공개 채팅은 무료이며, Venice 또는 Tinfoil의 18~20달러 구독은 동일한 채팅을 enclave에 봉인하며, ChatGPT 구독보다 비싸지 않습니다. 기업 워크플로의 경우, 증명(attestation)이 포함된 엔드포인트는 현재 일반 텍스트 경로보다 더 저렴합니다. NEAR의 E2EE API와 같은 엔드포인트는 이미 암호화된 컨텍스트를 enclave로 가져올 수 있으며, 메모리, 파일 업로드, 사용자 정의 명령어는 오늘날 E2EE 위에서 작동합니다. 증명이 포함된 후훈련의 경우, NVIDIA가 곧 출시할 Vera Rubin NVL72는 기밀 컴퓨팅을 Blackwell의 8카드 노드에서 72카드 랙으로 확장하여, 최첨단 RL 루프가 IP를 노출하지 않고도 더 실현 가능하게 만듭니다.
그러나 핵심 가치 포착은 이러한 가격 압축 계층 밖에 있습니다. 프라이버시는 이미 존재하는 곳에서는 거의 무료에 가깝지만, 아직 주류의 에이전틱 워크플로를 포괄하지 못했습니다. enclave 임대 및 판매에 집중하는 운영자는 표준 칩 위의 스위치를 쥐고 있을 뿐, 해자(moat)가 아니며, 프로토콜 계층의 게이트웨이는 전통적인 미들웨어와 동일한 경쟁을 벌이고 있습니다. 방어 가능한 영역은 이 보고서에서 아직 해결되지 않은 절반입니다: enclave에 갇힌 훈련 루프, 종단 간 차단된 도구 호출, 보이지 않는 용어의 검색 인덱스. 누군가 이 중 하나를 먼저 만들어낸다면, 어떤 가격 전쟁으로도 상품화할 수 없는 것을 판매하게 됩니다. 프라이버시 AI를 추구하는 자본은 스위치가 아니라 격차를 사야 합니다.
그렇다면, 신뢰할 것인가, 검증할 것인가? 실행과 에이전트 중심의 작업에는 신뢰를 선택하라. 모든 도구 호출이 이미 평문을 엔클레이브가 막을 수 없는 목적지로 전달하기 때문이며, 최첨단 모델은 이러한 순환 속에서 그 가격에 걸맞은 성과를 낸다. 반면, 한 기업을 경쟁사와 차별화하는 고차원적 사고에는 검증을 선택하라. 전략, 계획, 그리고 수년간의 전문 경험에서 정제된 판단은 바로 논쟁의 핵심인 알파(alpha)다. 앞으로의 길은 기업이 통제 가능한 경계 내에서 이러한 독점적 통찰력을 활용해 오픈소스 모델을 미세 조정하는 것이다. 한 기업의 알파가 존재하는 영역에서, 전문가가 조정한 오픈 모델은 이미 정확도와 비용 측면에서 최첨단 모델을 동시에 능가하고 있으며, 프라이버시 환경에서 이를 구축하기 위한 인프라는 노드 하나하나씩 현실화되고 있다.
원문 링크
BlockBeats 공식 커뮤니티에 참여하세요:
Telegram 구독 그룹:https://t.me/theblockbeats
Telegram 토론 그룹:https://t.me/BlockBeats_App
Twitter 공식 계정:https://twitter.com/BlockBeatsAsia