원문 제목: 《IOSG Weekly Brief|추론이 희소 자원이 될 때, 가치는 누가 포착하는가 #329》
원문 저자: Frank Fu, IOSG Ventures
2023년 David Cahn이 제기한 그 구멍은 훈련 측면에서 채워지지 않았습니다. 그것은 추론 측면에서 채워졌고, 시장은 지난 몇 주 동안에야 이를 가격에 반영하기 시작했습니다.
엔비디아가 '서비스 토큰'을 중심으로 재무 보고 기준을 재편하고, Cerebras 상장이 20배 초과 청약을 기록하면서 병목 현상 논쟁은 끝났습니다. 진짜 문제는 다음으로 바뀌었습니다: 추론이 희소 자원이 될 때, 가치는 컴퓨팅 스택의 어느 계층에 축적될까요.
2023년, Sequoia의 David Cahn은 전체 AI 구축 위에 드리운 문제, 즉 '2000억 달러 문제'를 제기했습니다. GPU에 1달러를 쓸 때마다 데이터 센터에서 전력을 공급하는 데 약 1달러를 더 써야 하므로, 매년 GPU CapEx는 이 칩들이 결국 약 2000억 달러의 수익을 창출해야 자본을 회수할 수 있음을 의미합니다.
AI 수익에 대해 매우 관대한 가정을 하더라도, 그는 여전히 '투입'과 '최종 고객이 실제로 지불하는 금액' 사이에 1250억 달러 이상의 구멍이 있음을 발견했습니다. 우려는 명확했습니다: GPU가 실제 수요보다 앞서 과도하게 구축되고 있다는 것입니다.
1년 후, 격차는 좁혀지기는커녕 오히려 확대되었습니다. Cahn은 2024년 후속 글에서 하이퍼스케일러의 CapEx 팽창에 따라 이를 '6000억 달러 문제'로 재정의했습니다. 약세 논리는 익숙한 형태로 수렴되었습니다: 과잉 구축이 공급 과잉을 초래하고, 과잉은 자본을 소멸시킨다는 것입니다.
두 글 모두 사실 같은 질문을 하고 있었습니다: 누가 이 구멍을 메울 것인가? 답은 '훈련' 측면의 장부에는 나타나지 않았습니다. 그것은 inference(추론) 측면에서 나타났고, 시장은 지난 몇 주 동안에야 이를 가격에 반영하기 시작했습니다.
Cerebras는 목요일에 상장했습니다. 이번 IPO는 20배 초과 청약을 기록했으며, 가격은 수요일 최종 인상분의 거의 두 배에 가깝게 책정되었습니다. 수요는 '차세대 엔비디아 킬러'에 대한 베팅이 아니라 더 단순한 이유에서 비롯되었습니다: 시장이 AI의 진정한 병목 현상은 훈련이 아니라 추론이라는 것을 인식하기 시작했다는 점입니다.
Cerebras의 핵심 기술은 추론을 극도로 빠르게 만드는 칩 아키텍처입니다. 훈련이 아니라 추론입니다. 이것이 바로 월스트리트를 흥분시키는 지점입니다. 추론 시장은 지속적인 시장으로, 사용량에 따라 확장됩니다. Claude가 질문에 답변할 때마다, 에이전트가 작업을 수행할 때마다 연산 능력이 소모됩니다. 훈련은 한 번만 발생하지만, 추론은 멈추지 않습니다.
J.P. Morgan은 추론 시장 규모를 훈련 시장의 10배에서 50배로 추정합니다. 기계가 다른 기계가 지시한 작업을 수행하기 시작하는, 즉 에이전틱(agentic) 방식의 확장이 시작되면 추론 수요는 더 이상 사용자 수에 따라 확장되지 않고 연산 능력 자체에 따라 확장됩니다.
Cerebras가 시장의 각성이라면, Nvidia의 최신 분기 실적은 산업 최상위에서 온 확인 신호입니다. 최근 실적 발표 컨퍼런스 콜에서 Jensen Huang은 암묵적으로 합의된 사실을 명확히 밝혔습니다: AI 수요가 포물선 형태로 증가하고 있다는 것입니다.
이유는 간단합니다: 에이전틱 AI가 도래했기 때문입니다. 주류 AI는 일회성 추론에서 논리적 추론을 거쳐, 이제는 스스로 도구를 호출하고 작업을编排하는 에이전트 단계로 진화했습니다. Huang은 "토큰은 이제 수익성이 있다"고 말했습니다. AI 시대에 연산 능력은 수익과 이윤입니다.
이는 전체 산업을 재편하고 있습니다. 훈련은 모델을 구축하는 일회성 비용인 반면, 추론은 이를 운영하는 지속적인 비용이며, 현재의 병목 현상은 훈련이 아닌 추론에 있습니다.
Nvidia는 이러한 판단을 자체 실적 보고 방식에 반영했습니다. 이제 하나의 플랫폼이 아닌 두 개의 플랫폼, 즉 데이터 센터(Data Center)와 엣지 컴퓨팅(Edge Computing)으로 공시하고 있습니다. 데이터 센터(해당 분기 약 750억 달러, 전년 동기 대비 +92%)는 하이퍼스케일(약 380억 달러, 전분기 대비 +12%)과 ACIE, 즉 AI 클라우드, 산업 및 기업(약 370억 달러, 전분기 대비 +31%)으로 세분화됩니다.
완전히 새로운 라인은 엣지 컴퓨팅입니다: 64억 달러, 전년 동기 대비 +29%로, 에이전틱 AI와 피지컬 AI가 실제로 작동하는 단말기, 예를 들어 PC, 워크스테이션, AI-RAN 기지국, 로봇 및 자동차를 포괄합니다.
엣지는 현재 전체 수익의 8% 미만을 차지하지만, Nvidia는 이를 데이터 센터와 동등한 '제2의 플랫폼'으로 격상했습니다. 이 신호는 다음과 같습니다: 추론이 두 개의 전선으로 분열되고 있다는 것입니다. 데이터 센터 내의 클라우드 추론(cloud inference)과 엣지 측의 엔드포인트 추론(endpoint inference)입니다. AI는 물리적 세계에서 보고, 움직이며 행동해야 합니다.
로드맵도 동일한 논리를 따릅니다: 3분기부터 출하되는 Vera Rubin은 Blackwell 대비 최대 35배의 추론 처리량을 제공하며, Huang은 에이전틱 워크로드를 위해 설계된 Vera CPU에 대해 2000억 달러 규모의 새로운 TAM(총가용시장)을 제시했습니다. 모든 프론티어 모델 기업은 첫날부터 전면 전환할 것으로 예상됩니다.
지구상에서 가장 높은 시가총액을 자랑하는 기업이 '서비스 토큰'을 중심으로 재무 공시를 재편할 때, 병목 현상에 대한 논쟁은 이미 결론이 났습니다. 이 글의 나머지 부분에서는 추론(훈련이 아닌)이 희소 자원이 되었을 때, 누가 가치를 포착하는지에 대해 논의합니다.
먼저 범위를 명확히 하겠습니다. 이 두 가지 전선 중에서 이 글은 클라우드 추론, 즉 외부에 API 토큰 서비스를 제공하는 임대형 데이터센터 GPU에 대해 다룹니다.
엔드포인트 추론은 기기 자체 내부의 로컬 칩(Nvidia의 Jetson, RTX, Drive, AI-RAN)에서 실행되며, 그 아래의 GPU 임대 및 집계 스택을 전혀 거치지 않습니다. 여기서는 이를 추론 경제 전체를 확대하고 병목 현상 논점을 뒷받침하는 순풍으로 간주하되, Hyperbolic과 Venice가 속한 시장(이 두 곳은 완전히 클라우드 라인에 있음)으로 보지 마십시오.
Anthropic은 탄광 속의 카나리아와 같습니다. 사용량이 사전에 구성된 용량을 훨씬 초과하면서, Claude가 '뇌엽 절제술'을 당했다는 불만이 인터넷 전체에 넘쳐나고 있습니다. 여기에는 제한된 응답, 느려진 추론, 축소된 컨텍스트 창이 포함됩니다.
해결책은 노골적인 컴퓨팅 파워입니다: 2026년 5월, Anthropic은 SpaceX로부터 Colossus 1 데이터센터 전체를 인수했습니다. 22만 개 이상의 Nvidia GPU, 300+ 메가와트 규모로, 이를 훈련이 아닌 추론 전용으로 사용합니다.
이 용량은 일련의 한도 변경을 해제했으며, 각각은 하나의 신호입니다.
5월 6일, Anthropic은 Claude Code의 5시간 한도를 두 배로 늘리고, 피크 시간대 제한을 없앴으며, Opus의 API 속도 제한을 대폭 높였습니다. 5월 13일에는 Claude Code의 주간 한도를 다시 50% 인상했습니다(7월 13일까지). 이후 6월 15일부터는 '관대함'과 반대되는 조치를 취했습니다: 에이전틱 및 프로그래매틱 사용(Agent SDK, 헤드리스 모드 claude -p, CI 파이프라인)을 플랫 구독에서 분리하여 독립적으로 측정되는 크레딧 풀(월 20~200달러, API 가격 기준)에 넣었습니다.
이 마지막 단계는 전체 논점을 하나의 동작으로 압축합니다: 에이전트가 추론(inference)을 소비하는 속도는 평면적인 구독 모델의 설계 용량을 훨씬 초과하므로, 본질적인 '반복 비용'에 따라 가격을 책정해야 합니다.
훈련은 일회성 자본 지출입니다. 추론은 반복적인 운영 비용으로, 새로운 사용자와 새로운 에이전트가 추가될 때마다 복리로 누적됩니다.
모든 AI 애플리케이션은 TSMC 팹에서 시작해 API 엔드포인트로 끝나는 공급망 위에 자리 잡고 있습니다:


대부분의 회사는 그중 하나의 레이어만 소유합니다. Nvidia는 실리콘을, CoreWeave는 베어메탈을, Together AI는 추론 최적화를, OpenRouter는 모델 API 라우팅을 보유합니다.
단 한 곳만 예외입니다.
Hyperbolic은 2025년 6월에 주문형 GPU 마켓플레이스를 출시했습니다. 첫 몇 달 만에 개발자 수가 20만 명을 돌파했으며, 채택 범위는 최첨단 AI 연구소, 검색, 대규모 소비자 플랫폼에 이릅니다.
흥미로운 점은 그 아키텍처입니다.
Hyperbolic은 자체적으로 GPU를 한 장도 보유하지 않습니다. 모든 카드는 CoreWeave, Lambda Labs, Nebius, 그리고 유휴 용량을 가진 소규모 운영자를 포함한 네오클라우드와 데이터센터에서 공급받습니다. 이는 약점처럼 들리지만, 실제로는 해자(moat)입니다.
GPU 공급자와 소비자 사이에 위치함으로써, Hyperbolic은 다른 곳에서는 볼 수 없는 실시간 데이터를 확보합니다. 어떤 GPU가 어떤 가격에, 언제, 누구에게 판매되는지 알 수 있습니다. 공급 과잉이 공개되기 전에 이를 감지하고, 수요 급증이 시장을 강타하기 전에 이를 포착합니다.
오늘날, 이 해자는 바로 멀티클라우드 집계 자체입니다. Hyperbolic은 수십 개의 독립적인 클라우드와 데이터센터에서 나오는 파편화된 용량을 하나의 표준화된 통합 풀로 엮어, 개발자가 각 운영자와 협상하거나 여러 계정을 관리할 필요 없이 어디서든 가장 저렴한 사용 가능한 GPU를 빌릴 수 있게 합니다.
연결되는 클라우드가 많을수록 유동성은 깊어지고, 가격 데이터는 더 풍부해집니다. 더 나아가 팀은 이러한 데이터를 활용해 GPU 가격 곡선을 모델링하고, 궁극적으로 자체 자본을 투입해 수급을 조절하며 물리적 연산력의 마켓 메이커 역할을 하는 방안을 모색 중입니다. 하지만 이 목표는 아직 초기 단계에 있으며, 현재 실질적으로 복리 효과를 내는 것은 집계 레이어입니다.
이것이 바로 플라이휠입니다:
1. 더 많은 클라우드 연결 → 더 많은 집계된 공급
2. 더 많은 공급 → 더 깊은 시장과 실시간 가격 데이터
3. 더 나은 데이터 → 현재는 더 스마트한 라우팅, 장기적으로는 가격 모델
4. 더 나은 유동성과 가격 → 더 많은 개발자 → 더 많은 클라우드가 연결을 원함
이를 시도하는 다른 회사는 없습니다. Hyperbolic은 GPU 임대 레이어, 배포 레이어, 모델 API 레이어를 동시에 아우르는 유일한 회사입니다.
Venice는 인퍼런스 경제가 애플리케이션 레이어에서 가장 명확하게 드러난 사례이며, Hyperbolic의 위치와 비교해볼 수 있는 유용한 대조점입니다.
이는 프라이버시 우선의 추론 애플리케이션입니다. OpenAI 호환 API와 소비자 대상 구독제(Free / Pro / Pro+ / Max)를 갖추고 있으며, 요청을 약 75개의 모델로 라우팅합니다. 이 중 약 3분의 2는 오픈소스 또는 자체 호스팅 모델(Llama, Mistral, Qwen, DeepSeek)이고, 나머지는 폐쇄형 최첨단 모델에 대한 익명 프록시 전송입니다.
핵심은 Venice 자체가 의미 있는 연산력을 보유하지 않는다는 점입니다. 공개되지 않은 GPU 파트너 및 기밀 컴퓨팅 공급업체(NEAR AI Cloud, Phala)로부터 임대하고, 최첨단 연구소에 프록시 전송 비용을 지불합니다. 따라서 실제 매출 원가는 SaaS 호스팅이 아닌 인퍼런스 연산력입니다.
Venice가 실제로 판매하는 것은 프라이버시입니다. 여기서 말하는 '프라이버시화'는 공공 연산력을 사유 재산으로 만드는 것이 아니라, 상품화된 추론에 데이터를 저장하지 않고, 훈련에 사용하지 않으며, 요청을 익명화하고, 일부 부하는 TEE에서 실행되어 운영자조차 평문을 볼 수 없도록 하는 보장을 덧입히는 것입니다.
기본 연산력은 대중적인 상품이며, 프리미엄을 붙여 파는 것은 바로 이 프라이버시 포장입니다. 또한 이 보장은 계층화되어 있으며 균일하지 않습니다. 자체 제어 또는 TEE GPU에서 실행되는 오픈소스 모델의 경우 거의 종단 간 기밀 컴퓨팅에 가깝지만, Claude, GPT와 같은 폐쇄형 모델에 대한 익명 프록시 전송의 경우 프라이버시는 신원 분리에 불과하며, 최첨단 연구소 측에서는 여전히 원본 프롬프트를 처리합니다. 따라서 가장 강력한 프라이버시는 오픈소스 부분에만 적용되며, 최첨단 모델 부분은 '진정한 기밀'이 아닌 '익명'에 가깝습니다.
Venice의 총이익 = 구독료 − 하위 계층에 지불하는 추론 비용이며, 순수 API 가격보다 더 많이 받을 수 있는 부분은 거의 전적으로 이 프라이버시 프리미엄에 의존합니다. 이것이 얇은 마진을 유지하면서 최첨단 통과 가격 책정에 제약을 받는 이유입니다.
토큰 설계는 이러한 추론 수요를 포장합니다. Venice는 두 개의 토큰으로 운영됩니다: VVV(스테이킹 및 플랫폼 접근)와 DIEM(추론 크레딧으로, 각 DIEM은 하루 약 1달러의 컴퓨팅 파워에 해당).
유료 구독은 VVV에 대한 프로그램화된 환매 소각을 촉발합니다(Pro / Pro+ / Max 각각 약 2 / 5 / 10달러). 배출량은 고정된 일정에 따라 감소합니다: 월 600만 → 500만 → 400만 VVV, 7월 1일에는 300만으로 하향 조정됩니다.
환매는 실제로 이루어지지만 재량적이며 여전히 규모가 작습니다: 4월과 5월에 각각 약 10만 3천 달러를 소각했으며, 6월에는 약 11만 달러로 천천히 증가하고 있지만, 월 20만 달러 선에는 크게 미치지 못합니다.
기본 펀더멘털은 제목보다 더 건전합니다. 공개적으로 유포된 "7000만 달러 ARR"이라는 숫자는 거의 확실히 구독 갱신을 순 신규 고객 확보로 잘못 해석한 결과입니다. 방어 가능한 관찰 가능 범위는 ARR 600만 ~ 1500만 달러에 더 가깝습니다.
그 아래에서 트랙션은 실제입니다: 약 13만 6천 명의 토큰 보유 주소, 월 약 990만 회의 웹사이트 방문(일 약 33만 회), 신규 Pro 구독은 하루 약 1400건 선에서 맴돌고 있습니다. 이는 실제 비즈니스이지만, 구매하는 컴퓨팅 파워에 의해 경제성이 제약되는 얇은 마진의 비즈니스입니다.
이것이 바로 Hyperbolic이 그 위 계층에 위치하는 이유입니다. Venice가 주유소라면, Hyperbolic은 정유소입니다. Venice는 모두가 의존하는 동일한 제한된 공급에서 컴퓨팅 파워를 구매합니다. 반면 Hyperbolic은 그 파편화된 공급을 집계하고 표준화하여 Venice 및 모든 유사한 플레이어에게 판매합니다.
추론 수요가 증가함에 따라 가치는 컴퓨팅 파워를 소비하는 애플리케이션뿐만 아니라, 컴퓨팅 파워를 집계하고 라우팅하며 이러한 애플리케이션이 지불하는 매출 원가를 포착하는 계층으로도 축적됩니다.
Nvidia는 '서비스 토큰'을 중심으로 재무를 재편했습니다. Cerebras의 IPO는 시장이 이미 추론(inference)이 병목 현상임을 이해하고 있음을 증명합니다. Anthropic은 생산 능력을 확보하기 위해 분주히 움직이며 이것이 실제 문제임을 입증하고 있습니다. 에이전틱(agentic) AI와 피지컬 AI(physical AI)는 클라우드와 엣지 양쪽에서 수요를 몇 배로 증폭시킬 것입니다.
그리고 이는 다른 측면에서 '6000억 달러 문제'의 고리를 닫았습니다. Cahn의 약세 논리, 즉 과잉 건설 후 공급 과잉은 결국 입증될 가능성이 높습니다.
하지만 공급 과잉은 바로 경량 자산 집계자에게 최적의 시장입니다. GPU 가격이 하락하고 공급이 수십 개의 클라우드에 분산될 때, 하드웨어를 전혀 보유하지 않고 모든 작업 부하를 가장 저렴한 가용 카드로 라우팅하는 플레이어는 차익을 얻는 반면, 감가상각되는 GPU를 보유한 운영자는 손실을 부담합니다. Hyperbolic은 공급 과잉을 약세로 보는 것이 아니라 강세로 활용합니다.
최종적으로 승리하는 기업은 가장 많은 GPU를 보유한 곳이 아니라, 어떤 GPU가 어디에서 어떤 가격으로 이용 가능한지 알려주고 모든 작업 부하를 최저 비용으로 실행할 수 있는 곳으로 라우팅하는 기업이 될 것입니다.
Hyperbolic은 바로 그러한 기업을 구축하고 있습니다. 자체적으로 GPU를 보유하지 않고, 순수 소프트웨어에 깊이 3계층으로 구성되며, 추론(inference)의 궁극적인 컴퓨팅 파워 집계 레이어가 되는 것을 목표로 합니다.
원문 링크
BlockBeats 공식 커뮤니티에 참여하세요:
Telegram 구독 그룹:https://t.me/theblockbeats
Telegram 토론 그룹:https://t.me/BlockBeats_App
Twitter 공식 계정:https://twitter.com/BlockBeatsAsia