비디오 제목: 실리콘밸리 좌표 x Fireworks 공동 창업자 Benny Chen: 오픈소스 모델, 토큰 성장률, 추론 최적화 및 모델 커스터마이징
비디오 제작자: Silicon Valley Vector 실리콘밸리 좌표
편집: Peggy, BlockBeats
편집자 주: 오픈소스 모델이 폐쇄형 최첨단 모델에 빠르게 근접하고 추론 가격이 지속적으로 하락하는 배경 속에서, 업계 논의는 '누가 가장 강력한 모델을 보유했는가'에서 '누가 더 낮은 비용으로 모델을 프로덕션에 투입할 수 있는가'로 전환되고 있습니다. 그러나 모델 성능이 수렴되고 토큰 소비 증가가 공감대가 되면서, 더 근본적인 문제가 떠오르기 시작했습니다: 기업이 실제로 비용을 지불할 의향이 있는 것은 더 저렴한 모델 호출인가, 아니면 특정 작업을 안정적으로 완료할 수 있는 전용 지능인가?
최근 《실리콘밸리 좌표》 진행자 차오칭윈이 Fireworks AI 공동 창업자 천위페이와 대담을 진행했습니다. Fireworks는 모델과 기업 애플리케이션 사이에 위치하며, 주로 고객에게 오픈소스 모델 추론, 성능 최적화 및 커스터마이징 서비스를 제공합니다. 단순히 오픈소스가 폐쇄형을 따라잡을 수 있는지 논의하는 것보다, 천위페이의 관찰은 실제 워크로드에 더 가깝습니다: 토큰이 어디로 흐르는지, 기업이 왜 비용을 지불하는지, 그리고 모델이 개념 검증에서 프로덕션으로 전환되기 위해 무엇이 부족한지입니다.

이 대담에서 천위페이는 '오픈소스와 폐쇄형 중 누가 승리할 것인가'를 더 근본적인 구조적 문제들로 분해했습니다: 토큰 성장이 수익으로 전환될 수 있는지, 범용 능력이 수직적 축적을 대체할 수 있는지, 저가 모델이 기업 평가를 통과할 수 있는지, 그리고 추론 플랫폼이 클라우드 업체와 애플리케이션 기업 사이에서 가치를 확보할 수 있는지입니다.
첫째, 오픈소스 모델의 사용 규모와 상업적 가치가 분화되고 있습니다. 과거에는 능력 추격과 호출 가격이 오픈소스 경쟁력을 판단하는 주요 지표였습니다. 현재 Fireworks 플랫폼은 하루 약 40조에서 50조 개의 토큰을 처리하며, 오픈소스 모델의 실제 사용량은 빠르게 확대되었습니다. 그러나 무료 트래픽, 프로모션 보조금 및 모델 가격 차이로 인해 토큰 통계가 일부 수요를 과대평가할 수 있습니다. 고객이 저가 모델을 대량으로 호출하면서도 최고 예산은 가장 성능이 좋은 폐쇄형 모델에 배정할 수 있습니다. 이는 오픈소스의 다음 단계가 단순히 트래픽 확대가 아니라, 고가치 작업에서 최첨단 모델에 도달하거나 이를 초과할 수 있음을 입증하고 비용 우위를 지불 의향으로 전환하는 것임을 의미합니다.
둘째, 범용 모델과 수직 모델이 서로 다른 방향으로 진화하기 시작했습니다. 과거에는 최첨단 모델이 업그레이드될 때마다 다수의 파인튜닝 모델이 직접 도태될 수 있었습니다. 현재 법률, 의료, 프로그래밍 등 수직 애플리케이션은 더 세밀한 평가, 데이터 및 워크플로우를 축적하고 있으며, 그 최적화 목표도 최첨단 연구소와 점차 분리되고 있습니다. 범용 모델은 능력 상한을 높여야 하고, 수직 모델은 제한된 시나리오 내에서 안정적으로 결과를 전달해야 합니다. 전자는 더 광범위한 문제를 해결할 수 있지만, 후자는 사용자가 '정확함'을 어떻게 정의하는지 더 잘 이해합니다. 이는 수직 기업의 장벽이 단순히 커스텀 모델을 보유하는 것이 아니라, 업계 수요를 지속적으로 평가 체계로 전환하고 기초 모델 업데이트에 따라 반복적으로 이전할 수 있는 능력에 있음을 의미합니다.
셋째, 기업의 AI 도입 병목 지점이 모델 공급에서 평가 역량으로 전환되고 있다. 과거에는 기업의 개념 검증(PoC)이 주로 체험과 주관적 판단에 의존했다. 그러나 이제 AI가 콜센터, 법률 검색, 의료 보조 등 생산 현장에 진입하면서 '그럴듯해 보인다'는 것만으로는 구매 결정을 뒷받침할 수 없게 되었다. 기업은 모델이 어떤 작업에서 효과적이고, 언제 실패하는지, 그리고 폐쇄형에서 개방형으로 전환할 때 비용과 품질이 얼마나 달라지는지 반드시 알아야 한다. 따라서 평가는 더 이상 부수적인 도구가 아니라 구매, 훈련, 생산 배포를 연결하는 인프라가 되었다. 작업을 정의하고, 테스트 분포를 구축하며, 기준을 지속적으로 업데이트할 수 있는 자만이 진정한 모델 선택권을 쥐게 된다.
넷째, 추론 플랫폼의 가치가 '저렴한 컴퓨팅 판매'에서 모델, 하드웨어, 워크플로우를 조직하는 방향으로 이동하고 있다. 과거에는 추론 최적화가 주로 단일 토큰 비용 절감으로 이해되었다. 그러나 이제는 캐싱, 작업 분할, 모델 라우팅, 컨텍스트 관리가 작업 완료율을 직접 바꿀 수 있다. 서로 다른 모델이 같은 자리를 두고 경쟁할 필요 없이, 각각 실행자와 조언자 역할을 분담할 수 있다. Fireworks의 비즈니스 로직도 여기서 성립한다. 자체 중자산 하드웨어를 구축하지 않고, 훈련, 커스터마이징, 지속적 추론을 통해 수익을 고객 모델의 실제 사용과 연동하는 것이다. 그러나 이 경로의 주요 경쟁자는 단일 신생 클라우드 기업이 아니라, 컴퓨팅, 소프트웨어, 고객 접점을 동시에 통제할 수 있는 대형 클라우드 업체들이다.
다섯째, 오픈소스 모델의 부상이 반드시 인프라 수요를 약화시키는 것은 아니며, 오히려 모델 계층의 프리미엄을 압축하고 가치를 추론과 컴퓨팅으로 더욱 밀어낼 수 있다. 기술 대기업들이 자본 지출을 지속적으로 늘리는 것은 단기 수익을 계산하기 위해서만이 아니라, AI 시대를 놓칠 경우의 장기적 위험을 측정하기 위해서다. 다만 외부 자금 조달에 의존하는 신생 클라우드 기업에게는 부채 비용, 프로젝트 지연, 회수 기간이 더 직접적인 제약으로 작용한다. 모델이 점점 저렴해진다고 해서 AI 시스템의 구축과 운영도 동시에 가벼워지는 것은 아니다.
이 대담을 하나의 판단으로 압축하자면, 오픈소스 모델의 추격은 시작점에 불과하며, AI 상용화의 다음 단계는 평가, 커스터마이징, 추론 효율성, 고객 워크플로우를 중심으로 전개될 것이다.
다음은 원문 내용입니다(이해를 돕기 위해 일부 정리되었습니다):
·오픈소스 모델이 폐쇄형 모델을 빠르게 따라잡고 있지만, 토큰 증가가 수익 증가를 의미하지는 않으며, 기업 예산은 여전히 가장 효과적인 모델에 우선 배분된다.
·증류는 오픈소스 모델이 단기적으로 격차를 줄이는 데만 도움이 되며, 장기적 경쟁력은 여전히 독자적 훈련, 평가 데이터, 인재, 컴퓨팅에 달려 있다.
·범용 모델의 업그레이드가 더 이상 수직 모델을 반드시 도태시키지는 않으며, 법률, 의료 등 시나리오의 장벽은 모델 역량에서 평가, 데이터, 워크플로우로 전환되고 있다.
·기업 AI가 PoC에서 생산으로 나아가는 핵심은 모델 선택지를 늘리는 것이 아니라, 품질, 비용, 실패 경계를 측정할 수 있는 평가 체계를 구축하는 데 있다.
·추론 최적화는 단일 토큰 비용 절감에서 캐싱, 작업 분할, 모델 라우팅으로 확장되었으며, 시스템 설계 자체가 다중 모델 조합이 단일 프론티어 모델을 능가할 수 있게 한다.
·맞춤형 모델은 다수의 유사 고객을 커버하는 수직 SaaS 플랫폼에 더 적합하며, 단일 기업은 일반적으로 충분히 광범위한 데이터 분포와 지속적인 평가 역량을 갖추기 어렵다.
·Fireworks의 경쟁력은 GPU 보유가 아니라 훈련, 맞춤화, 지속적 추론을 연결하는 데 있으며, 진정한 장기적 경쟁 상대는 여전히 전체 기술 스택을 아우를 수 있는 클라우드 거대 기업이다.
·오픈소스 모델의 보급이 반드시 하드웨어 수요를 약화시키는 것은 아니며, 모델 계층의 프리미엄을 압축하고 산업 가치를 컴퓨팅 파워, 추론 인프라, 기업 워크플로우에 재분배할 가능성이 더 크다.
Fireworks 팀은 대부분 Meta의 PyTorch 생태계 출신이다. 과거 운영체제, 데이터베이스 등 소프트웨어의 발전 경험을 바탕으로, 팀은 오랫동안 중요한 가치를 지닌 소프트웨어에는 결국 경쟁력 있는 오픈소스 솔루션이 등장할 것이라고 믿어왔다. 대형 모델도 유사한 경로로 발전할 가능성이 높지만, 이번 추격 속도는 천위페이가 당초 예상했던 것보다 더 빨랐다.
한편으로 OpenAI, Anthropic 등 폐쇄형 모델 기업의 연간 반복 매출은 여전히 빠르게 성장하고 있다. 다른 한편으로 중국과 미국의 오픈소스 모델도 능력 격차를 빠르게 좁히며 추론 가격을 매우 낮은 수준으로 끌어내리고 있다. 오픈소스와 폐쇄형은 한쪽이 성장하면 다른 쪽이 반드시 쇠퇴하는 제로섬 관계가 아니다.
일부 오픈소스 모델이 폐쇄형 모델의 출력을 통해 증류되는 것에 대해 천위페이는, 이 방식이 단기적으로 모델을 높은 수준에 도달하게 할 수는 있지만 신뢰할 수 있는 장기적 경로가 되기는 어렵다고 본다. 폐쇄형 업체는 API와 보안 메커니즘을 점진적으로 보완하여 추론 과정과 관련 데이터가 추출될 가능성을 낮출 수 있다.
그러나 오픈소스 모델의 발전이 전적으로 증류에 의존하는 것은 아니다. 평가 체계가 지속적으로 개선되고 데이터 비용이 계속 하락하며, 충분한 인재, GPU, 엔지니어링 역량이 갖춰진다면 오픈소스 팀은 여전히 독자적으로 경쟁력 있는 모델을 훈련할 수 있다. 컴퓨팅 파워와 인재를 보유한 Meta와 같은 기업이 장기간 폐쇄형 프론티어 모델과 큰 격차를 유지할 이유가 없다.
이것이 폐쇄형 모델이 시장을 잃는다는 의미는 아니다. 천위페이는 둘을 애플과 안드로이드에 비유한다. 개방형 생태계는 더 큰 사용 규모를 흡수할 수 있고, 지속적으로 선두를 유지하는 폐쇄형 제품은 안정적인 경험, 브랜드 인지도, 기업 신뢰를 바탕으로 가격 민감도가 낮은 고가치 고객을 유지할 수 있다.
기업 구매는 종종 보수적인 경향이 있다. "IBM을 구매했다고 해고되는 사람은 없다"는 말이 바로 이러한 의사결정 심리를 설명한다. 고객이 여전히 선두 폐쇄형 모델을 구매하는 것이 더 안전하다고 믿는 한, OpenAI, Anthropic 등 기업은 일정한 우위를 유지할 수 있다. 단기적 기술 격차보다 사용자 인식과 시장 진입 능력이 더 바뀌기 어려울 수 있다.
천위페이는 폐쇄형 모델 기업의 ARR이 여전히 성장할 것으로 예상하지만, 이 수치가 최종적으로 확보한 경제적 이익을 완전히 반영하지는 못할 수 있다고 본다. 예를 들어, 일부 수익은 클라우드 업체와 분배해야 할 수 있으며, ARR 상승이 반드시 동일한 비율의 회계 수익과 이익으로 전환되지는 않는다. 폐쇄형 모델의 협상력이 하락했는지 여부는 관련 기업이 더 완전한 재무 정보를 공개한 후에야 판단할 수 있다.
장기적으로 볼 때, 오픈소스는 더 큰 호출 규모를 확보할 수 있고, 폐쇄형은 계속해서 더 높은 수익성을 가진 수요를 장악할 것이다. 양자의 상업적 경계를 결정하는 것은 모델 역량뿐만 아니라 브랜드, 채널, 고객 신뢰 및 수익 분배 방식도 포함된다.
천위페이의 소개에 따르면, Fireworks 플랫폼은 현재 하루 약 40조에서 50조 개의 토큰을 처리한다. 그가 인용한 공개 기준에 따르면, 이 규모는 이미 Gemini와 OpenAI가 공개한 기업 API 트래픽을 초과한다.
플랫폼의 주요 수요는 프로그래밍, 의료, 협업 오피스 및 심층 연구에서 발생한다. 그중 점점 더 많은 원래 프로그래밍으로 간주되지 않던 작업이 '프로그래밍 문제'로 재정의되고 있다.
PowerPoint, Excel과 같은 오피스 소프트웨어가 대표적인 사례다. 모델이 코드나 구조화된 도구를 통해 이러한 소프트웨어를 조작할 수 있게 되면, 기존의 코드 생성, 도구 호출 및 강화 학습 방법을 오피스 시나리오로 이전할 수 있다. 많은 수직 SaaS 기업들도 업계 도구를 모델이 호출할 수 있는 환경으로 캡슐화하고, 강화 학습을 통해 모델이 특정 작업 흐름에 익숙해지도록 하고 있다.
천위페이는 현재 수요를 크게 두 가지로 분류한다. 하나는 프로그래밍이고, 다른 하나는 심층 연구다. 다양한 수직 애플리케이션이 이 둘을 결합하여 법률, 의료, 오피스 등 시나리오에 특화된 전용 에이전트를 형성할 것이다.
그는 특히 비기술 사용자를 대상으로 한 협업 오피스 제품을 낙관적으로 본다. 지금까지 업계의 대부분 자원은 수학, 프로그래밍 등 '이과생 수요'에 투입되었지만, 슬라이드 생성, 문서 처리, 비디오 제작 등 광범위한 지식 근로자를 대상으로 한 수요는 더 빠르게 성장할 수 있다.
컴퓨터 조작 에이전트의 발전은 이전 예상보다 더디다. 1년여 전, 이러한 제품은 복잡한 API를 우회하고 사람처럼 컴퓨터를 직접 사용할 수 있을 것으로 한때 기대되었다. 실제 발전 과정에서 기업들은 비용 절감을 위해 오히려 더 많은 작업 흐름을 순수 텍스트로 전환했다. 텍스트 모델은 더 저렴하고 기존 프로세스에 통합하기도 더 쉽다. 가상 머신 비용 하락과 실행 환경 개선에 따라 컴퓨터 조작 에이전트는 여전히 더 큰 공간을 확보할 수 있지만, 구체적인 최적화 경로는 여전히 탐색 중이다.
그러나 토큰 증가가 곧바로 상업적 가치를 의미하지는 않는다. 공개 모델 라우팅 순위는 종종 무료 할당량과 프로모션 활동의 영향을 받으며, 동일한 수의 토큰도 완전히 다른 가격에 대응할 수 있다. 저가 모델에서 발생한 트래픽과 고가의 프론티어 모델에서 발생한 트래픽은 수익 측면에서 그 의미가 동일하지 않다.
천위페이는 토큰 수보다 수익이 고객의 진정한 선택을 더 잘 반영한다고 본다. 기업이 가격에 민감하지 않을 때, 예산은 여전히 성과가 가장 좋은 모델로 흘러간다. 따라서 Fireworks가 고객의 모델 커스터마이징을 도울 때, 최우선 목표는 대개 '가성비가 괜찮은 것'이 아니라 특정 작업에서头部 폐쇄형 모델에 도달하거나 이를 초과하는 것이다.
프로그래밍 시장에서도 사용량과 수익의 분화가 존재한다. 토큰 소비는 높은 확률로 지속적으로 증가하겠지만, 일반적으로 사용되는 모델의 가격이 계속 내려가면 더 낮은 가격이 더 많은 호출을 자극하지만 시장 수익이 동시에 확대되지는 않을 수 있다. 전기의 보급이 이익이 모두 발전 기업에 돌아가는 것을 의미하지 않는 것처럼, AI 호출량 증가도 산업 가치가 최종적으로 어느 계층에 귀속되는지에 대한 답을 직접 주지는 못한다.
향후 일정 기간 동안 오픈소스 모델의 사용량은 계속 증가할 가능성이 있지만, 관련 지출이 동시에 확대될 수 있을지는 기업이 리소스를 투입해 커스터마이징할 의향이 있는지에 달려 있다. 점점 더 많은 기업이 커스터마이징한 오픈소스 모델이 특정 작업에서 폐쇄형 모델에 도전할 수 있게 된다면, 트래픽과 수익은 오픈소스로 더욱 이동할 것이다. 반면 커스터마이징 비용, 실패율, 조직 역량이 계속 장애물로 작용한다면, 폐쇄형 모델이 여전히 대부분의 고부가가치 수요를 흡수할 것이다.
새로운 프론티어 모델이 출시될 때마다 시장은 항상 같은 질문을 다시 던진다: 기업이 데이터와 자금을 투입해 파인튜닝한 모델이 빠르게 가치를 잃게 될까?
천위페이는 2025년에는 실제로 많은 커스터마이징 모델이 차세대 기초 모델로 대체되었지만, 2026년에는 이러한 상황이 눈에 띄게 줄었다고 말한다. 그의 관점에서 이는 수직 모델의 상업적 가치가 점차 안정화되고 있다는 긍정적인 신호다.
그 이유는 범용 모델과 수직 애플리케이션이 서로 다른 방향으로 최적화되고 있기 때문이다. 프론티어 연구소는 모델이 더 어려운 수학, 과학, 신약 개발 문제를 해결할 수 있음을 입증해야 한다. 법률, 의료 등 수직 기업이 주목하는 것은 구체적인 사용자 요구, 작업 완료율, 인용 정확성, 워크플로우의 신뢰성이다.
"수직 분야의 Agent 하나를 잘 만드는 것과 리만 가설을 푸는 것은 완전히 다른 종류의 작업일 수 있다."
법률 AI 기업 Harvey를 예로 들면, 그 강점은 단순히 어떤 기초 모델을 사용했는지에 있는 것이 아니라 법률 작업의 분해, 평가 체계, 데이터 처리, 제품 프로세스에 있다. 의료 시나리오도 마찬가지로, 각 제품은 의사의 업무 방식, 자료 출처, 정확성 요구에 맞춰 전문적인 기준을 구축해야 한다.
이러한 평가와 데이터는 새 모델이 출시된다고 해서 자동으로 무효화되지 않는다. 기초 모델이 업그레이드되면 수직 기업은 기존 훈련 환경을 새 모델로 이전할 수 있으며, 업계 전체를 다시 이해할 필요는 없다. 평가가 점점 더 세분화되고 데이터 정제 프로세스가 점점 더 성숙해짐에 따라, 수직 모델은 특정 작업을 중심으로 지속적으로 축적되는 역량을 형성한다.
이론적으로 프론티어 모델 기업은 법률이나 의료 시장에 자원을 집중하여 단일 분야에서 기존 제품을 능가할 수도 있습니다. 그러나 이러한 접근 방식이 반드시 상업적 목표에 부합하는 것은 아닙니다. 범용 모델 기업은 광범위한 고객을 대상으로 서비스를 제공해야 하므로, 대규모 자원을 하나의 수직 분야에 투입할 경우 추구하는 시장 규모와 기업 가치를 유지하기 어려울 수 있습니다.
천위페이는 범용 모델을 다양한 입맛을 고려해야 하는 체인 레스토랑에 비유하며, 수직 모델은 소수의 메뉴에 집중하는 전문 식당에 더 가깝다고 설명합니다. 후자는 모든 문제를 해결할 필요가 없으며, 목표 작업에서 범용 솔루션보다 현저히 우수한 성과를 내기만 하면 독립적인 유료 공간을 구축할 수 있습니다.
이러한 불균형하지만 고도로 전문화된 능력을 그는 '재기드 인텔리전스(Jagged Intelligence)'라고 부릅니다. 법률 모델이 리만 가설을 풀지 못할 수도 있지만, 특정 유형의 법률 작업에서는 더 큰 규모의 범용 모델을 능가할 수 있습니다. 기업 고객에게는 모델이 더 폭넓은 능력을 갖추었는지보다 작업을 안정적으로 완수할 수 있는지가 더 중요합니다.
모든 기업이 맞춤형 모델에 적합한 것은 아닙니다. 천위페이는 가장 적합한 고객은 유사한 기관 다수에 서비스를 제공하는 수직 SaaS 기업이며, 단일 병원, 법무법인 또는 최종 기업은 아니라고 봅니다.
수직 SaaS 플랫폼은 많은 고객과 접촉하여 다양한 기관 간의 공통 요구를 이해할 수 있고, 더 많은 상황을 포괄하는 평가 시스템을 구축할 수도 있습니다. 단일 기업은 일반적으로 충분히 넓은 데이터 분포와 지속적인 평가 역량을 갖추기 어렵기 때문에, 독자적으로 모델을 훈련하는 대신 내부 프로세스를 스킬, 도구 또는 에이전트로 고정한 후 외부 기반 모델을 호출하여 작업을 완료하는 것이 더 낫습니다.
맞춤형 강화 학습 프로젝트에서 GPU는 주요 비용이지만, 데이터와 훈련 환경도 마찬가지로 중요합니다. 팀은 모델이 보상 해킹(평가의 허점을 이용해 높은 점수를 얻지만 실제로 작업을 완료하지 못하는 현상)을 일으키는지 점검해야 하며, 훈련 환경의 안정성을 보장하고 훈련 규모를 확장할 수 있는지도 확인해야 합니다.
초기 환경이 반드시 수십만 개에 이를 필요는 없습니다. 천위페이는 수천 개의 훈련 환경만으로도 강화 학습을 시작할 수 있다고 말합니다. 모델이 훈련 과정에서 반복적으로 탐색하며 많은 궤적을 생성하기 때문입니다. 각 훈련 단계에서 하나의 환경을 128회 실행한다고 가정하면, 천 개의 초기 데이터로 약 12만 8천 개의 훈련 궤적이 생성될 수 있습니다.
맞춤형 모델이 출시된 후에도 '재훈련'이 필요합니다. 새로운 오픈소스 기반 모델이 출시되면 플랫폼은 기존 훈련 및 평가 시스템을 새 모델로 이전할 수 있습니다. 평가 기준과 작업 환경이 이미 고정되어 있다면 이전 자체는 시간이 많이 걸리지 않을 수 있습니다. 실제로 지속적인 작업량을 발생시키는 것은 고객이 새로운 시나리오, 워크플로우, 더 어려운 작업을 추가하는 부분입니다.
따라서 수직 기업의 핵심 자산은 특정 세대 모델의 가중치가 아니라, 기반 모델 업데이트에 따라 반복적으로 이전할 수 있는 데이터, 평가, 워크플로우입니다.
기업이 오픈소스와 폐쇄형 모델 중 무엇을 선택할지 결정할 때 가장 우선적으로 고려하는 것은 성능이나 가격이 아니라 신뢰다.
기업 계약은 일반적으로 1~2년 지속되므로, 구매자는 서비스 제공업체와 그 생태계가 장기적으로 비즈니스 요구를 지원할 수 있는지 판단해야 한다. 오픈소스 모델은 더 저렴하고 유연할 수 있지만, 폐쇄형 모델 업체는 브랜드 홍보, 성공 사례, 시장 인지도 측면에서 여전히 우위를 점하고 있다.
천위페이는 오픈소스 모델과 그 서비스 제공업체의 가장 뚜렷한 약점은 기술이 아니라 시장 진입 능력이라고 본다. 폐쇄형 모델 기업은 새로운 기능 시연과 연구 성과를 지속적으로 발표하며 사용자 인식을 강화할 수 있지만, 오픈소스 생태계에는 통일된 마케팅과 고객 커뮤니케이션 체계가 부족하다.
배포 방식도 변화하고 있다. 초기 기업들은 온프레미스 배포에 더 주목했지만, 현재는 점점 더 많은 워크로드가 클라우드로 전환되고 있다. 서비스 제공업체가 보안, 가상 프라이빗 클라우드 등 측면에서 신뢰를 구축할 수 있다면, 멀티테넌트 클라우드 서비스가 일반적으로 기업 전용 GPU보다 경제성이 더 높다.
개별 기업이 GPU 집합을 항상 높은 활용률로 유지하기는 어렵지만, 플랫폼은 다양한 고객의 수요를 통합하여 하드웨어 사용 효율을 높일 수 있다. 추론 비용이 기업 운영 지출에서 차지하는 비중이 커질수록 공유 인프라가 제공하는 비용 이점은 더욱 두드러진다.
기업이 개념 검증(PoC) 단계에서 실제 운영으로 넘어갈 때 가장 큰 장애물 중 하나는 엄격한 평가 체계의 부재다. 많은 기업이 이미 콜센터 등 중요한 영역에 AI를 도입했음에도 불구하고, 모델 효과를 판단하는 방식은 여전히 감각에 의존한 시범 사용에 가깝고, 반복 실행 가능한 테스트 기준을 구축하지 못하고 있다.
평가가 없으면 기업은 오픈소스와 폐쇄형 모델을 안정적으로 비교할 수 없을 뿐만 아니라, 모델 업데이트가 실제로 비즈니스를 개선했는지도 판단할 수 없다. 따라서 천위페이는 AI 평가를 설계할 수 있는 인재가 여전히 부족하다고 본다. 신뢰할 수 있는 평가 체계는 기업이 모델 교체를 완료하도록 돕고, 구축 비용보다 훨씬 높은 장기 지출을 절감할 수 있다.
이는 전통적인 소프트웨어 기업의 유닛 테스트와 본질적으로 다르지 않다. 과거에는 SaaS 기업이 소프트웨어를 출시하기 전에 일련의 테스트를 실행해야 했다. 현재는 수직 AI 기업이 에이전트가 실제 운영에 투입되기 전에 일정 기준을 충족하는지 확인하기 위해 일련의 평가를 구축해야 한다. 업계 업무의 중심은 일부 '테스트 작성'에서 '평가 작성'으로 이동하고 있지만, 핵심은 여전히 제품 품질을 측정 가능하고 축적 가능한 조직 역량으로 전환하는 것이다.
제3자 데이터 기업의 발전도 기업 AI 도입을 관찰하는 지표가 될 수 있다. 고객이 소수의 선도 연구소에 계속 집중되어 있다면, 일반 기업이 독자적인 AI 역량을 구축할 여지가 여전히 제한적이라는 뜻이다. 수익원이 점차 분산된다면, 더 많은 기업이 데이터를 구매하고 평가를 구축하며 자체 모델을 훈련하기 시작했다는 의미일 수 있다.
기업에 실제로 부족한 것은 더 많은 모델이 아니라, 올바른 것을 정의하고 실패를 식별하며 구매 결정을 지원할 수 있는 표준입니다.
Fireworks의 첫 번째 핵심 사업은 추론 최적화입니다. 천위페이는 이 작업에 여전히 큰 여지가 있다고 생각합니다. 모델이 처음 출시될 때의 실행 효율성과 장기간 최적화를 거친 후의 성능 사이에는 일반적으로 뚜렷한 차이가 있기 때문입니다.
플랫폼이 해결해야 할 문제는 이 최적화 주기를 단축하여 새 모델이 출시될 때 가능한 한 최적 상태에 가깝게 만드는 것입니다. 모델 런타임 자체 외에도 캐시, 스케줄링 및 지원 인프라가 최종 비용에 영향을 미칩니다. 많은 최적화가 수많은 세부적인 엔지니어링 작업에서 비롯되므로 추론 최적화는 여전히 노동 집약적인 사업입니다.
모델 개발자가 제공하는 자사 API와 달리 Fireworks는 다양한 기반 모델과 맞춤형 모델을 동시에 서비스하므로 더 다양한 트래픽 패턴과 워크로드를 관찰할 수 있습니다. 모델 제조사는 먼저 자체 모델을 광범위한 사용자에게 안정적으로 서비스해야 하며, 제3자 플랫폼은 특정 고객의 요청 특성에 맞춰 더 세밀한 최적화를 수행할 수 있습니다.
모델 라우팅은 단지 비용 절감만을 위한 것이 아닙니다. Fireworks와 Harvey의 공동 실험에서 시스템은 한 모델을 작업 실행자로, 다른 모델을 컨설턴트로 지정하여 긴 컨텍스트 작업을 여러 개의 짧은 하위 작업으로 분할했습니다. 대형 모델의 성능은 컨텍스트가 길어질수록 저하될 수 있으므로, 합리적인 역할 분담을 통해 시스템 전체 성능이 오히려 가장 강력한 모델을 단독으로 사용할 때보다 더 나을 수 있습니다.
천위페이는 이 과정을 CPU 성능 최적화에 비유합니다. 개발자는 프로세서의 특성을 이해한 다음 프로그램을 해당 프로세서에 적합한 워크로드로 분할해야 합니다. 마찬가지로 AI 시스템에서 기반 모델은 텍스트 프로세서로 간주할 수 있습니다. 팀은 먼저 다양한 모델의 능력 경계를 이해하고, 작업 프레임워크를 설계한 다음, 적절한 모델을 적절한 위치에 배치해야 합니다.
하드웨어 최적화도 GPU, HBM, CPU 및 네트워크의 개별 지표만 볼 수는 없습니다. 모델은 훈련 초기에 일반적으로 기존 하드웨어의 계산 및 메모리 비율에 맞춰 설계됩니다. 따라서 모델을 엔비디아 GPU에서 유사한 특성을 가진 AMD GPU로 이전하는 것은 상대적으로 쉬우나, 아키텍처가 다른 ASIC으로 이전하려면 많은 작업이 필요할 수 있습니다.
새 하드웨어의 성공 여부는 매개변수가 엔비디아에 근접한지 여부에만 달려 있지 않으며, 공급 규모, 소프트웨어 생태계 및 경제적 인센티브가 개발자가 이를 위해 모델을 최적화하도록 유도할 수 있는지에도 달려 있습니다. 하드웨어 구성이 엔비디아와 유사하더라도 개발자가 이를 사용하여 충분한 보상을 얻지 못한다면 생태계를 형성하기 어렵습니다.
추론 플랫폼이 최종적으로 최적화하는 것은 단순히 모델 실행 속도가 아니라, 모델·태스크·하드웨어 간의 매칭 방식이다.
AI 클라우드 업체들이 소프트웨어 레이어로 확장하는 상황에서, Fireworks는 당분간 자체 하드웨어를 구축하거나 GPU에 대규모 자산을 투자할 계획이 없다. 천위페이는 회사의 모델을 '임대인'에 가깝다고 표현한다. 인프라 공급자로부터 컴퓨팅 자원을 확보하고, 핵심 역량을 컴퓨팅 소프트웨어, 추론 서비스, 모델 커스터마이징에 집중한다는 것이다.
Fireworks와 일반 AI 클라우드 플랫폼의 차이는, 플랫폼의 대부분 트래픽이 수정되지 않은 기본 모델이 아닌 커스텀 모델에서 발생한다는 점이다. 천위페이는 기본 모델 추론의 경쟁이 점점 치열해질 것이며, 수익은 고객에게 더 나은 결과를 제공할 수 있는 전용 모델에서 나올 가능성이 높다고 본다.
Fireworks는 학습과 추론을 하나의 비즈니스로 연결한다. 회사는 고객의 모델 학습을 돕고, 모델 출시 이후 추론 트래픽이 지속적으로 성장하기를 기대한다. 단순히 학습 비용이나 컨설팅 비용만 받는 서비스 제공업체와 비교하면, 이러한 수익 구조는 플랫폼과 고객의 장기적 사용 효과를 더욱 일치시킨다. 고객이 모델을 통해 더 많은 가치를 창출해야 Fireworks도 지속적인 추론에서 더 많은 수익을 얻을 수 있기 때문이다.
일부 강화학습 서비스 제공업체는 학습이나 컨설팅만 제공하며, 그 수익이 모델 출시 이후의 사용 효과와 반드시 직접적으로 연결되지는 않는다. Fireworks의 비즈니스 로직은 학습을 통해 모델 성능을 향상시키고, 이후 추론 트래픽에서 보상을 얻는 것이다. 일회성 학습 프로젝트를 파는 것이 아니라, 고객의 모델이 지속적으로 사용량을 창출할 수 있는 역량을 제공한다.
전체 체인을 실제로 커버할 수 있는 경쟁자는 단일 신생 클라우드 기업이 아니라, AWS, Microsoft Azure, Google Cloud와 같은 대형 클라우드 서비스 제공업체다. 이들은 컴퓨팅 자원을 보유하고 있을 뿐만 아니라, 강화학습 서비스, 추론 플랫폼, 개발 도구도 구축할 수 있다.
Fireworks는 한편으로는 클라우드 업체와 경쟁하면서도, 다른 한편으로는 그들의 인프라에 의존하고 협력한다. 현재 회사는 Azure와 가장 긴밀하게 협력하고 있으며, 고객은 Azure 크레딧을 사용해 Fireworks 서비스를 구매할 수 있다. 또한 AWS 및 Google Cloud와도 협력을 진행 중이다.
천위페이는 Fireworks의 현재 추론 최적화 역량이 여전히 클라우드 업체의 유사 서비스보다 우수하지만, 단일 성능이 가장 견고한 장벽은 아니라고 본다. 더 중요한 것은 학습, 배포, 평가, 추론에 이르는 전체 머신러닝 운영 주기를 완성하여 개발자에게 일관된 경험을 제공하는 것이다. 신생 클라우드 기업과 비교하면 Fireworks가 커버하는 체인이 더 길고, 클라우드 거대 기업과 비교하면 전문성과 실행 속도에서 우위를 유지해야 한다.
미래에 AI가 커널, 추론, 후처리 최적화를 자동으로 수행할 수 있게 되더라도, 고객 요구를 이해하는 작업은 여전히 완전히 대체하기 어려운 영역일 수 있다. 시스템이 복잡한 수학 문제를 해결할 수 있을지라도, 기업의 프로세스, 제약 조건, 평가 기준을 공백 상태에서 이해할 수는 없을 것이다. Fireworks의 장기적 가치는 궁극적으로 고객 요구를 모델, 평가, 실행 가능한 제품으로 전환할 수 있는지에 달려 있다.
향후 1~2년간 Fireworks가 직면한 가장 큰 도전은 여전히 컴퓨팅 파워다. 회사가 합리적인 가격에 충분한 컴퓨팅 자원을 확보할 수 있는지가 매출 성장을 직접적으로 제한할 것이다. 천위페이는 Fireworks의 현재 상태를 '컴퓨팅 파워 제약'으로 요약하며, 최소한 향후 1년간 시장 전반이 이러한 상태를 유지할 가능성이 높다고 판단했다.
이는 그가 기술 대기업들의 AI 자본 지출에 대한 견해에도 영향을 미쳤다. 시장은 일반적으로 투자 수익률 관점에서 Google, Meta 등 기업의 과잉 투자 여부를 판단한다. 그러나 이러한 기업들에게는 또 다른 위험이 더 클 수 있다: AI가 결국 매우 높은 수익을 가져오는데, 투자를 줄여 이번 경쟁에서 뒤처진다면 영구히 게임에서 밀려날 수 있다는 점이다.
따라서 단기적으로 과잉 투자를 하더라도, 그 대가는 재무제표 부담과 향후 수년간의 감가상각 흡수에 불과할 수 있다. 장기적 현금 흐름과 자금 조달 능력을 갖춘 기술 대기업에게 이는 일반적으로 생존 위험이 아니다. 그러나 핵심 기술 주기를 놓치는 것은 생존 위험이 될 수 있다.
신규 클라우드 기업들의 상황은 다르다. 이들은 프로젝트 수익, 자금 조달 비용, 회수 기간을 더 엄격하게 계산해야 한다. 천위페이는 관련 기업의 채권 등급, 프로젝트 지연, 재융자 능력에 주목할 것을 권장한다. 향후 3~6개월 내에 일부 참여자가 신용 문제로 대출을 계속하지 못하고 부채 재구성이 필요해질 경우, 시장에 이를 인수할 자금이 있는지 여부가 AI 인프라 자금 조달 능력을 검증하는 핵심 시점이 될 것이다.
'오픈소스 모델이 폐쇄형 모델을 따라잡으면 하드웨어 수요가 낮아질 것'이라는 시장 내러티브에 대해 천위페이는 회의적인 입장이다. 그가 보기에 오픈소스 모델의 성능 향상은 먼저 모델 계층의 프리미엄 능력을 약화시킨다. 전체 AI 지출이 변하지 않는다면, 가치는 오히려 컴퓨팅 파워와 인프라를 제공하는 기업으로 이동할 수 있다.
그러나 AI 자본 지출이 결국 충분한 수익으로 실현될 수 있을지는 여전히 답이 없는 문제다. 컴퓨팅 파워 프로젝트는 투자 회수에 수년이 걸리는 경우가 많으며, 1년 후의 수급 구도는 이미 예측하기 어렵다. 현재 단계에서 비교적 명확한 신호는 Fireworks와 그 고객들 모두 여전히 더 많은 컴퓨팅 파워를 찾고 있다는 점이다.
오픈소스와 폐쇄형의 경쟁은 모델 리더보드만으로 결정되지 않을 것이다. 성능 격차가 지속적으로 줄어들면서, 산업 가치는 누가 작업을 정의하고, 효과를 검증하며, 지속 가능한 비용으로 모델을 생산에 투입할 수 있는지에 더 많이 달려 있게 될 것이다.
[동영상 링크]
BlockBeats 공식 커뮤니티에 참여하세요:
Telegram 구독 그룹:https://t.me/theblockbeats
Telegram 토론 그룹:https://t.me/BlockBeats_App
Twitter 공식 계정:https://twitter.com/BlockBeatsAsia