AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

AlphaGo의 아버지가 창업하여 시드 라운드에서 11억 달러를 조달했습니다.

이 글을 읽으려면 18 분
그는 인간 데이터가 아닌 모델이 환경에서 직접 경험을 생성하도록 했기를 원합니다

David Silver은 마지막으로 떠올랐던 곳은 2016년 서울의 그 회의실이었습니다. 정확히 말하면, 그 옆 테이블에서 이세돌의 "뒤"에 앉아 있었습니다. 테이블 가장자리에 앉아 있던 것은 AlphaGo였습니다.



10년이 흘렀고, 그는 구글 DeepMind를 떠나 런던에서 새 출발을 했습니다. 자금 조달 발표가 나온 지 24시간도 채 되지 않았을 때, 유럽의 벤처 캐피털계는 숨을 죽이고 있었습니다: 110억 달러의 시드 라운드, 510억 달러 평가액, Sequoia와 Lightspeed가 공동 리드했고, Nvidia, DST Global, Index, Google, 영국 주권 AI 기금 등의 연이은 이름들이 참여했습니다.


이것은 유럽 벤처 투자사업의 역사상 가장 큰 시드 라운드거래였습니다.


“가장 큰 시드 라운드”는 그저 오프닝일 뿐, 핵심이 아닙니다


우선 숫자부터 말하죠.


그 회사는 Ineffable Intelligence라고 합니다. 2025년 11월에 설립되었으며, Silver는 올해 1월에 DeepMind를 정식으로 퇴사하고 전격적으로 이를 맡았습니다. 회사를 설립한 지 이 금액을 받기까지, 반 년도 되지 않았습니다.


시드 라운드로 510억 달러의 가치를 제시받았으며, 거의 직전의 Mistral의 B 라운드를 따라잡을 정도로, 동시에 당시 유럽 AI 스타트업 중의 어떤 초기평가보다도 높았습니다. 투자자 명단은 유럽과 미국의 주권 자본, 실리콘밸리의 최고급 BC와 알고리즘 제공 업체가 한꺼번에 참여한 것이 드문 일입니다. 영국 정부의 주권 AI 기금이 최초로 이 정도 규모의 초기 라운드에 참여하는 것 자체가 하나의 신호였습니다.


이 정도의 금액을 시드 라운드에서 받는 것은 전통적인 의미에서 말이 안 된다고 할 수 있습니다. 초기 투자자들은 일반적으로 제품, 수익, 고객 중 적어도 하나가 나타날 때까지 기다려야만 합니다. Silver의 이 라운드는 모든 단계를 건너뛰고, 바로 중소 규모의 상장 기업 수준의 가치를 받은 것과 마찬가지였습니다.


돈의 원천은 의구심을 줄 만큼 명확했습니다. 그들이 건든 것은 제품이 아닌 패러다임이었습니다. 이 판단은 이어지는 내용에서 전개될 것입니다.


먼저 Silver 자신의 이력부터 살펴보죠. 10년간 DeepMind에서 근무하면서 Atari 픽셀 게임에서 게임하는 방법을 지도하거나 협업하여 AlphaGo, AlphaZero(바둑, 체스, 장기 3종 무인종이버전), AlphaProof(국제 수학 올림피아드 은메달 획득)을 이끌었습니다. 또한 UCL 교수입니다. 다시 말해, 그는 거의 15년 동안 강화 학습을 학술적으로는 영향력이 적은 분야에서 산업의 주요 소식까지 만든 사람입니다.



이력서의 가치는 논문 수에 있지 않습니다. 대신 독점적인 발언 권한입니다. 이 분야에서 '학술적 명성 + 엔지니어링 경력 + 교과서적 지위'를 동시에 갖는 사람은 전 세계적으로 5명을 넘지 않습니다.


그는 인간 데이터를 원하지 않습니다


이야기가 정말로 직관적이지 않은 곳은 여기에 있습니다.


GPT, Claude, Gemini와 같은 이 세대의 모델은 본질적으로 인간이 쓴 모든 것을 네트워크에 채우고 의미론적 확률로 압축한 다음 각종 사후 훈련 방법을 사용하여 '불러내는' 것입니다. 이 모델은 이메일을 쓸 수도 있고, 코드를 쓸 수도 있고, 소구 발화를 연기할 수도 있는 이유는 인간이 이미 이 모든 것을 썼기 때문입니다.


Ineffable 웹사이트에 게시된 Silver의 목표는 '슈퍼러너(superlearner)'를 만드는 것입니다. 이 모델이 해야 할 일은 어떤 인간이 만든 데이터에도 의존하지 않고 자신만의 '경험'을 통해 아무 것도 모르는 상태에서 기초적인 운동 기술부터 '심오한 지식의 극한'까지 스스로 배우는 것입니다.



이것은 마케팅 구호가 아닙니다. 이에는 현재 게시 중인 기사가 있습니다.


작년부터 Silver는 강화 학습 교과서 저자이자 튜링상 수상자인 Richard Sutton과 공동으로 '경험 시대(Era of Experience)'라는 제목의 글을 썼으며, 이 글은 곧 MIT Press에서 출판될 예정인 'Designing an Intelligence'의 일부입니다. 이 글에서 많이 인용되는 판단이 있습니다.


“수학, 코드, 과학과 같은 핵심 분야에서 인간 데이터에서 추출할 수 있는 지식은 빠르게 한계에 다다르고 있습니다.”

인간이 작성한 모든 것은 모델에 읽히기 충분합니다. 그 이후로는 사전 훈련의 이점이 점점 더 줄어들며, 스케일링 법칙은 점점 더 평평한 선이 될 것입니다.


다음 세대 AI의 해법은 더 큰 말뭉치나 더 많은 인간 피드백이 아니라 모델이 환경에서 직접 경험을 생성하도록 하는 것입니다. 모델이 시도하고 실패하며 상호 작용하고 아무도 쓴 적 없는 것들을 탐구하도록 하는 것입니다.


이 점에서 벤처캐피탈은 공고에서 더 확실하게 말했습니다. “성공한다면, 이것은 다윈 수준의 과학적 돌파구일 것입니다. 그의 법칙은 모든 생명을 설명했지만, 우리의 법칙은 모든 지능을 설명하고 구축할 것입니다.”


이런 말은 사람들이 눈을 돌리기 쉽습니다. 그러나 서두르지 마세요. 이 문구는 적어도 성실하게 실현 가능성을 인정했습니다. 그들이 가장하고 있는 것은 채팅 봇도 아니고 특정 산업의 도우미도 아닌 새로운 가능성입니다.


사실 이것은 새로운 이야기가 아닙니다


Silver의 이력에 친숙한 사람들은 슈퍼러너 이 방향이 새로운 것이 아니라는 것을 알 수 있을 것입니다.


2017년의 AlphaZero는 바로 이렇게 했습니다. 바둑, 체스, 신장 세 가지 프로젝트에서 어떤 인간의 기보도 사용하지 않고 자가 대국만으로 몇 시간 안에 이전의 최강 엔진들을 모두 뚫었습니다. 2024년의 AlphaProof는 국제 수학 올림피아드에서 은메달을 획득했는데, 이도 마찬가지 방법으로 자체 생성된 형식적인 증명을 사용하여 자기 자신을 훈련했습니다.


AlphaProof 팀이 수상 후 사무실에서 "칼을 치다"


매력적으로 들립니다. 그러나 이 경로는 지난 10년 동안 거의 모든 강화 학습 실험실에서 벽에 부딪친 경험이 있습니다.


이유는 "자가 대국"이 깨끗한 환경을 필요로 한다는 것입니다. 바둑은 19×19의 바둑판과 흑백 두 가지 색의 규칙이 있으며, 체스는 여덟 줄과 명확한 승부가 있습니다. 이러한 폐쇄적인 환경에서 모델은 무엇이 "이기다"인지 명확히 알기 때문에 명확하게 최적화할 수 있습니다.


그러나 고객이 지불하도록 하는 계약서 작성, 증명되지 않은 수학적 가정을 증명, 낯선 도시에서 택시를 가져와 호텔로 돌아가는 것으로 작업을 변경하면 보상 신호를 어떻게 설정하고 환경을 어떻게 설정해야 하는지, 이러한 문제들은 10년 동안 진정으로 해결된 것이 없습니다.


Silver의 이번 베팅은 이 문제가 아직 해결되지 않았다고 공개적으로 인정하고, 그런 다음 110억 달러, 새로운 팀, 새로운 조직으로 다시 시작한다는 것입니다.


왜 지금인가요?


2026년 시장은 "인간 데이터를 읽지 않는" AI에 110억 달러를 거는 것을 원합니다. 이 답은 최근 12개월 동안 고립되지 않은 몇 가지 신호에 숨어 있습니다.


OpenAI의 o3, o4 시리즈는 점점 강화 학습 후 훈련에 의존하고 있습니다. "사고"나 "추론" 같은 능력은 더 큰 사전 훈련에서 나오는 것이 아니라 강화 학습 단계에서의 환경 상호작용에서 오는 것입니다. DeepSeek R1은 강화 학습의 소량 샘플 경로를 직접 오픈소스 템플릿으로 만들어, 일부 엔지니어링 역량을 가진 기업이 오늘날 "사고하는" 작은 모델을 복제할 수 있게 했습니다. RL은 더 이상 DeepMind 내부의 불가해로 남아 있지 않았으며, 이미 산업의 일반 상식으로 자리 잡았습니다.


더 깊은 수준은 사전 훈련 스케일링 법칙의 정점에 대한 토론이며, 2025년 하반기부터 매월 거의 새 논문이 등장합니다. 인간 언어 말뭉치의 고품질 토큰이 대부분 소진된 상황에서 모델 크기를 더 확장하면 한계이익이 뚜렷하게 감소하기 시작합니다. 자본 측면은 이미 조용히 궤도를 변경하고 있으며, 최근 반년 동안 실리콘밸리 최고의 벤처 캐피탈이 투자한 AI 대형 거래는 점점 더 강화 학습, 세계 모델, 에이전트와 같은 "사전 훈련 이후" 방향에 더 많이 투자되고 있습니다. 그리고 또 다른 LLM 공장이 아닙니다.


시장은 이미 "사전 훈련 이후 시대"를 대비하고 있습니다. 그저 그 깃발을 내리게 될 사람을 기다리고 있을 뿐입니다. Silver는 거의 해당 역할의 교과서적 해답입니다. RL 라인에서 그는 AlphaGo에 대한 공신력이 있을 뿐만 아니라, AlphaZero, AlphaProof와 같은 엔지니어링 경력, 그리고 Sutton과 합동 저술한 권한도 가지고 있습니다.


110억 달러가 투자된 바로 그것은 본질적으로 시장이 돈으로 표결하는 것입니다. 강화 학습은 기술적 접근 방식이 아니라 다음 패러다임입니다.


12개월 후, 우리는 무엇을 볼 것인가


110억 달러로는 반도체 공장을 지을 수도, 축구 클럽을 사도, 영화를 몇 편이나 제작할 수도 있습니다. 그 돈으로 인간 데이터가 필요 없는 범용 지능을 만들 수 있을까요?


아무도 모릅니다. 실버도 그렇게 말하지 않았습니다.


하지만 다음 12개월 동안 몇 가지 관찰 지점이 이미 마련되어 있습니다. 가장 직접적인 것은 Ineffable이 AlphaProof보다 어려운 "자가 학습" 벤치마크를 먼저 만들 것인가입니다. 수학 경시대회는 깨끗한 폐쇄된 환경이지만, 만약 다음 단계가 "비형식적으로 정의된 연구 수학"이라면, 난이도는 갑자기 한 단계 급상승할 것입니다. 이 문턱을 넘을 수 있느냐 없느냐는 거의 전체 이야기의 흐름을 결정할 수 있습니다.


다음으로는 석호의 움직임을 지켜보아야 합니다. 최고의 벤처 캐피탈은 시드 라운드에 투자한 뒤 A 라운드의 리듬이 프로젝트에 대한 외부 평가에 영향을 미칩니다. 12개월 내에 300억 달러 규모의 A 라운드가 나오면, 초기 성과가 예상을 뛰어넘었다는 뜻입니다. 그렇지 않을 경우 시장은 해당 가치를 다시 조정할 것입니다.


또한 DeepMind 사태도 살펴야 합니다. 실버가 떠난 후 그가 이끌던 RL 팀이 다음 논문은 어떻게 쓰고, 누가 저자로 기재되고, 누가 따라갈지는 초기 창업 기업이 "단일 스타"에서 "기관급 연구 능력"으로 나아가는 판단의 관건입니다.


마지막은 중국입니다. 이미 R1 경로를 갖춘 DeepSeek, ByteDance의 Byte 등이 있으며, 2026년 하반기에 자사의 "인간 데이터 없는" 탐색을 공개할 것인가. 이 경로가 열리면 런던 한 곳 회사에만 속할 것이 아닐 것입니다.


슈퍼러너가 가면서 찾아 갈지는 몰라도, 최소 110억 달러의 자금은 한 가지 사실을 분명히 합니다. 인간의 말을 더 자연스럽게 배우는 데에 경쟁하는 모두가 있을 때, 어떤 이들은 왜 AI가 먼저 우리로 변해야만 더 나은 존재가 될 수 있는지라는 질문을 던졌습니다.


BlockBeats 공식 커뮤니티에 참여하세요:

Telegram 구독 그룹:https://t.me/theblockbeats

Telegram 토론 그룹:https://t.me/BlockBeats_App

Twitter 공식 계정:https://twitter.com/BlockBeatsAsia

举报 오류 신고/제보
문고 선택
새 문고 추가
취소
완료
새 문고 추가
자신만 보기
공개
저장
오류 신고/제보
제출