요즘 AI에 대해 이야기하면, 사람들은 상하류 산업에 대해 이미 잘 알고 있다. 스토리지 관련주를 매매할 때는 광모듈, 소재, 장비를 살피고, 컴퓨팅 파워 관련주를 매매할 때는 엔비디아, 전력, 방열을 살핀다.
하지만 로봇에 대해 이야기하면, 대부분의 사람들은 춘절 갈라에서 두 걸음 걷는 휴머노이드 로봇 몇 대를 떠올릴 뿐, 멋지다고 느끼지만 그 외에 로봇의 상하류 산업이 무엇인지, 로봇 업계의 '차조기 잎'이 무엇인지에 대해서는 대부분 설명하지 못한다.
사실 로봇 산업에도 자체 공급망이 있으며, 점점 더 세분화된 트랙으로 분화되고 있다. 하드웨어를 만드는 사람도 있고, 모델을 만드는 사람도 있지만, 일반인이 거의 주목하지 않으면서도 로봇의 성능 상한선에 영향을 미칠 수 있는 분야가 하나 있다: 바로 데이터다. 더 정확히 말하면, 로봇에게 '실행 경험'을 생산해 주는 데이터다.
대형 모델의 부상에는 아주 단순한 전제가 있다: 인터넷에는 이미 방대한 양의 텍스트, 이미지, 코드, 비디오가 축적되어 있다는 것이다. 모델 회사들은 처음에 이 데이터를 어떻게 흡수하고, 컴퓨팅 파워를 어떻게 확장하며, 더 큰 모델을 어떻게 훈련할지를 해결해야 했다.
로봇은 다르다.
로봇에게는 자연적인 인터넷 말뭉치가 없다. 로봇 제어 학습에 직접 사용할 수 있는 궤적에는 일반적으로 관찰, 동작, 로봇 상태가 포함되며, 작업에 따라 물체 상태, 접촉 정보, 성공 조건, 작업 의미론, 제어 빈도가 포함될 수도 있다. 실제 수집은 느리고, 비싸고, 위험하며, 특정 로봇에 크게 의존한다.
그리고 이것이 바로 Axis Robotics가 탄생한 배경이다. 7월 27일, 이 Physical AI 데이터 엔진 회사는 1200만 달러의 시드 라운드 투자를 완료했다고 발표했으며, Hack VC가 주도하고 Nomad Capital, Pi Network Ventures, 10K Ventures 및 여러 엔젤 투자자가 참여했다. 이 자금이 걸린 것은 또 다른 로봇 제작 팀이 아니라, 로봇에게 '경험을 먹이는' 데 특화된 팀이다.
이러한 배경 속에서 BlockBeats는 Axis Robotics의 창립자 Chris를 인터뷰했다. Chris는 투자 및 컨설팅 업계에서 풍부한 경험을 보유하고 있다.
BlockBeats 질문: Axis를 창업하기 전에, 과거 주요 창업 및 직업 경력은 무엇인가요? 로봇, Physical AI, 로봇 데이터라는 방향에 어떻게 접하게 되었나요? 창업 기회가 있다는 것을 깨닫게 된 구체적인 계기가 있었나요?
Chris: Axis를 시작하기 전, 제 이전 창업 경험에서 이미 큰 깨달음을 얻었습니다. 데이터는 화려하지 않지만, 종종 한계를 결정하는 변수이며, 회사가 최종적으로 얼마나 높이 성장할 수 있는지를 결정합니다.
2024년 초는 저에게 꽤 중요한 시점이었습니다. 그때 AI가 매우 뜨거웠고, 모두가 모델, 파라미터, 컴퓨팅 파워에 대해 이야기하고 있었지만, 저는 점점 업계가 '모델 중심'에서 '데이터 중심'으로 전환되고 있다고 느꼈습니다. 모델이 물론 중요하지만, 모델이 계속 발전할 수 있는지를 결정하는 것은 결국 데이터인 경우가 많습니다.
저를 정말 자극한 것은 Surge AI라는 회사였습니다. 2020년에 설립되어 4년 만에 매출이 10억 달러를 돌파했고, Scale AI보다도 더 가파르게 성장했으며, 거의 자금 조달을 하지 않았습니다. 저는 그때 계속 생각했습니다. 왜 데이터 회사가 이렇게 빠르게 성장할 수 있을까? 우리는 지능 시대에서 데이터의 가치를 과소평가하고 있는 것은 아닐까?
그 시기에 저는 난양공대, 버클리, 엔비디아의 친구들과도 자주 대화하며 학계와 산업 현장에서 일어나는 변화를 들었습니다. 우리는 점차 명확한 합의를 형성했습니다. 모델의 반복은 빠르지만, 데이터는 기반이며 가장 어렵고, 가장 비표준적이며, 가장 쉽게 간과되는 층이라는 것입니다. 대규모 언어 모델의 사전 학습부터 후속 학습, 그리고 Agent가 등장한 이후 고품질 데이터에 대한 수요까지, 데이터는 중요하지 않아지는 것이 아니라 오히려 점점 더 복잡해지고 있습니다.
그래서 저는 Physical AI도 같은 길을 갈 것인지 생각하기 시작했습니다. 물리 세계는 텍스트 세계보다 훨씬 복잡합니다. 실제 환경의 변화, 센서 노이즈, 다양한 롱테일 작업, 사람마다 다른 사용 습관은 모두 데이터 수요를 배로 증가시킵니다. Physical AI가 필요로 하는 데이터 양과 후속 학습 시 오류를 수정하는 데 사용되는 시나리오는 오늘날 AI의 100배, 아니 그 이상일 수 있습니다.
하지만 당시 '누가 Physical AI 데이터를 하고 있나'라고 물어보면, 즉시 떠오르는 이름이 거의 없었습니다. 미래에 수천억 달러 규모의 회사가 탄생할 수 있는 트랙인데도, 아직 진정한 마인드 점유자가 없었습니다. 창업자에게 이 신호는 이미 분명했습니다. 창업자가 전력을 다해 뛰어들 가치가 있다는 것입니다.
그래서 2025년 여름부터 저는 NTU, UCB의 친구들과 함께 기술 로드맵과 제품 형태를 체계적으로 논의하기 시작했고, Axis Robotics도 그 단계에서 본격적으로 시작되었습니다.
BlockBeats 질문: 외부에서 로봇 업계를 이야기할 때, 보통 하드웨어와 모델을 먼저 주목합니다. 그런데 왜 Axis 팀은 데이터가 Physical AI의 이번 라운드에서 규모화된 상용화를 가장 제한할 수 있는 '보틀넥'이라고 생각하나요?
Chris:좋은 질문입니다. 대형 모델의 발전은 우리에게 아주 직접적인 시사점을 줍니다. 하나의 기술 경로가 검증된 후, 다음 단계의 능력 향상은 흔히 데이터, 연산력, 모델 규모의 공동 확대에서 비롯됩니다. GPT-1에서 GPT-3까지, 우리는 대규모 사전 학습이 뚜렷한 능력 도약을 가져올 수 있음을 확인했습니다.
하지만 로봇 산업은 현재 훨씬 더 이른 단계에 있습니다. 오늘날의 하드웨어와 알고리즘은 이미 꽤 빠르게 발전하고 있으며, 다양한 로봇 팔과 휴머노이드 로봇이 계속 등장하고 있습니다. 모델 경로도 점차 수렴하고 있습니다. 예를 들어 VLA는 비전, 언어, 로봇 동작을 연결하고, 월드 모델은 어떤 동작이 발생한 후 환경이 어떻게 변할 수 있는지를 학습하며, WAM은 미래 상태 예측과 동작 생성을 더욱 결합합니다. 이러한 방향들은 모두 연구가 진행 중입니다.
문제는 로봇이 단지 실험실에서 시연되는 것이 아니라 실제 환경에서도 제대로 작동하도록 만드는 것, 즉 언어 모델의 당시 'GPT-1 순간'에 가까운 도약에 도달하려면 훨씬 더 큰 규모의 실제 세계 상호작용 데이터가 필요하다는 점입니다.
비유하자면, 오늘날의 로봇은 교과서에서만 수영을 배운 사람과 같습니다. 이론은 모두 알지만 물에 들어가 본 적이 없는 것이죠. 실제로 수영을 할 수 있게 하려면 다양한 수영장, 다양한 수온, 다양한 파도 속에서 반복적으로 연습해야 합니다. 이러한 '물에 들어간 경험'이 바로 데이터입니다.
하지만 현재 공개 데이터의 규모는 아주 작습니다.

Open X-Embodiment는 대표적인 공개 데이터셋 중 하나로, 21개 기관, 22종의 로봇, 100만 개 이상의 궤적을 통합했지만, 많아 보여도 인터넷 수준의 데이터량과 비교하면 그마저도 턱없이 부족합니다. 다른 공개 데이터셋들은 대부분 수백 시간 수준에 머물러 있습니다.

그래서 우리는 현재 로봇 기반 모델을 막고 있는 것이 반드시 모델 구조 자체는 아니라고 판단합니다. 오히려 데이터의 규모와 다양성이 훨씬 뒤처져 있는 것이 문제입니다. 충분한 양의 교차 시나리오, 교차 산업의 실제 데이터가 없다면 아무리 좋은 모델과 하드웨어도 실험실 안에서만 맴돌 뿐입니다. 데이터는 이 단계에서 단순한 부가 요소가 아니라 Physical AI가 변곡점을 넘을 수 있는지를 결정하는 핵심 변수입니다.
BlockBeats 질문: 가장 간단하고, 가장 직설적이고, 가장 빙 돌리지 않는 방법으로 일반인에게 Axis가 무엇을 하는 회사인지 설명해 주실 수 있나요?
Chris: 가장 직설적으로 말하면, Axis는 로봇이 계속해서 '실전 경험'을 쌓도록 돕는 역할을 합니다.
로봇을 막 입사한 인턴이라고 상상해 보세요. 머리는 나쁘지 않지만 아무것도 해본 적이 없습니다. 이걸 숙련된 인력으로 만들려면, 조작 매뉴얼만 보여주는 걸로는 부족합니다. 직접 일을 시켜보고, 실수를 하면 누군가가 고쳐주고, 다시 시도하고, 반복해서 연습해야 합니다. 우리가 하는 일은 바로 이런 경험을 체계적으로 생산하는 것입니다.
훈련 전 준비, 작업 설계, 시뮬레이션 연습부터 실제 세계 데이터 수집, 데이터 정제, 모델 훈련 후 오류 수정 및 지속적 최적화까지, 전체 파이프라인을 모두 구축했습니다. 또한 웹 기반 시뮬레이션 플랫폼과 모바일 수집 도구를 만들어 일반인도 참여할 수 있게 했습니다. 집에서 옷을 개거나 책상을 정리하는 일상적인 동작도 로봇의 학습 자료가 될 수 있습니다.
한 문장으로 요약하면: Axis는 Physical AI에 훈련 데이터를 지속적으로 공급하고 오류 수정도 지속적으로 돕는 데이터 엔진으로, 로봇이 더 빠르게 배우고 실수를 줄이게 만듭니다.
BlockBeats 질문: 현재의 임베디드 인텔리전스 데이터 격차에 대한 궁극적인 해결책은 무엇이라고 생각하나요? 1인칭 시점 데이터, 원격 조작 데이터, 시뮬레이션 데이터 중 어떤 것이 더 나은가요?
Chris: 오늘날 업계의 가장 큰 난제는 데이터 규모, 시나리오 다양성, 실제 물리적 정합성이라는 세 가지를 동시에 달성하기 어렵다는 점입니다. 소위 실제 물리적 정합성이라는 것은 데이터 속 동작 규칙이 실제 세계와 일치해야 한다는 뜻입니다. 가상 환경에서 능숙하게 연습했다고 해서 실제 로봇에 적용하면 '손이 어색해지는' 상황이 생기면 안 됩니다.
비유를 들어보겠습니다. 시뮬레이션 원격 조작 데이터는 운전 학원의 시뮬레이터에서 연습하는 것과 같습니다. 진입 장벽이 낮아 실제 차량이 필요 없고, 전 세계 사람들이 웹을 통해 원격으로 가상 로봇을 조작해 대량의 훈련 데이터를 생산할 수 있습니다. 우리는 로봇 형태, 객체, 시나리오, 작업을 무작위로 조합해 다양성을 빠르게 확장할 수 있습니다. 단점도 분명합니다. 아무리 좋은 시뮬레이터라도 실제 도로 상황과는 다릅니다. 현실의 요철, 돌발 상황, 불규칙한 노면은 시뮬레이터가 완벽히 재현하기 어렵습니다. 모델이 가상 환경에서 배웠더라도 실제 로봇에서는 제대로 작동하지 않을 수 있습니다. 이것이 바로 사람들이 말하는 '가상과 실제의 차이'입니다.
1인칭 시점의 실제 인간 데이터는 베테랑 운전자에게 블랙박스를 장착하는 것과 같습니다. 일반인이 스마트폰으로 집이나 사무실에서 실제 작업을 촬영할 수 있고, 영상에는 시각적·언어적 정보가 포함되어 있어 모델이 인간이 실제로 어떻게 일하는지 이해하는 데 도움이 됩니다. 하지만 단점은 영상에 로봇의 정밀한 관절 데이터가 없어서 정밀 동작을 직접 훈련하기에는 부족하다는 점입니다.
실제 로봇 원격 조작 데이터는 실제 도로에서 운전 연습을 하는 것과 같습니다. 궤적 정밀도가 가장 높고 실제 물리적 상호작용에 가장 가깝습니다. 특히 모델이 스스로 조작에 실패한 후 사람이 개입해 교정하며 남긴 궤적은 모델 개선에 특히 가치가 있습니다. 하지만 비용도 가장 높아서 실제 로봇과 인력이 필요하고 생산 능력에 한계가 있어 무한정 확장할 수 없습니다.

Axis 실제 배포 스타일
그래서 답은 어느 것이 더 나은가가 아니라, 세 가지 데이터가 각자의 역할을 한다는 것입니다. 시뮬레이션은 규모를 확장하고, 1인칭 시점 데이터는 모델이 실제 세계의 상식을 이해하도록 돕고, 실제 로봇 원격 조작은 정밀도 보정과 폐쇄 루프 오류 수정을 담당합니다. 세 가지 데이터를 동일한 시스템에 통합해야만 이 격차를 실제로 메울 수 있습니다.
이것이 우리가 '혼합 데이터 소스, 양방향 폐쇄 루프 엔진'을 만든 이유이기도 합니다. 우리는 시뮬레이션 원격 조작 데이터와 1인칭 실제 인간 데이터를 이중 공급으로 활용하고, Human-Gated DAgger를 결합합니다. 그 방식은 매우 직접적입니다. 모델이 실패하면 사람이 개입해 교정하고, 교정 결과를 다시 훈련에 보냅니다. 이렇게 데이터는 수집, 정제, 증강을 거쳐 통합된 시각, 언어, 행동 모델 훈련에 들어가고, 가상·실제 배포, 실패 피드백 회수, 데이터 보충으로 이어지며 스스로 앞으로 나아가는 순환을 형성합니다.
BlockBeats 질문: Axis는 처음에 왜 시뮬레이션 데이터부터 시작했으며, 지금은 1인칭 시점 데이터를 구축하기 시작했나요? 전략적 방향에 변화가 있는 것인가요?
Chris: 이것은 동일한 데이터 전략의 확장입니다. Physical AI는 반드시 데이터 기반이며, 데이터의 핵심 지표는 양이 아니라 다양성입니다. 다양성이 일반화 능력과 견고성을 결정하기 때문입니다. 우리가 먼저 시뮬레이션을 한 이유는 통제 가능하고, 반복 가능하며, 평가하기 쉽기 때문입니다. 작업을 설계하고, 시나리오와 로봇 형태를 조정할 수 있으며, 수집 완료 후에는 재생, 검증, 훈련, 테스트가 가능합니다. 그것 자체가 하나의 '세계 모델'과 같으며, 현실 세계의 가상화입니다.
1인칭 시점 데이터는 실제 세계의 폭을 보완할 수 있습니다. 최근 DreamDojo를 포함한 연구들은 대규모 1인칭 비디오가 인간 행동과 세계 법칙을 학습하는 데 있어 큰 잠재력을 지니고 있음을 업계에 다시 한번 보여주었습니다. 이러한 데이터는 사람들이 도구를 사용하고, 물체를 다루고, 작업을 완료하는 방식을 기록하며, 이러한 행동은 서로 다른 국가, 산업, 생활 시나리오에 분산되어 있어 소수의 연구실만으로는 커버하기 어렵습니다.
시뮬레이션 데이터는 소수의 플랫폼이 집중 생산하기 쉽지만, 1인칭 시점 데이터는 본질적으로 분산되어 있어 전 세계 기여자들의 공동 참여가 필요합니다. NVIDIA, DeepMind 등 선두 모델 기업들이 이러한 데이터에 대한 수요를 늘리면서, 전 세계적으로 1인칭 시점 데이터를 지속적으로 수집, 처리, 검증할 수 있는 능력이 중요한 역량이 될 것입니다.
더 중요한 것은, Axis에게 있어 기여자 네트워크, 작업 분배, 데이터 처리 및 검증 파이프라인은 재사용이 가능하다는 점입니다. 시뮬레이션에서 1인칭 시점 데이터로 확장하는 것은 방향을 바꾸는 것이 아니라, 더 완전한 로봇 데이터 인프라를 구축하는 것입니다.
BlockBeats 질문: Axis에서 임베디드 지능 데이터 수집, 가공, 훈련의 전체 과정을 안내해 주실 수 있나요?
Chris: Axis에서 데이터 수집과 처리는 단편적으로 분리되어 있지 않습니다. 전체 프로세스는 엔드투엔드 폐쇄 루프로 구성됩니다. 최근 출시된 Axis V2는 우리에게 매우 중요한 업그레이드입니다. 이전에는 Axis가 단방향 데이터 수집 스테이션에 가까웠다면, 이제는 작업 생성, 데이터 수집, 모델 훈련, 평가 최적화를 모두 하나의 시스템으로 연결했습니다.

첫 번째 단계는 문제 출제입니다. 시뮬레이션 환경에서 알고리즘을 사용해 로봇 본체, 대상 객체, 위치, 시각 조건 등의 변수를 조합합니다. 예를 들어 10가지 동작, 10가지 객체, 10가지 배치 방식을 조합하면 작업의 다양성은 기하급수적으로 빠르게 확대될 수 있습니다.
두 번째 단계는 문제 풀이입니다. 전 세계 기여자는 간단한 웹 또는 모바일 인터페이스를 통해 시뮬레이션 작업을 완료할 수 있으며, 모바일 1인칭 시점 애플리케이션을 사용해 실제 세계의 조작 과정을 수집할 수도 있습니다.
세 번째 단계는 채점 및 가공으로, 가장 핵심적인 단계입니다. 원시 데이터에는 종종 떨림, 무효 동작, 부자연스러운 조작이 포함되어 있어 먼저 정제, 평활화, 리샘플링을 수행합니다. 그런 다음 RoboVerse를 활용해 동일한 데이터 배치를 서로 다른 시뮬레이션 환경 간에 전환합니다. 먼저 경량 웹에서 수집한 시뮬레이션 데이터를 Isaac Sim으로 마이그레이션하여 재생 및 데이터 증강을 수행하고, 재생하면서 장면 재질, 조명, 카메라 각도, 물리 파라미터를 변경합니다. 마치 동일한 레시피로 다른 냄비, 다른 불, 다른 재료로 다시 요리하는 것과 같아서, 하나의 원시 데이터에서 많은 훈련 샘플을 확장할 수 있습니다.

가공이 끝났다고 해서 바로 대형 모델에 무작정 투입하는 것은 아닙니다. 성공 조건 검사, 이상 필터링, 형식 통일을 거쳐야 모델 훈련에 들어갈 수 있습니다. 한 차례 훈련이 완료되면 모델이 시뮬레이션 및 평가 환경에서 작업을 수행하도록 하고, 어떤 시나리오와 상태에서 실패하기 쉬운지 관찰한 다음, 이러한 취약점을 새로운 맞춤형 수집 작업으로 전환합니다.
모델이 먼저 자율적으로 작업을 수행하고, 올바른 경로에서 벗어나면 기여자가 개입하여 교정 동작을 제공합니다. 이러한 교정 데이터는 다시 훈련에 투입되어 모델이 원래 처리하지 못했던 상황을 점차 학습하게 됩니다. 이 플라이휠이 계속 돌면서 데이터, 모델, 로봇의 역량이 함께向上합니다.
따라서 V2의 의미는 단순히 기능이 몇 개 추가된 것이 아니라, Axis를 '데이터 수집 도구'에서 '모델을 더 똑똑하게 만드는 완전한 시스템'으로 전환시킨 것입니다.
BlockBeats 질문: Axis가 최근 Dataset V1을 출시했습니다. 이 데이터셋이 왜 중요한가요? 구체적으로 무엇을 입증했나요?
Chris: Dataset V1의 가장 중요한 점은 단순히 데이터가一批 추가된 것이 아니라, 한 가지 사실을初步적으로 검증했다는 것입니다: 다수의 일반 기여자로부터 수집한 시뮬레이션 조작 데이터가 작업 설계, 성공 검사, 필터링, 평활화, 데이터 증강을 거치면 로봇 사전 훈련에 유용한 신호가 될 수 있다는 점입니다.
V1은 207개의 조작 작업, 5만 개 이상의 궤적, 6만 개 이상의 작업 및 시나리오 변형을 포함합니다. 공개된 LIBERO-Plus 평가에서 전체 AXIS 데이터로 사전 훈련을 계속한 결과, π0.5의 전체 성공률이 83.9에서 88.8로 4.9% 포인트 상승했습니다. 동일한 데이터량의 RoboCasa 대조군은 57.5였습니다. 이는 최소한 이 평가 조건에서 모델 개선이 단순히 개별 데이터 수에만 의존하는 것이 아니라 작업, 시나리오, 시점, 교란 조건의 다양성과 더 관련이 있음을 시사합니다.
올해 우리는 Dataset V2를 출시할 예정이며, 규모를 더 확대하고 더 다양한 로봇 형태, 작업, 시나리오를 포함할 것입니다.
BlockBeats 질문: Axis는 데이터 하나의 가치를 어떻게 판단하나요? 평가 기준은 대략 무엇인가요?
Chris: 우리는 단순히 데이터가 '수집되었는지'만 보지 않고, 연속적으로 몇 가지 질문을 던집니다: 깨끗한가? 새로운 것을 가져왔는가? 실제 세계에서 쓸모가 있는가? 모델의 진짜 약점을 보완하는 데 도움이 되었는가?
첫 번째 관문은 사용 가능 여부입니다. 조작이 끝까지 완료되었는가? 중간에 멈추거나 연결이 끊기지 않았는가? 동작 재생이 재현 가능한가? 장치 지연, 조작 드리프트, 물체가 관통하는 등 물리 법칙에 어긋나는 상황이 없는가? 우리는 이 데이터로 경량 모델을 훈련시켜 빠른 검사를 수행하며, 이 관문조차 통과하지 못하면 해당 데이터는 훈련 풀에 들어가지 않습니다.
두 번째 관문은 새로운 정보가 있는지 확인하는 것입니다. 로봇이 가장 두려워하는 것은 이미 풀 줄 아는 문제를 반복해서 푸는 것입니다. 우리는 이 궤적의 장면, 객체, 상호작용 방식이 기존 데이터와 얼마나 다른지 살펴봅니다. 드문 장면 배치, 특수 재질, 흔치 않은 조작 방식이 나타나면 가치가 높습니다. 대량으로 반복되는 '집고 내려놓기'도 물론 유용하지만, 주로 기본 수치를 채우는 데 기여합니다. 진정으로 집중 투자할 가치가 있는 것은 여러 객체가 서로를 가리고 연속적으로 여러 단계를 거쳐야 완료되는 복합 작업입니다. 이런 데이터만이 모델이 유추 능력을 키우도록 강제할 수 있습니다.
세 번째 관문은 시뮬레이션에서 현실로 전환할 수 있는지 확인하는 것입니다. 시뮬레이션 데이터는 많을수록 좋은 것이 아니라, 실제 세계의 변화를 고려했는지가 핵심입니다. 조명이 바뀌면 괜찮은가? 재질이 변하면? 마찰력이 달라지면? 카메라 각도가 기울어지면? 이러한 변수의 교란이 충분할수록 모델이 실제 기기에 적용되었을 때 '빛을 보자마자 죽는' 상황이 발생할 가능성이 낮아집니다. 만약 시뮬레이션 데이터가 항상 동일한 이상적인 조건에서 발생한다면, 그것은 기초 사전 학습용 바닥재료에 불과하며 실제 세계로의 전이 가치는 매우 제한적입니다.
마지막으로 장기 반복 개발에 대한 기여도를 확인합니다. 모델이 실제 기기에서 실패했을 때, 사람이 개입하여 교정한 그 짧은 궤적은 특히 가치가 높습니다. 그것은 모델이 정확히 어디를 못하는지 정밀하게 알려주기 때문입니다. 새로운 작업, 새로운 기종에서 나온 완전히 새로운 궤적도 마찬가지로 모델이 능력 경계를 빠르게 확장하는 데 도움을 줍니다. 반대로, 어떤 간단한 작업을 모델이 이미 안정적으로 수행한다면 유사한 데이터를 더 쌓아도 수익은 감소합니다.
그래서 좋은 데이터는 단순히 '형식이 올바른' 것만이 아닙니다. 그것은 깨끗하고, 새로움이 있으며, 실제 세계에 적용될 수 있고, 모델이 계속 발전하도록 이끌어야 합니다. 우리는 제한된 수집 자원을 진정으로 로봇을 더 똑똑하게 만드는 데이터에 사용하기를 원합니다.
BlockBeats 질문: Axis가 로봇 회사라면 왜 블록체인 기술이 필요한가요? Axis는 Base 체인을 선택했는데, 구체적인 이유를 설명해 주실 수 있나요?
Chris: 이것은 매우 날카롭고 중요한 질문입니다. 우리의 논리는 간단합니다. Axis는 먼저 Physical AI의 데이터 병목 현상을 해결하고 있으며, 이를 위해서는 전 세계의 많은 일반 기여자들의 참여가 필요합니다. 블록체인 기술은 주인공이 아니라, 추적, 검증, 인센티브, 배분을 위한 효율적인 기반 도구에 가깝습니다.
대규모 언어 모델 시대에 훈련 데이터는 상당 부분 '블랙박스'입니다. 데이터가 어디서 왔는지, 어떻게 처리되는지, 기여자의 가치가 어떻게 확인되는지 외부에서 파악하기 어렵습니다. 그러나 Physical AI는 로봇이 실제 세계에서 수행하는 동작과 직접적으로 연결되며, 데이터 품질은 안전성에 영향을 미치므로 이러한 블랙박스는 단순히 받아들여질 수 없습니다.
우리는 Physical AI의 일부 데이터 생산 과정을 Base에 올리기로 한 것은 이 작업을 더 투명하게 만들고자 함입니다. Base는 이더리움 위에 구축된 저비용 블록체인 네트워크입니다. 구체적으로, 작업 번호, 데이터 궤적 번호, 사용자 번호 및 이들 간의 연관 관계가 모두 기록됩니다. 이렇게 하면 모든 동작 궤적과 모든 기여자를 추적하고 감사할 수 있으며, 그에 상응하는 인센티브도 받을 수 있습니다.
또한, 우리는 커뮤니티 범위가 넓고 참여门槛이 낮은 네트워크가 필요합니다. Base의 커뮤니티는 매우 글로벌화되어 있고, Base 체인은 사용 비용이 낮고 거래 확인이 빠르며, 기여 기록과 인센티브 지급에도 용이합니다.
더 중요한 것은, 우리가 보상하는 것은 단순한 수량이 아니라 고품질 기여입니다. 로봇 모델에게 쓰레기 데이터는 쓸모없을 뿐만 아니라 오히려 해로울 수 있습니다. 우리는 이중 평가와 포인트 시스템을 통해 어떤 데이터가 실제로 모델에 도움이 되었는지 판단하며, 기여가 좋을수록 평가가 높고 보상도 많아집니다. Base 체인의 효율성과 저비용은 우리의 이러한 고빈도, 소액 인센티브 글로벌 협업 요구에 완벽하게 부합합니다.
BlockBeats 질문: Axis의 현재 상업화 경로는 무엇인가요? 로봇 데이터 수집, 모델 훈련 및 실제 배포를 중심으로 고객에게 주로 어떤 제품이나 서비스를 제공하나요? 기존 고객들은 이 모델에 대해 어떤 피드백을 주었나요?
Chris: 우리의 상업화 경로는 비교적 명확하며, 핵심은 세 가지 유형의 고객을 대상으로 각자의 문제에 맞는 엔드투엔드 솔루션을 제공하는 것입니다.
첫 번째 유형은 로봇 하드웨어 및 임베디드(具身) 기업, 예를 들어 Booster Robotics, Feagine Robotics, AgiBot입니다. 이들은 자체 하드웨어를 보유하고 있지만, 운영 능력을 보완하기 위해 더 맞춤화된 데이터와 직접 배포 가능한 모델이 필요한 경우가 많습니다. 우리는 작업 설계부터 시작하여 데이터 수집, 모델 훈련 및 배포를 지원하고, 하위 고객에게도 데이터 솔루션을 제공합니다.
두 번째 유형은 비전-언어-행동 모델 또는 세계 모델을 만드는 모델 기업, 예를 들어 Manycore Tech와 SomaStacks입니다. 세계 모델의 역할은 기계가 환경이 어떻게 변화하는지 이해하도록 하는 것입니다. 이들은 범용 모델을 훈련하기 위해 대량의 고품질 운영 데이터가 필요하며, 우리는 고품질 작업 세트와 데이터 세트를 제공하고 공동 훈련도 함께 진행할 수 있습니다.
세 번째 유형은 수직 산업 기업, 예를 들어 로터스(Lotus)와 지리자동차(Geely)입니다. 이들은 모델이 얼마나 고도화되었는지보다는 로봇을 실제로 생산 라인에 어떻게 적용할지에 더 관심이 있기 때문에, 우리는 머신러닝 방법론을 기반으로 한 엔드투엔드 자동화 솔루션을 제공합니다.
우리는 시스템 역량을 중요하게 생각하기 때문에, 단순히 데이터 패키지 하나를 전달하는 데 그치지 않습니다. 고객이 무엇을 필요로 하는지, 내부 역량의 경계가 어디까지인지를 파악하면 그에 맞게 조정할 수 있습니다. 데이터를 제공할 수도 있고, 데이터 기반 솔루션까지 함께 전달할 수도 있습니다. 이를 통해 고객 서비스 경쟁력을 높일 수 있을 뿐만 아니라, 고객의 효율성과 품질 향상에도 더 직접적으로 기여할 수 있습니다.
BlockBeats 질문: Axis의 파트너와 고객은 어떤 곳들인가요? 다양한 고객들이 Axis를 찾아올 때, 그들의 요구는 일반적으로 무엇인가요?
Chris: 아까 언급한 몇몇 유형의 기업들이 우리의 대표적인 고객입니다. 그들은 겉으로는 모두 "데이터가 부족하다"고 말하지만, 실제로 부족한 것은 서로 다릅니다.
예를 들어, 한 하드웨어 제조업체는 아주 훌륭한 로봇 팔을 막 개발했을 수 있습니다. 그런데 고객 현장에 가면 조명이 바뀌거나 물건 배치가 달라지기만 해도 로봇이 정확히 잡지 못합니다. 그들이 Axis를 찾는 진짜 이유는 "어떻게 하면 로봇이 더 다양한 환경에서 안정적으로 작동할 수 있을까"를 해결하기 위해서입니다.
우리가 그들에게 제공하는 것은 지저분한 영상 더미가 아니라, 다차원적 다양성 생성, 정제, 의미론적 주석을 거친 구조화된 데이터입니다. 필요할 때는 전략 학습을 직접 도와주기도 합니다. 최종적으로 전달하는 결과물은 그들의 하드웨어가 비구조적 환경에서 더 안정적이고 일반화 능력을 갖추도록 하는 것입니다.
BlockBeats 질문: 플랫폼 출시 이후, 아직 공개되지 않은 실제 운영 데이터를 공유해 주실 수 있나요? 예를 들어 유효 등록 기여자 수, 작업 게시 수, 누적 트레이스, 그리고 고품질 사용자의 활동 및 기여 현황 같은 것들입니다.
Chris: 플랫폼 출시 이후 15주 동안 누적 등록 기여자는 8만 명을 넘었습니다. 이 수치는 봇 계정 등 무효 주소를 제외한 실제 유효 데이터입니다. 우리는 사전 학습용 머신러닝 작업 1,600개를 게시했고, 누적 200만 개 이상의 데이터 트레이스를 수집했습니다. 이를 환산하면 약 3,500시간 분량의 고품질 데이터입니다.
하지만 우리가 더 중요하게 보는 것은 사용자 품질과 충성도입니다. 현재 고품질 기여자는 약 2만 명으로, 전체의 약 30%를 차지합니다. 지난 30일 동안 이들 중 7,800명이 활발히 활동했고, 지난 7일 동안은 5,300명이 활동했습니다. 주간 활성 사용자와 월간 활성 사용자의 비율은 68%에 달합니다. 이들은 지난 30일과 지난 7일 동안 각각 68만 개와 16만 개의 트레이스를 기여했습니다.
이러한 활성도와 참여 깊이는 "훈련이 곧 기여이고, 기여는 보상을 받는다"는 모델에 대한 사용자들의 관심을 보여줍니다. 또한 우리 커뮤니티가 비교적 성숙하고 안정적인 로봇 지능 기여자 네트워크로 형성되고 있음을 시사합니다.
BlockBeats 질문: 지난 2년간 휴머노이드 로봇, VLA, Physical AI가 모두 뜨거웠지만, 대부분의 일반인은 아직 실제로 로봇을 사용하지 못하고 있습니다. 로봇이 대규모로 폭발적으로 보급되기까지 얼마나 걸릴까요? 진정한 전환점은 무엇일까요—하드웨어 비용 하락, 모델 능력의 도약, 아니면 데이터 인프라의 성숙일까요?
Chris: 우리는 진정한 전환점이 데이터 인프라의 성숙이라고 생각합니다.
하드웨어 비용은 이미 빠르게 하락하고 있습니다. 중국 공급망의 강점 덕분에 로봇 제조 비용은 더 이상 넘을 수 없는 장벽이 아닙니다. 하지만 일반인이 아직 로봇을 대규모로 사용하지 못하는 핵심 이유는 로봇이 충분히 똑똑하지 않기 때문입니다. 로봇은 실제 세계의 물리 법칙과 인간의 의도에 대한 상식적인 이해가 부족합니다.
이는 마치 저렴한 차를 가지고 있지만 운전면허가 없고 도로에 나가 본 적이 없는 것과 같습니다—하드웨어와 알고리즘만 있고 충분한 '도로 경험'이 없다면 차를 잘 몰 수 없습니다. 오늘날 웹페이지를 크롤링하듯이 물리 세계의 상호작용 데이터를 저비용으로 대규모로 확보하고, 이를 모델이 소화할 수 있는 양분으로 만들 수 있을 때, 로봇은 진정으로 폭발할 것입니다.
우리는 이 전환점이 점점 가까워지고 있다고 생각하며, Axis가 하고자 하는 것은 이를 한 발 더 앞당기는 것입니다.
BlockBeats 질문: 로봇 산업에서 대형 모델 기업과 완제품 기업은 미래에 자체 데이터 구축에 나설 가능성이 높습니다. 이러한 데이터 자체 구축 팀과 Axis의 현재 동종 업계 경쟁사들을 상대로, Axis의 장기적 해자(moat)는 무엇인가요? 기여자 네트워크, 작업 생성 능력, 데이터 품질 관리, 고객 시나리오, 아니면 폐쇄 루프 훈련 효과인가요?
Chris: 이것은 매우 중요하고 현실적인 질문입니다. 대형 모델 기업과 완제품 제조사는 미래에 반드시 자체 데이터 팀을 구축할 것이며, 이는 산업 발전의 필연적 결과에 가깝습니다. 하지만 진정한 경쟁은 누가 데이터를 직접 수집할 수 있느냐가 아니라, 누가 교차 시나리오를 아우르고 확장 가능하며 지속적으로 최적화할 수 있는 데이터 인프라를 구축하느냐입니다.
단기적으로는 데이터 커버리지와 다양성에서 경쟁하고, 중기적으로는 데이터를 모델 능력으로 전환하는 효율성에서 경쟁하며, 장기적으로는 고객의 지능형 생산 시스템에 진정으로 통합되어 쉽게 대체되지 않는 일부가 되는 것이 핵심입니다.
Axis의 해자는 단일 포인트에만 의존하지 않습니다—예를 들어 기여자 네트워크, 수집 효율성, 또는 데이터 처리 능력 같은 것들입니다. 단일 포인트 능력은 복제될 수 있습니다. 우리는 이러한 능력들을 하나의 지속적으로 강화되는 폐쇄 루프로 연결하고, 이를 고객의 훈련 프로세스에 점진적으로 통합하는 데 더 중점을 둡니다.
고객 입장에서 Axis에 접속하는 것은 가벼워야 합니다. 복잡한 라이선스가 필요 없고, 빠르게 작업을 게시하고 데이터를 얻을 수 있어야 합니다. 하지만 고객이 우리의 시뮬레이션 자산 체계, 분산 수집 네트워크, 모델 오류 수정 루프를 사용하기 시작하면, 양측의 훈련 프로세스는 점차 결합됩니다. 우리를 교체하려면 고객은 단순히 데이터 공급업체를 바꾸는 것이 아니라, 시뮬레이션 인프라를 다시 구축하고, 기여자 네트워크, 데이터 처리 파이프라인, 사후 훈련 오류 수정 프로세스를 재건해야 합니다. 우리의 해자(moat)는 폐쇄성이 아니라 이러한 구조적 임베딩입니다.
우리는 또한 모델과 함께 진화하는 능력을 특히 중요하게 생각합니다. 단순히 데이터만 판다면 언제든 대체될 수 있습니다. 하지만 우리가 지속적으로 모델의 약점을 발견하고, 맞춤형 작업을 설계하며, 사후 훈련용 오류 수정 데이터를 제공하고, 실제로 고객의 성공률과 견고성을 향상시킨다면, 우리는 모델 최적화 루프의 일부가 됩니다. 그때 우리와 고객의 관계는 더 이상 공급업체와 구매자가 아니라, 공동 구축자에 가깝습니다.
향후 18개월 동안 업계는 대규모·고커버리지 데이터가 크게 부족할 것이며, 데이터 양과 다양성이 여전히 핵심입니다. 그 이후 3년 동안은 특정 도메인, 특정 시나리오의 전문 데이터가 더 필요할 것입니다. 우리가 진정으로 축적하려는 자산은 특정 유형의 데이터가 아니라, 프로그래밍 가능한 작업 생성 시스템, 조정 가능한 분산 기여 네트워크, 지속적으로 최적화되는 훈련 루프입니다. 이는 수평적으로 더 많은 산업으로 확장할 수 있을 뿐만 아니라, 수직적으로 하나의 특정 분야에 깊이 들어갈 수 있습니다.
한 문장으로 요약하면, 단기적으로는 규모로 승부하고, 중기적으로는 효율로 승부하며, 장기적으로는 임베딩으로 승부합니다. Axis의 목표는 Physical AI 지능 생산 체계의 일부가 되는 것이지, 쉽게 대체될 수 있는 데이터 공급업체가 되는 것이 아닙니다.
BlockBeats 질문: 투자 이후 6~12개월 동안 Axis의 가장 주요한 임무와 목표는 무엇인가요? 데이터 규모를 계속 확대하고, 더 많은 실제 로봇 작업을 검증하며, 더 많은 유료 고객을 확보하는 것인가요? 1년 후 돌아봤을 때, 외부에서 Axis를 어떤 키워드로 설명하길 바라시나요?
Chris: 향후 6~12개월 동안 우리는 제품, 생태계, 상업화를 동시에 추진할 것입니다.
제품 측면에서 V2는 우리를 단방향 수집 플랫폼에서 완전한 훈련 루프로 발전시켰습니다. 이제 해야 할 일은 이 시스템을 실제로 가동하고 규모를 확장하는 것입니다. 9월에는 1인칭 시점 데이터 수집 파이프라인을 더 확장할 예정이며, 현재 수만 시간의 데이터를 축적했고 북미 최첨단 모델 연구소와 수요를 맞추고 있습니다. 10월 전후로 데이터셋 V2 버전을 출시할 계획이며, 더 많은 로봇 형태와 원자적 능력을 포함할 것입니다. 연말 이전에는 최초의 대규모 Human-Gated DAgger 사후 훈련 데이터셋을 출시할 예정입니다.
생태계 측면에서 우리는 글로벌 네트워크를 계속 확장하여 라틴아메리카와 유럽 시장에 진출할 것입니다. 향후 6~12개월 내에 1인칭 시점 데이터의 안정적인 일일 생산량을 500시간 이상으로 유지하고, 시뮬레이션 데이터의 일일 생산량을 50시간 이상으로 끌어올리며, DAgger 후속 훈련 데이터의 생산 능력을 점진적으로 확대하고자 합니다.
상업화 측면에서 우리의 목표는 연말까지 2~3개의 새로운 유료 파일럿 프로젝트를 완료하고, 내년 초에는 기초 모델 기업의 우수 공급업체 명단에 진입하는 것입니다.
1년 후 돌아봤을 때, 우리는 모두가 Axis를 '규모, 다양성, 폐쇄 루프'라는 세 가지 단어로 설명하길 바랍니다. 규모는 우리가 지속적으로 업계 수준의 데이터 공급을 제공할 수 있다는 것이고, 다양성은 우리가 실제 세계의 복잡성을 진정으로 포괄한다는 것이며, 폐쇄 루프는 우리가 단순히 데이터를 생성하는 데 그치지 않고 모델의 약점을 중심으로 지속적으로 최적화한다는 것입니다.
더 중요한 것은, 업계가 Axis를 언급할 때 "로봇 모델의 진화를 더 빠르게 만드는 시스템"이라고 말하길 바란다는 점입니다. 우리가 해결하는 것은 단순한 데이터 수량 문제가 아니라 모델 진화의 효율성 문제입니다. 고객이 Axis를 도입한 후 모델 반복이 더 빠르고, 성공률이 더 높으며, 시나리오 커버리지가 더 넓어진다면, 그것이 바로 우리의 가치입니다.
BlockBeats 공식 커뮤니티에 참여하세요:
Telegram 구독 그룹:https://t.me/theblockbeats
Telegram 토론 그룹:https://t.me/BlockBeats_App
Twitter 공식 계정:https://twitter.com/BlockBeatsAsia