AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

오픈AI가 투자한 110억 달러 가치의 법률 AI 유니콘 기업이, 중국 오픈소스 모델을 '랩핑'하기 시작했다.

이 글을 읽으려면 30 분
모델 회사의 또 다른 사업.
원문 제목: 《OpenAI가 투자한 110억 달러 가치의 법률 AI 유니콘, 중국 오픈소스 모델을 '셸'로 사용하기 시작》
원문 저자: 동파차이징(动察Beating)


8월 20일, OpenAI가 투자한 법률 AI 기업 Harvey가 Tenet을 공개했다. 2022년에 설립된 이 회사는 현재 기업가치 110억 달러로, 전 세계에서 가장 높은 가치를 인정받는 법률 AI 기업이다. 수천 개 기관에 서비스를 제공하며, 주주 명단에는 세쿼이아(Sequoia), a16z, GIC도 포함되어 있다.


Tenet은 Harvey의 첫 번째 자체 모델로, 기반은 월지킹면(Moonshot AI)이 7월에 가중치를 공개한 Kimi K3를 사용한다. Tenet은 현재 연구 미리보기 단계에 있으며, Harvey는 검증된 기능을 점진적으로 제품에 반영할 계획이다.


Harvey의 공동 창업자 윈스턴 와인버그(Winston Weinberg)는 원래 O'Melveny & Myers의 소송 변호사였고, 가브 페레이라(Gabe Pereyra)는 Google Brain과 Meta에서 대규모 모델 연구를 담당했다. OpenAI는 초기부터 투자했으며, 이후 양측은 함께 판례법 모델을 훈련해 약 100억 토큰의 미국 판례법 데이터를 학습에 포함시켰다. OpenAI가 당시 공개한 고객 사례에서 페레이라는 Harvey가 다양한 방안을 평가한 끝에 OpenAI와의 맞춤형 훈련만을 신뢰했다고 밝혔다.


지난 몇 년 동안 Harvey는 거의 항상 폐쇄형 모델이 전문 서비스 업계에서 가장 대표적인 고객이었으며, 전 세계에서 가장 강력한 폐쇄형 모델들을 지속적으로 활용해 왔다. 그러나 처음으로 자체 법률 업무, 변호사의 평가 기준, 두 달간의 컴퓨팅 자원을 실제 가중치에 반영하기로 결정했을 때, 선택한 기반 모델은 중국의 오픈 가중치 모델이었다.


모델이 출시되면 업계는 곧 두 가지를 알게 된다. 얼마나 똑똑한지, 그리고 그 능력이 얼마에 팔리는지. 몇 시간 안에 벤치마크 테스트가 업데이트되고, Arena 순위가 변하며, 다양한 지능과 가격의 좌표 그래프가 유포된다. 몇 달간 훈련하고 막대한 컴퓨팅 자원을 소모한 모델이 결국 그래프 위의 한 점으로 압축된다.


대부분의 개발자에게 이 방법은 여전히 유효하다. 그 배경에는 모델이 사용자에게 전달될 때 능력이 이미 기본적으로 고정되어 있다는 전제가 있다. 폐쇄형 API가 주류일 때 이 전제는 성립했다. 모델 기업이 사전 훈련과 사후 훈련을 완료한 뒤 능력을 API로 캡슐화한다. 하류 기업은 프롬프트를 수정하고, 검색을 수행하고, 에이전트를 구축할 수 있지만, 모델 자체를 변경하기는 어렵다.


오픈 가중치는 이 전제를 깨뜨렸다. 기업은 가중치를 확보한 후 자체 데이터와 전문가 피드백을 계속 넣어 실제 작업과 평가 기준을 훈련에 반영할 수 있다. 출시 시점에 동일하게 90점을 받은 두 모델이 같은 데이터와 컴퓨팅 자원으로 훈련을 계속하면, 하나는 91점에 머물고 다른 하나는 97점에 도달할 수 있다. 몇 달간의 시간, 컴퓨팅 자원, 전문가 리소스를 투자할 준비가 된 기업에게 출시 시점의 동일한 90점은 이미 천지 차이다.


하지만 이 일에는 전제 조건이 있다. 기업이 몇 달간의 시간과 일정량의 연산 자원을 투자해 추가 학습을 진행하려면, 먼저 훈련할 가치가 있는 가중치가 있어야 한다. 지난 몇 년간 오픈 모델과 최첨단 폐쇄형 모델 사이에는 항상 격차가 존재했고, 일반적인 질의응답이나 일상적인 코드 작성에서는 차이가 크지 않았지만, 오류 비용이 높은 전문 시나리오에 들어가면 그 격차는 더욱 부각되었다. 법률 분야는 그중에서도 요구 사항이 가장 높은 부류에 속하며, 과거에 실제로 Harvey와 같은 회사의 핵심 업무에 진입할 수 있었던 모델은 대부분 당시 가장 강력한 성능을 가진 폐쇄형 모델이었다. 오픈 가중치는 물론 더 쉽게 제어하고 개조할 수 있지만, 가장 기본적인 전문 작업조차 수행하지 못한다면 이후의 학습 공간은 논의할 여지가 없다.



Kimi K3는 이 오랜 장벽을 처음으로 넘어섰다. 총 파라미터 수가 2.8조에 달하며, 100만 토큰의 컨텍스트를 지원하고, 장기 작업, 도구 사용, 복잡한 추론에서 이미 우수한 기반 능력을 갖추고 있다. Harvey에게 오픈 가중치 모델은 처음으로 단순히 비용이 더 낮고 통제권이 더 많은 대안이 아니라, 최첨단 모델과 함께 진지하게 평가받을 수 있는 범위에 들어서기 시작했다.


그래서 그들은 과거에 별도로 논의되는 일이 거의 없었던 문제에 주목하기 시작했다. 이 가중치가 얼마나 쉽게 추가 학습될 수 있는지에 대한 문제였다.


Cursor는 Composer 2를 훈련할 때 일반적인 프로그래밍 에이전트 순위표를 기준으로 모델을 선택하지 않았다. 그들의 판단은 에이전트와 장기 작업 능력이 강화 학습 과정에서 크게 변화할 수 있으며, 훈련 시작 전의 순위가 최종 결과를 예측하지 못할 수도 있다는 것이었다. 순위표 점수보다 Cursor는 모델의 프로그래밍 지식, 상태 추적 능력, 내부 코드베이스에서의 혼란도, 그리고 자체 인프라에서의 실행 효율성을 더 중시했다. 최종적으로 선택된 베이스 모델은 Kimi K2.5였다.


Devin을 만든 Cognition도 같은 판단을 내렸다. K3의 오픈 가중치가 공개된 후, 그들은 곧바로 모델을 Devin Desktop과 CLI에 통합했고, 자체 FrontierCode 1.1 Extended에서 K3는 58.2%의 점수와 63.6%의 통과율을 기록했다. 이 테스트는 실제 엔지니어링 작업을 평가하며, 코드가 최종적으로 메인 브랜치에 병합될 수 있는지, 품질이 충분한지까지 모두 반영된다. Cognition은 또한 K3가 버그 재현과 자체 실행 환경 관리에서 특히 뛰어난 성과를 보였다고 언급했는데, 이 두 가지는 장기 프로그래밍 작업에서 가장 쉽게 실패하는 부분이다. 그 후 그들도 이 가중치에 대해 후속 학습을 진행했다.


진정으로 부족한 것은 법률 데이터가 아니다


Harvey는 빠르게 성장하고 있다. 올해 3월 기준 약 1,300개 기관과 10만 명 이상의 변호사에게 서비스를 제공했으며, 5개월 만에 고객 수는 거의 두 배로 늘어 70개국을 커버하고, AmLaw 100 중 4분의 3 이상의 로펌이 Harvey를 사용하고 있다.


법률 서비스는 프로젝트 금액이 높고 오류에 대한 허용 범위가 매우 낮다. 하나의 M&A 실사 보고서는 수백에서 수천 개의 파일에서 경영권 변경 조항을 찾아내 거래가 촉발되는지 판단하고, 위험을 식별한 뒤 원문 근거를 첨부해야 한다. 그 과정에는 수십 개의 판단이 연속적으로 성립해야 하며, 거래에 실제로 영향을 미치는 단 하나의 문제를 놓치면 앞서 제대로 수행한 대부분의 작업도 큰 의미를 잃게 된다.


서비스를 제공하는 로펌이 점점 많아지면서 Harvey는 기본 모델 기업들이 쉽게 확보하기 어려운 데이터를 축적하게 되었다. 변호사가 업무를 어떻게 배치하는지, 최종 결과물을 받는 파트너가 어디서 문제를 지적하는지 알고 있다.



이러한 경험은 나중에 Legal Agent Benchmark로 제작되었다. 이미 1,200개 이상의 장기 법률 과제가 포함되어 있으며, 24개 실무 분야를 아우른다. 각 과제의 설명은 평균 약 50단어에 불과하며, 모델은 이후 폐쇄된 고객 사건 환경에 진입한다. 관련 문서와 다수의 무관한 자료가 섞여 있는 가운데, 모델은 스스로 검색하고 읽고 판단한 뒤 항목별로 검증 가능한 작업 결과물을 제출해야 한다.


각 과제에는 평균 약 50개의 평가 기준이 있으며, 복잡한 과제는 수백 개에 달할 수 있다. 사실이 빠짐없이 확인되었는지, 결론이 성립하는지, 인용이 원문과 일치하는지, 위험 등급과 권고 사항이 합리적인지 모두 개별적으로 판정 가능한 평가 항목으로 세분화된다. 하나의 과제는 최장 1,000라운드 이상 지속될 수 있으며, 수십만 토큰을 소모한다.


젊은 변호사는 몇 년간 일하면서 고객이 실제로 걱정하는 것이 무엇인지, 눈에 띄지 않는 조항이라도 놓쳐서는 안 되는 것이 무엇인지 점차 알게 된다. 이러한 경험은 과거에 교과서에 온전히 담기 어려웠고, 대부분 파트너의 수정 사항, 팀 내 업무 관행, 그리고 이미 납품된 문서들 속에 남아 있었다.


Harvey는 그중 일부를 과제, 자료, 평가 기준으로 분해했고, 모델이 작업을 수행하는 모든 과정은 이제 계산되고 비교될 수 있는 피드백을 갖게 되었다.


프롬프트와 검색은 모델에게 어디를 찾아야 하는지 알려주고, 평가 기준은 또 다른 질문에 답하기 시작한다. 즉, 하나의 법률 업무가 어느 수준에 도달해야 완료된 것인가 하는 것이다. Harvey가 지난 몇 년간 실제로 축적한 것은 고객 및 법률 데이터 외에도 모델 훈련에 직접 활용할 수 있는 전문 평가 체계다.


법률 경험을 가중치에 새기다


이러한 과제와 평가 기준이 본격적으로 훈련에 들어가기 시작했다. 데이터는 공개 법률 자료, 합성 데이터, 인간 전문가 데이터에서 비롯되었으며, 실무 변호사들이 과제 구성, 평가, 합성 데이터 검토에 참여했다. Harvey는 총 약 1,750개의 법률 에이전트 과제 환경을 준비했다.


모델이 재료와 도구가 있는 작업 공간에 들어간 후에는 스스로 파일을 읽고, 도구를 호출하며 결과를 제출해야 하며, 시스템은 변호사가 정한 기준에 따라 전체 작업 궤적을 검사하여 구체적인 요구사항이 얼마나 완료되었는지, 법적 문제가 어느 정도 해결되었는지 확인합니다. 핵심 요구사항을 모두 통과하면 추가 보상도 받게 됩니다.


각 훈련 주기마다 1만 개 이상의 작업 궤적이 생성됩니다. Harvey는 그룹 시퀀스 전략 최적화(GSPO)를 사용하여 모델이 동일한 작업에서 여러 가지 접근 방식을 생성하도록 하고, 결과 간의 품질 차이에 따라 가중치를 업데이트합니다. 두 궤적의 점수가 너무 근접하면 시스템이 재평가를 수행하여 평가 노이즈가 훈련에 미치는 영향을 줄입니다.


전체 과정은 약 2개월간 지속되며, 약 150장의 NVIDIA B300을 사용합니다. 프리트레이닝으로 최첨단 모델을 구축하려면 보통 수만 장의 GPU가 필요하지만, Harvey가 이번에 투입한 연산 자원은 또 다른 규모입니다. Harvey는 rank-64 LoRA를 채택하여 Kimi K3의 어텐션 레이어, 피드포워드 네트워크, 라우팅 전문가 가중치를 포함하며, 약 50만 개의 전문가 텐서에 적용됩니다.


긴 궤적 훈련은 또 다른 엔지니어링 문제에 직면합니다. 법적 작업이 수백 라운드에 걸쳐 지속될 수 있는데, 모델이 작업 궤적을 생성하는 동안 훈련 측의 가중치가 이미 업데이트되었을 수 있습니다. 트레이너가 이 궤적을 나중에 계산할 때 양쪽 모델 상태가 일치하지 않으면, 당시 각 단계의 행동에 해당하는 확률도 변하게 되어 보상이 원래의 결정에 정확하게 작용하기 어려워집니다.



Kimi K3의 혼합 전문가 구조는 이 문제를 더 복잡하게 만듭니다. 각 토큰이 모델에 들어가면 라우터가 896명의 전문가 중 16명을 선택하여 계산에 참여시킵니다. 훈련 측과 실행 측에서 수치 정밀도나 배치 처리 방식에 미세한 차이만 있어도, 동일한 토큰이 다른 전문가에게 할당될 수 있으며 원래의 궤적을 완전히 재현하기 어려워집니다.


따라서 Harvey와 그 공급업체는 트레이너와 실행 환경을 커널 레벨에서 수치적으로 정렬했습니다. 가중치가 업데이트될 때마다 실행 환경에 직접 핫로드되어 작업 생성을 반복적으로 중단할 필요가 없습니다. 시스템은 또한 토큰에 해당하는 전문가 라우팅 결과를 기록하여, 트레이너가 재계산할 때 모델이 이 궤적을 생성할 때 거쳤던 경로를 최대한 복원할 수 있도록 합니다.


이 지점에 이르러 Tenet은 더 이상 법적 말뭉치를 모델에 추가하는 일반적인 미세 조정이 아닙니다. Harvey가 구축한 것은 반복적으로 실행할 수 있는 훈련 프로세스입니다. 법적 작업이 계속 환경에 유입되고, 모델이 작업을 완료하며, 변호사가 정한 기준이 전체 궤적을 평가하고, 가중치가 업데이트된 후 새 모델이 환경으로 돌아가 다음 라운드 작업을 수행합니다.


Kimi K3가 안정적으로 계속 훈련될 수 있는지 여부도 이러한 순환 속에서 실제로 검증되었습니다.


훈련 이후, 그것은 더욱 법률 에이전트에 가깝다


Harvey가 진정으로 개선하고자 한 것은 모델이 장기 법률 업무를 완수하는 능력이었다. 그것은 매우 엄격한 all-pass 기준을 채택했으며, 한 작업 내 핵심 평가 기준이 모두 통과해야 한다. Harvey가 공개한 내부 결과에 따르면, 훈련에 참여하지 않은 LAB 보류 세트에서 Tenet이 완전히 완료한 작업 수는 원래 Kimi K3의 약 두 배에 달했고, all-pass 비율은 약 11%에서 19.7%로 약 9% 포인트 증가했다.


계약 초안 작성, 검토 및 협상을 전문적으로 테스트하는 LAB Contracts에서는 완료된 작업 수가 약 20% 증가했고, all-pass 비율은 11.3%에 도달하여 약 2% 포인트 상승했다. Harvey 자체 순위에 따르면, Tenet은 LAB Contracts에서 1위, 전체 LAB에서 2위를 차지했다.


이후 Tenet을 두 가지 외부 테스트, 즉 Mercor의 APEX Agents Corporate Law와 Crosby의 Redline Bench에 투입했다. 전자는 시뮬레이션된 업무 환경에서의 장기 전문 작업을 테스트하고, 후자는 모델이 계약을 연속적으로 수정한 후 변호사가 수립한 기준에 따라 평가하도록 요구한다.



Tenet은 이 두 테스트의 훈련 데이터를 접하지 않았음에도 불구하고 성적이 여전히 원래 Kimi K3보다 현저히 높았으며, 이는 Harvey 작업 환경에서 길러진 능력이 새로운 법률 작업으로 전이될 수 있음을 시사한다.


그러나 또 다른 문제는 전문 사후 훈련이 모델을 특정 유형의 작업에 점점 더 능숙하게 만들면서 동시에 원래의 일부 지식과 추론 능력을 잃게 할 수 있다는 점이다.


LegalBench, CUAD 및 MAUD에서 Tenet은 뚜렷한 퇴보를 보이지 않았다. Scale Professional Reasoning Benchmark의 어려운 하위 집합에서는 점수가 36.0%에서 36.8%로 소폭 상승했다. 적어도 이 결과 세트에서 볼 때, Kimi K3가 법률 작업에서 더 강력해진 후에도 뚜렷한 능력 망각 문제는 나타나지 않았다.


Harvey의 보상 설계는 결과 품질이 비슷할 때 더 짧은 궤적을 선호하는데, 법률 에이전트가 파일을 하나 더 읽거나 도구를 한 번 더 호출할 때마다 토큰 소비와 대기 시간이 증가하기 때문이다. 훈련 이후 Tenet은 일부 비효율적인 단계를 줄였고, 작업 품질이 향상되는 동시에 작업 완료 비용은 기본적으로 안정적으로 유지되었다.


이번 후속 훈련이 더 크게 바꾼 것은 Kimi K3가 복잡한 법률 업무를 처리하는 방식입니다. 절차를 더 잘 정리하고 도구를 호출하며, 작업에서 핵심 요구사항을 놓치는 일도 줄었습니다.


Harvey는 이미 2025년부터 멀티 모델 전략을 채택했으며, 올해도 계속해서 OpenAI와 Anthropic의 신규 모델을 통합하고 있습니다. Tenet은 이 체계에 처음으로 Harvey가 직접 훈련하고 직접 통제하는 오픈 가중치 모델을 추가했습니다.


필요한 것은 기본 토대가 이미 검증된 모델입니다. Harvey의 법률 업무는 대량의 문서를 처리해야 하며, 수백에서 수천 라운드의 연속 작업을 실행해야 하고, 모델은 긴 작업 과정에서 상태를 유지해야 합니다. 후속 훈련은 법률 업무 처리 방식을 계속 다듬을 수 있지만, 기본 토대에 원래 없던 능력을 처음부터 채워 넣기는 어렵습니다.


또 다른 조건은 통제권입니다. Harvey는 API를 통해 GPT와 Claude를 호출할 수 있지만, 1750개의 법률 작업 환경과 변호사의 평가 기준을 이 폐쇄형 모델에 계속 입력할 수는 없습니다. 오픈 가중치는 훈련 방식과 보상 설계를 자체적으로 결정할 수 있게 하고, 훈련된 전문 역량을 자체가 보유한 가중치에 남길 수 있게 합니다.


하지만 가중치를 확보한 후에는 이 모델이 후속 훈련에 적합한지 검토해야 합니다. 장기 궤적 강화 학습이 안정적으로 실행될 수 있는지, 혼합 전문가 라우팅이 정확히 재현되는지, 전문 역량이 향상된 후 기존 지식을 잃지 않는지, 추론 비용이 생산 환경에서 사용 가능한 범위 내로 유지되는지, 모두 실제로 한 번 테스트해봐야 알 수 있습니다.


Tenet이 두 달간 실행된 후, Kimi K3가 이번 라운드의 답을 제시했습니다. 훈련 과정이 안정적으로 운영되었고, 법률 업무 역량이 뚜렷하게 성장했으며, 눈에 띄는 능력 망각도 없었고, 비용도 효과와 함께 통제 불능 상태가 되지 않았습니다.


Harvey에게 이러한 결과는 '오픈 가중치' 자체보다 더 중요합니다. 가중치를 다운로드할 수 있다는 것은 기업이 후속 훈련을 할 자격이 있다는 뜻일 뿐입니다. 훈련 후 얼마나 많은 역량이 남는지가 이 모델에 계속해서 컴퓨팅 파워, 데이터, 전문가 시간을 투자할 가치가 있는지를 결정합니다.


모델 기업의 또 다른 사업


Harvey는 목표가 로펌이 오픈 가중치 위에서 자체 독점 모델을 훈련하고, 훈련 후 형성된 역량을 보유할 수 있게 하는 것이라고 말합니다. Tenet이 내놓은 것은 모델이라기보다는 하나의 방법론에 가깝습니다.


과거에는 기반 모델 기업의 사업이 대부분 모델 출시 이후의 호출에서 발생했습니다. 오픈 가중치는 또 다른 관계를 가져왔습니다. 한 기업이 기성 기반 모델을 가져와 계속 훈련하고, 자체 업계 지식을 가중치에 남긴 다음, 결국 자체 비즈니스에 더 가까운 모델을 얻을 수 있게 된 것입니다.


이런 수요는 예전에는 진정한 시장을 형성하기 어려웠습니다. 범용 모델의 능력이 충분히 강하지 않을 때, 수직 기업이 가중치를 확보하더라도 후속 훈련만으로 장기 추론, 도구 호출, 복잡한 작업 처리를 보완하기는 어려웠습니다. 처음부터 사전 훈련을 하는 것은 너무 비싸서 대부분의 기업이 굳이 할 필요가 없었습니다.



Cursor는 프로그래밍 분야에서 Composer 2를 훈련했고, Cognition도 동일한 가중치 위에서 Devin에 사용되는 모델을 계속 훈련했으며, Harvey는 법률 분야에서 Tenet을 만들었습니다. 프로그래밍과 법률은 서로 거리가 멀지만, 모두 Kimi가 이미 훈련한 범용 능력에서 출발해 자신들이 가장 잘 아는 전문 작업을 계속 추가하는 방식을 선택했습니다.


Tenet은 또한 이 작업의 진입 장벽을 구체적으로 보여주었습니다. 두 달, 약 150장의 GPU, 그리고 실무 변호사가 정의한 평가 기준만 있으면, 한 기업이 범용 가중치를 자신의 업계 최전선으로 끌어올릴 수 있습니다. 연산 장벽은 이미 한 자릿수 이상 낮아졌고, 더 복제하기 어려운 부분은 반대편으로 넘어가기 시작했습니다. 즉, 전문 작업이 어느 수준까지 완료되어야 하는지를 명확히 설명할 수 있는 사람이 있는지가 관건이 되었습니다.


소프트웨어 개발과 법률은 이미 나타난 두 가지 사례일 뿐입니다. 금융, 컨설팅, 의약, 회계, 그리고 다수의 전문 서비스 업계는 모두 자체 데이터, 워크플로우, 전문가 판단을 보유하고 있습니다. 이러한 업계는 그 자체로 수조 달러 규모의 지식 노동 시장입니다. 그중 최상위 기업들이 반드시 자체적으로 기초 모델을 사전 훈련하지는 않겠지만, 점점 더 성숙한 가중치 위에서 자체 모델을 계속 훈련할 수 있는 여건을 갖추고 있습니다.


이 경로가 계속 유효하다면, Kimi가 직면한 시장은 더 이상 단순히 얼마나 많은 사람이 호출하는지에 국한되지 않습니다. 앞으로 더 주목할 점은 Harvey, Cursor, Devin 이후, 얼마나 많은 기업이 Kimi 위에서 자체 모델을 훈련하기로 선택할지입니다.


원문 링크


BlockBeats 공식 커뮤니티에 참여하세요:

Telegram 구독 그룹:https://t.me/theblockbeats

Telegram 토론 그룹:https://t.me/BlockBeats_App

Twitter 공식 계정:https://twitter.com/BlockBeatsAsia

举报 오류 신고/제보
문고 선택
새 문고 추가
취소
완료
새 문고 추가
자신만 보기
공개
저장
오류 신고/제보
제출