动察 Beating 모니터링에 따르면, AI 모델 평가 회사 Vals AI가 4000만 달러 규모의 시리즈 A 투자를 유치했으며, 기업 가치는 4억 달러에 달합니다. 이번 라운드는 a16z가 주도했고, 8VC, Pear VC, Bloomberg Beta 등 기존 주주들도 계속 참여했습니다.
Vals는 대형 언어 모델의 제3자 평가를 전문으로 합니다. 현재 많은 모델이 출시될 때 성적을 여전히 제조사가 자체 측정하고 자체 보고합니다. 반면 Vals는 프로그래밍, 금융, 법률, 의료 등 실제 작업을 통해 다양한 모델을 동일한 기준으로 테스트합니다. 공식 발표에 따르면, 그 결과는 OpenAI, Anthropic, Google, Meta, xAI의 모델 카드에 인용되었으며, 올해 수익은 이미 2025년 전체의 8배에 달합니다.
a16z가 주목한 것은 바로 이 '제3자 심판' 가치입니다. 공개 벤치마크는 점점 더 쉬워지고, 훈련 데이터에 섞이거나 제조사가 특정 목적에 맞게 최적화할 수 있어, 순위표의 높은 점수가 반드시 실제 성능을 의미하지는 않습니다.
이번에 Vals는 Vals Smith를 전면 공개하여, 누구나 임의의 GitHub 저장소를 Coding Benchmark로 만들 수 있게 했습니다. 시스템은 과거 PR에서 실제 개발 작업을 추출하고, 숨겨진 테스트를 통해 모델이 작업을 완료할 수 있는지 확인합니다. 따라서 기업은 공개 순위표만 보는 대신, 어떤 모델이 자신의 코드베이스에 가장 적합한지 직접 테스트할 수 있습니다.