동차 Beating AI 속보, Meta Superintelligence Labs가 Muse Voice Transcribe를 출시했습니다. 이 모델은 실시간 음성을 텍스트로 변환하고, 화자를 구분하며, 사용자가 말을 마쳤는지 판단하는 기능을 모두 하나의 모델에 담았습니다. 최대 1시간 이상의 오디오를 처리할 수 있으며, 동시에 20명 이상의 화자를 구분할 수 있습니다.
Artificial Analysis의 영어 실시간 전사 테스트에서 WER(단어 오류율, 낮을수록 좋음)은 3.1%를 기록했습니다. GPT Live Transcribe는 3.9%, Gemini 3.5 Transcribe Live는 4.0%였습니다. Muse Voice Transcribe는 발화가 끝난 후 약 0.16초 만에 최종 텍스트를 제공합니다.
이 모델은 모든 단어에 동일한 대기 시간을 고정하지 않습니다. 모델은 80ms 오디오를 읽을 때마다 계속 들을지 아니면 출력을 시작할지 스스로 결정합니다. 간단한 단어는 더 빨리 작성할 수 있고, 어려운 단어는 더 많은 맥락을 듣고 확정합니다. Meta는 강화 학습을 통해 정확도와 지연 시간을 동시에 최적화했습니다.
이 모델은 70개 이상의 언어로 훈련되었으며, 그중 25개 언어는 중점적으로 검증되었습니다. 또한 한 문장에서 중문과 영문이 섞여 있어도 바로 인식할 수 있습니다. 현재 Meta AI for Mac 및 Muse Code에 통합되었으며, Meta Model API도 공개되었습니다. 가격은 1,000분당 3달러, 즉 시간당 0.18달러입니다.