동차 Beating AI 속보, 실시간 음성 AI 기업 Inworld가 공식적으로 Realtime TTS-2를 출시했습니다. Artificial Analysis 최신 Controlled Voice Arena에서 1123 Elo로 1위를 차지했으며, Cartesia Sonic 3.6의 1119보다 4점 높습니다. 이 순위표는 서로 다른 모델이 동일한 8개 음성을 복제한 후 블라인드 테스트를 진행하여, 발음, 멈춤, 억양, 리듬 등 누가 더 자연스럽고 실제 사람처럼 말하는지를 주로 평가합니다.
이 모델은 이전 몇 라운드의 실제 음성을 컨텍스트로 활용하여 사용자의 어조, 리듬, 감정을 듣고 다음 문장을 어떻게 말할지 조정합니다. 개발자는 또한 "낮은 목소리로 말해", "방금 퇴근한 것처럼 피곤하지만 따뜻하게" 같은 자연어 명령을 직접 작성할 수 있으며, 웃음, 한숨, 호흡 같은 소리도 추가할 수 있습니다. 또한 여러 언어에서 동일한 음색을 유지하고, 짧은 녹음으로 음성을 복제하는 것도 지원합니다.
Inworld 공식 측은 이번 세대 모델이 실시간 대화를 위해 설계되었으며, 완전한 음성 교류에서의 억양, 리듬, 감정 상태를 활용한다고 밝혔습니다.