동찰 Beating AI 속보, ElevenLabs가 차세대 음성 모델 Eleven v4와 실시간 버전 Eleven v4 Turbo를 발표했다. v4는 더 자연스러운 감정과 음성 제어를主打로 하며, Turbo는 실시간 음성 Agent를 대상으로 중위 추론 지연이 약 100ms이다.
Artificial Analysis 최신 TTS 블라인드 테스트 순위에서 Eleven v4는 현재 1315 Elo로 1위를 차지하고 있다. Cartesia Sonic 3.6은 1275, Gemini 3.8 Flash TTS는 1267, Qwen-Audio-3.0-TTS-Plus는 1258이다. 이전 세대 Eleven v3는 현재 1169에 불과해 17위이다.
v3는 이미 웃음소리, 속삭임 등 오디오 태그를 지원했으며, v4는 주로 이 제어 세트를 더 정확하게 만들었다. 사용자는 직접 어조, 리듬, 감정 및 음향 효과를 지정할 수 있고, 자연어로 한 문장을 어떻게 말할지 설명할 수도 있다. 모델은 언어 커버리지를 70여 종에서 90여 종으로 확대했으며, Instant Voice Clone은 약 10초 오디오만 필요하고, 긴 텍스트와 다인 대화에서의 음성 일관성도 강화했다.
Turbo는 실시간 대화의 속도 문제를 전문적으로 해결한다. 공식 문서에 따르면 v3 Conversational의 중위 추론 지연은 약 280ms이며, v4 Turbo는 약 100ms로 낮아졌다.