동찰 Beating AI 속보, 계단성진(阶跃星辰)이 StepAudio 3를 발표하며 Realtime, ASR, TTS, Gen, Music 다섯 가지 음성 모델을 한꺼번에 출시했다.
Artificial Analysis의 두 가지 음성 평가에서 StepAudio 3 Realtime이 모두 1위를 차지했다. Conversational Dynamics 점수는 98.9%로 Qwen Audio 3.0 Realtime Plus의 98.4%와 GPT-Realtime-2 High의 95.3%를 앞섰고, Speech Reasoning 점수는 99.7%로 역시 1위에 올랐다. 전자는 모델이 멈춤, 발화 순서, 사용자 끼어들기, "음", "맞아" 같은 맞장구를 처리할 수 있는지를 주로 측정하고, 후자는 모델이 오디오를 직접 이해하고 추론을 완료할 수 있는지를 측정한다.
ASR도 Artificial Analysis 비스트리밍 음성 인식 순위에서 1.7% WER(단어 오류율)를 달성하며 Fun-Realtime-ASR-preview와 공동 1위를 기록했다. 또한 StepAudio 3 Gen은 보컬, 음향 효과, 환경음, 음악을 한 번에 생성하고 장면에 맞게 통합 편곡할 수 있다.
다섯 모델 모두 현재 계단성진의 음성 제품 라인에 편입되었다.
