동찰 Beating 모니터링에 따르면, StepAudio 2.5 Realtime 엔드 투 엔드 실시간 음성 대형 모델이 야랩성 대화에 초점을 맞춘「인간 감성」을 강조하며, 전체 차원의 인물 설정을 사용자 정의하고 보조 언어(억양, 일시 정지, 탄식 등의 비언어적 신호) 지각을 지원합니다. 해당 모델은 모두 오픈 플랫폼 API에 상용화되었습니다.
공식으로 제공된 다섯 가지 평가 차원(2026년 4월 테스트) 모두 1위를 차지하였습니다. 특히, 실제 경험을 가장 잘 반영할 수 있는 주관적 평가(모바일 APP 실제 대화 평가)는 80.41로, GPT-Realtime-1.5는 68.01, Gemini Live는 67.16입니다. 음성 질의 밴치마크는 79.80이며, GPT-Realtime-1.5(53.20)의 거의 1.5배입니다. 보조 언어 이해는 82.18, 일반 대화는 86.36, 차량 시나리오는 84.80입니다.
기술적인 방향은 세 가지 핵심 설계가 있습니다. 첫 번째는 1만 여개의 기본 인물 설정을 기반으로 하여 알고리즘을 통해 백만 규모의 인물 설정 특징 매트릭스를 분리하고, 대량의 현실 대화 말뭉치를 통합하여 모델이 롱테일 소수 주제에 있어서도 안정을 유지할 수 있도록 하는 것입니다. 두 번째는 역할 연기 시나리오에 대한 전용 RLHF(인간 피드백 중심 강화 학습) 정렬을 수행하여, AI가 대화하는 동안 "인물 설정 붕괴" 이슈를 해결했습니다. 세 번째는 이해와 생성의 심층 융합을 통해, 자사의 StepAudio 2.5 TTS의 표현력을 계승하여, 전체적인 시나리오 설정과 문장 내 세부사항을 정교하게 다듬는 것입니다.
API는 OpenAI Realtime API 프로토콜(WebSocket 기반)과 호환되며, 개발자는 저렴한 비용으로 마이그레이션할 수 있습니다. 가격은 입력 당 10원/백만 토큰(캐시 히트 시 2원), 출력 당 70원/백만 토큰이며, 공식적으로 지속적인 음성 통화 비용은 약 3.8원/시간으로 추정됩니다.