동차 Beating 모니터링에 따르면, 바이트댄스 Seed가 오디오 생성 모델 Seed Audio 1.0을 출시했습니다. 이 모델은 하나의 프롬프트로 대사, 효과음, 환경음을 동시에 생성하고, 타임라인에 따라 사운드 진입을 제어할 수 있습니다.
이 모델은 텍스트 및 참조 오디오 입력을 지원하며, 시간 제어 정밀도는 100ms입니다. 한 번에 약 2분 분량의 오디오를 생성할 수 있으며, 캐릭터 음색 일관성을 유지하면서 계속 연장할 수도 있습니다.
Seed Audio 1.0은 20개 이상의 언어를 지원합니다. 동일한 음색을 언어 간에 전이할 수 있으며, 어조와 감정도 전환할 수 있습니다.
공식 평가에 따르면, 대부분의 시나리오에서 오디오 사용 가능률이 90%를 초과합니다. 대부분 언어의 자연스러움 MOS 점수는 4점을 넘습니다. 이 모델은 이미 화산 방주 체험 센터에上线되었으며, API 접속도 개방되었습니다.