AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

샤오홍슈가 완전 연속 자기회귀 TTS 모델 dots.tts를 오픈소스로 공개했으며, 제로샷 음성 복제를 지원합니다.

동차 Beating 모니터링에 따르면, 샤오홍슈 hi lab이 20억 파라미터의 엔드투엔드 자기회귀 텍스트 음성 변환(TTS) 모델인 dots.tts를 오픈소스로 공개했습니다. Apache 2.0 라이선스 하에 완전한 추론 및 미세 조정 코드를 공개했으며, 공개된 가중치에는 기본 사전 학습 버전, 자기 교정 정렬(SCA) 미세 조정 버전, 저지연 추론 증류 버전이 포함됩니다.

기존의 이산 오디오 코덱 토큰(Discrete Codec Tokens)에 의존하는 TTS 아키텍처(VALL-E, CosyVoice, ChatTTS 등)와 달리, dots.tts는 완전 연속적이고 엔드투엔드인 자기회귀 흐름 매칭 아키텍처를 구현하여 전체 파이프라인에서 이산 토큰을 전혀 사용하지 않습니다. dots.tts는 48kHz 샘플링 속도의 AudioVAE에서 추출한 연속 특징을 의미 인코더, 백본 언어 모델(Qwen2.5-1.5B-Base에서 초기화, 병음 입력 없이 BPE 텍스트 직접 처리) 및 자기회귀 흐름 매칭 음향 헤드와 결합하여 연속 잠재 변수를 예측하고 생성기가 이를 오디오로 재구성합니다. 연속 특징을 직접 예측함으로써 dots.tts는 이산 양자화로 인한 음질 손실을 피하고 발음 세부 사항, 음색 유사성 및 감정 표현력을 유지합니다.

dots.tts는 약 150만 시간의 음성 데이터를 기반으로 사전 학습되었습니다. Seed-TTS-Eval 평가에서 dots.tts는 중국어, 영어 및 중국어 난이도 테스트 세트에서 각각 0.94% / 1.30% / 6.60%의 단어 오류율(WER)과 81.0 / 77.1 / 79.5의 유사도 점수(SIM)를 기록하여 오픈소스 SOTA 수준에 도달했습니다. 24개 언어의 MiniMax Multilingual 벤치마크 테스트에서는 평균 화자 유사도가 83.9에 달했습니다. 샤오홍슈는 Hugging Face에서 Gradio 체험 공간을 제공하여 사용자가 온라인에서 제로샷 음성 복제를 테스트할 수 있도록 했습니다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료