AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

텐센트가 오픈소스로 공개한 '오디오판 나노 바나나': 단어 수정과 음성 변환을 모두 지원하며 음성 편집 성능을 대폭 끌어올렸다

동찰 Beating AI 속보, 텐센트 훈위안이 15억 파라미터 음성 생성 및 편집 모델 AuK를 오픈소스로 공개했으며, 공식적으로 '오디오판 Nano Banana'라고 직접 부른다. 음성 복제, 가사 수정, 감정 변경, 억양 제거, 말속도와 음높이 조절, 노이즈 제거, 다인 및 음악 분리가 모두 하나의 모델에 담겼고, 자연어로 제어할 수 있다.


AuK는 기존 녹음도 바로 수정할 수 있다. 몇 글자를 잘못 말했을 때 그 몇 글자만 고치면 되고, 전체를 다시 녹음할 필요가 없다. 내용은 그대로 두고 감정, 음색, 억양을 바꿀 수도 있다. 가사 수정, 웃음소리와 기침 소리 제거, 정상적인 말을 속삭임으로 바꾸는 것도 지원한다. 음성 복제도 먼저 참조 녹음에 대한 텍스트 스크립트를 제공할 필요 없이, 음성 한 조각과 새로운 텍스트만 있으면 생성할 수 있다.


공식 테스트에서 AuK는 음성 생성 및 범용 음성 편집의 여러 평가에서 선두를 차지했다. SpeechEditBench 점수는 49.73으로, 2위 Ming-UniAudio는 28.70이었다. 고속 버전 AuK-Flash는 증류 후 4단계 추론만 필요해 속도가 약 4.5배 빠르다. 다만 논문에서도 AuK가 현재 모든 임의의 자연어 명령을 안정적으로 이해하지는 못하며, 여전히 Prompt Enhancer가 먼저 작업을 판단하고 파라미터를 정리하고 명령을 재작성해야 한다는 점을 인정했다. 코드와 모델 가중치는 이미 공개되었으며, MIT 라이선스를 채택했다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료