알리바바 Qwen-Audio-3.0-TTS-Plus 음성 합성 리더보드 1위 달성
알리바바의 신규 음성 합성 모델 Qwen-Audio-3.0-TTS-Plus가 아티피셜 애널리시스 스피치 아레나에서 1위를 차지했습니다. 다국어 지원과 자연스러운 감정 표현 기능을 앞세워 글로벌 시장 공략에 나섭니다.
주장알리바바의 새로운 음성 합성 모델인 Qwen-Audio-3.0-TTS-Plus가 업계 최고 수준의 성능을 입증했습니다. 해당 모델은 아티피셜 애널리시스(Artificial Analysis)의 스피치 아레나 리더보드에서 1위를 기록하며 기술적 우위를 확보했습니다.
팩트Qwen-Audio-3.0-TTS-Plus는 엘로(Elo) 점수 1,236점을 획득했습니다. 이는 1,234점을 기록한 심바(Simba) 3.2를 근소한 차이로 앞선 결과입니다. 제미나이(Gemini) 3.1 플래시 TTS와 소닉(Sonic) 3.5가 뒤를 이어 상위권에 이름을 올렸습니다.
팩트알리바바는 이번 모델을 플래시 버전과 플러스 버전 두 가지로 출시했습니다. 플래시 버전은 300밀리초 수준의 지연 시간으로 실시간 상호작용에 최적화했습니다.
팩트플러스 버전은 고품질 음성 출력에 집중했습니다. 사용자는 자연어를 통해 말하기 스타일을 조정하거나 태그를 사용하여 비언어적 표현을 추가할 수 있습니다.
팩트지원 언어는 타갈로그어, 말레이어, 태국어, 베트남어 등 16개 언어입니다. 여러 중국어 방언까지 포함하여 언어적 다양성을 확보했습니다.
교차검증음성 복제 기능의 경우 소음이나 울림이 심한 참조 녹음본을 처리하는 능력이 향상되었습니다. 이전 버전과 비교하여 데이터 처리의 안정성이 개선되었습니다.
교차검증처리 속도 면에서는 경쟁 모델 대비 낮은 효율을 보입니다. 초당 16자를 처리하는 속도는 소닉 3.5의 초당 120자와 비교할 때 현저히 느린 수치입니다.
팩트서비스 이용 가격은 알리바바 클라우드 모델 스튜디오를 기준으로 백만 자당 27.60달러입니다. 이는 기업용 서비스 도입 시 주요 비용 요소로 작용합니다.
주장이번 모델의 출시는 음성 합성 시장에서 알리바바의 영향력이 확대되고 있음을 보여줍니다. 다국어 지원과 감정 표현 기능은 글로벌 시장 경쟁에서 유리한 요소입니다.
주장기술적 성과와 함께 속도 개선은 향후 과제로 남았습니다. 실시간 서비스 품질을 높이기 위한 최적화 작업이 필요합니다.
주장알리바바는 이번 리더보드 1위 달성을 기점으로 인공지능 음성 기술 분야의 입지를 강화할 계획입니다. 글로벌 사용자 확보를 위한 언어 확장 전략도 지속합니다.
출처더 디코더(The Decoder) 보도 내용과 아티피셜 애널리시스 자료를 교차 검증했습니다.
본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

