허깅페이스 오픈 TTS 리더보드 공개
허깅페이스가 급증하는 오픈소스 텍스트 음성 변환 모델을 체계적으로 평가하기 위한 오픈 TTS 리더보드를 공개했습니다. 기존 인간 선호도 기반 평가의 한계를 극복하고 객관적 지표를 도입하여 평가 시간을 단축했습니다.
주장허깅페이스는 오픈소스 텍스트 음성 변환 모델의 급격한 증가에 발맞추어, 확장 가능하고 표준화된 평가 체계인 오픈 TTS 리더보드를 구축했습니다.
주장기존의 인간 선호도 기반 평가 방식은 모델 출시 속도를 따라가지 못하며, 오픈소스 모델이 충분히 반영되지 못한다는 한계가 있습니다.
팩트2026년 9월 30일 기준, 허깅페이스 허브에는 8,000개 이상의 텍스트 음성 변환 모델이 등록되어 있습니다.
팩트인공 지능 분석 리더보드에 등록된 92개 모델 중 공개 가중치 모델은 16개에 불과하여 오픈소스 모델의 비중이 낮습니다.
교차검증인간의 선호도는 음성 합성의 품질을 결정하는 최종 기준이지만, 평가자의 주관이 시간에 따라 변할 수 있고 평가 비용이 많이 듭니다.
팩트허깅페이스는 객관적 지표를 도입하여 평가 시간을 수 주에서 수 시간 단위로 단축했습니다.
팩트새로운 리더보드는 명료도, 속도, 화자 유사도라는 세 가지 객관적 지표를 사용합니다.
팩트명료도 측정에는 자동 음성 인식 리더보드에서 상위권을 차지한 쿠원 스리 에스알 모델이 활용됩니다.
팩트영어 성능이 타 언어의 성능을 대변하지 못한다는 점을 고려하여 다국어 평가를 지원합니다.
팩트중국어, 일본어, 한국어와 같은 문자 기반 언어는 문자 오류율을 보고하며, 다국어 평균은 각 언어의 매크로 평균으로 산출합니다.
출처허깅페이스 블로그(https://huggingface.co/blog/open-tts-leaderboard)의 보도를 교차 검증했습니다.
관련 콘텐츠
본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

