HeyGen Voice가 Artificial Analysis Controlled Voice TTS 아레나 리더보드에서 1위를 차지했으며, Alibaba의 Qwen-Audio-3.1-TTS-Plus와 ElevenLabs의 Eleven v4 Turbo를 앞섰습니다
HeyGen Voice는 @HeyGen의 Text to Speech 모델로서, 미국 영어와 영국 영어 전반에 걸쳐 동일한 8개의 복제된 음성을 사용하여 모델을 평가하는 우리의 Controlled Voice Arena에서 평가된 최초의 모델입니다.
주요 요점:
➤ Controlled Voice: HeyGen Voice는 1,468회의 아레나 등장에서 Elo 1,201을 기록하며, 1,182점의 Qwen-Audio-3.1-TTS-Plus, 1,166점의 Eleven v4 Turbo, 1,162점의 Eleven v4를 앞섰습니다. Assistants and Customer Service 부문에서 1위, Knowledge Sharing 부문에서 2위, English (UK) 부문에서 1위를 차지했습니다.
➤ 발음 견고성: HeyGen Voice는 83.1%를 기록하여 29개 모델 중 10위를 차지했으며, 84.6%의 Qwen-Audio-3.1-TTS-Plus에는 뒤지고 80.7%의 Inworld Realtime TTS-2보다는 앞섰습니다. Preserving Exact Sequences 부문에서는 83.3%로 SpaceXAI TTS에 이어 2위를 기록했습니다.
➤ 가격: HeyGen Voice는 1M 글자당 $30이며, 1M 글자당 $19.3인 Qwen-Audio-3.1-TTS-Plus, 1M 글자당 $40인 Eleven v4 Turbo, 1M 글자당 $80인 Eleven v4와 비교됩니다.
➤ 속도: HeyGen Voice는 생성 시간 초당 40글자를 처리하며, Eleven v4의 초당 76글자, Gemini 3.8 Flash TTS의 초당 46글자와 비교됩니다.
아래에서 더 자세한 내용을 확인하고 샘플을 들어보세요 ⬇️