HeyGen VoiceがArtificial Analysis Controlled Voice TTS Arenaリーダーボードで第1位を獲得、AlibabaのQwen-Audio-3.1-TTS-PlusおよびElevenLabsのEleven v4 Turboを上回る
HeyGen Voiceは、米国英語と英国英語で同一の8つのクローン音声を使用してモデルを評価する当社のControlled Voice Arenaで評価された、@HeyGen初のText to Speechモデルです。
主なポイント:
➤ Controlled Voice: HeyGen Voiceは1,468回のアリーナ出場でElo 1,201を記録し、1,182のQwen-Audio-3.1-TTS-Plus、1,166のEleven v4 Turbo、1,162のEleven v4を上回りました。Assistants and Customer Serviceで第1位、Knowledge Sharingで第2位、English (UK)で第1位にランクインしています。
➤ 発音の堅牢性: HeyGen Voiceは83.1%をスコアし、29モデル中第10位。84.6%のQwen-Audio-3.1-TTS-Plusには及ばないものの、80.7%のInworld Realtime TTS-2を上回りました。Preserving Exact Sequencesでは83.3%で第2位であり、SpaceXAI TTSにのみ及ばない結果です。
➤ 価格: HeyGen Voiceの価格は$30/1M文字で、$19.3/1M文字のQwen-Audio-3.1-TTS-Plus、$40/1M文字のEleven v4 Turbo、$80/1M文字のEleven v4と比較されます.
➤ 速度: HeyGen Voiceは生成時間1秒あたり40文字を処理します。Eleven v4の1秒あたり76文字、Gemini 3.8 Flash TTSの46文字と比較されます。
詳細と音声サンプルは以下をご覧ください ⬇️