イレブンラボ、新音声合成モデル「Eleven v4」提供開始 低遅延版「Eleven v4 Turbo」も同時公開

 イレブンラボジャパン合同会社は9月29日、新しいモデルアーキテクチャを採用した音声合成モデル「Eleven v4」の提供を開始した。あわせて、同じ研究成果を低遅延で利用できるリアルタイム対話向けモデル「Eleven v4 Turbo」も同時に公開している。

 「Eleven v4」は、文章の文脈や演出意図を捉えて、声のトーン、間、感情、キャラクター性を表現する点が特徴となる。従来のように台本を単に読み上げるのではなく、テキストそのものが含む感情や状況に沿って話し方が自然に変化する。感情表現を指示する[タグ]によるプロンプトにも対応するが、その前段としてテキスト自体を読み取って演技に反映する設計となっている。

 台本内に「インラインタグ」を書き込むことで、感情、テンポ、間、リアクション、効果音を直接指定できる。「[laughs](笑う)」「[whispers](ささやく)」「[long pause](長めの間)」といったタグに加え、「[door slams](ドアが閉まる)」「[rain](雨)」など環境音や効果音も演技に組み込める。制作途中で1文だけを作り直しても、前後との境目が自然になじむという。

 対応言語は90以上。日本語は、ブラジルポルトガル語、標準中国語、広東語などとともに、前モデルから改善に重点を置いた言語のひとつとされる。発音の正確さだけでなく、リズムや話し方の自然さといった「その言語らしさ」の部分も対象となっている。また、声と話し方を切り離して扱えるようになり、たとえば日本語の音声を基に英語の台本を読ませる場合も、声の特徴を保ちながら英語として自然な発音に近づけられる。

 リアルタイム対話向けの「Eleven v4 Turbo」は、最初の音声が出るまでのモデル推論時間が中央値で約100ミリ秒となる。この数値には通信や大規模言語モデルによる回答生成の時間は含まれない。音声品質については小さなトレードオフを伴う一方、顧客サポートや予約、営業などの音声エージェント用途に適した低遅延を実現している。両モデルは同じ表現機能を備えており、じっくり作り込むコンテンツには「Eleven v4」、リアルタイムのやりとりには「Eleven v4 Turbo」という使い分けが想定される。

 話者の声を再現するボイスクローン機能も向上した。約10秒の音声から声を再現する「インスタントボイスクローン」では、声質や話し方の特徴をこれまで以上に忠実に捉えられるようになったという。なお、ボイスクローンの作成には声の利用に必要な権利や許可が求められる。

 「Eleven v4」は『ElevenCreative』とAPIで、「Eleven v4 Turbo」は『ElevenAgents』とAPIで利用できる。

音声AIは「自分らしさ」をどう変える? Parakeet中村泰貴氏が語る、声色と表現の可能性

音声AIは、表現やコミュニケーションをどう広げるのか。「AI荒井由実」やリアルタイムAIボイスチェンジャー「Paravo」を手が…

関連記事