Google「Gemini 3.8 Flash TTS」発表 声を文章で設計、セリフの感情や間も指定可能に

Gemini新音声AI、声を文章で設計

 Googleは9月23日、音声生成AI「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表した。文章からオリジナルの声を作成し、セリフごとに感情や話す速さ、間の取り方を指定できる。ゲームのキャラクターボイスやオーディオブック、ポッドキャストなどでの利用を想定している。

 Gemini 3.8 Flash TTSの特徴は、用意された声を選ぶだけでなく、声そのものを言葉で設計できる点だ。キャラクターの年齢や声質、アクセント、基本的な話し方を文章で伝えて音声を作成し、保存した声を別の原稿にも使用できる。既存の音声ライブラリも2,000種類以上を用意する。

 読み上げ方も細かく調整できる。セリフごとにささやき声や感情を指定するほか、笑い声、ため息、短い沈黙などを加えられる。2人の話者による会話の生成にも対応し、相づちや声が重なるやり取りも表現できるという。

 短い録音から声の特徴を再現する機能も備える。対象は自分の声や使用する権利を持つ声で、音声サンプルに加え、声の本人が利用に同意する旨を読み上げた録音が必要となる。また、生成音声にはAIによるものと識別するための電子透かし「SynthID」を埋め込む。

 Gemini 3.8 Flash TTSが声の表現力や細かな演技の指定を重視する一方、同時発表のFlash-Lite TTSは大量の音声制作や応答の速さ、コスト効率を重視する。対応言語はFlash TTSが130言語、Flash-Lite TTSが101言語で、Flash TTSは日本語にも対応する。

 両モデルは発表同日から、開発者向けの「Gemini API」と、ブラウザー上で音声生成を試せる「Google AI Studio」で順次提供を開始。Google AI Studioでは、声の作成や試聴に加え、2人の会話を編集する画面でセリフごとの読み上げ方を調整できる。

Geminiに音楽生成モデル「Lyria 3」搭載 GoogleがAIクリエイティブで目指す方向性とは

2月19日、Googleは同社のGeminiアプリに音楽生成モデル「Lyria 3」を搭載し、音楽生成機能のベータ版提供の開始を…

関連記事

リアルサウンド厳選記事

インタビュー

もっとみる

Pick Up!

「ニュース」の最新記事

もっとみる

blueprint book store

もっとみる