音声AIは「自分らしさ」をどう変える? Parakeet中村泰貴氏が語る、声色と表現の可能性

Parakeet中村氏が語る音声AI

 音声合成や音声変換の技術が、私たちの「声」のあり方を変えつつある。テキストから自然な声を生み出すことはもちろん、リアルタイムで別人の声へ変換したり、本人の声色を保ったまま別の言語を話したりと、「声」をめぐる技術は大きく広がりつつある。

 その最前線で音声技術を研究・開発するのが、Parakeet株式会社の代表取締役CEO・中村泰貴さんだ。「AI荒井由実」などのプロジェクトに携わり、現在はリアルタイムAIボイスチェンジャー「Paravo」をはじめとした技術を手がけている。

 進化を続ける音声技術は、私たちの表現やコミュニケーションをどう広げていくのか。中村さんの言葉から、AI時代における「声」の可能性を考える。(編集部)

「AI荒井由実」で追求した、声色だけではない「本人らしさ」

Parakeet 中村泰貴

――中村さんは2018年頃から音声情報処理の研究を続けているそうですが、もともと音声に興味を持った背景には、個人的な原体験もあったのでしょうか。

中村:そうですね。学部生のときに東京大学の研究室でインターンを始めて、そこからずっと音声合成の研究をしています。今も博士課程にいるので、もう8年くらいになります。きっかけのひとつは、祖父の耳が聞こえにくかったことです。子どもの頃、こちらが10喋っても3くらいしか聞き取ってもらえないような感覚があって、コミュニケーションのもどかしさを感じていました。それで、最初はもっと精度の高い補聴器を作りたいと思って、音声技術に興味を持ったんです。

 ただ、研究を始めた2018年頃は、ちょうどディープラーニングによって音声合成の領域が大きく伸びていた時期でもありました。「これは面白いな」と感じて、最終的には音声合成の研究へ進んでいきました。起業も中学生くらいの頃から考えていて、自分の中には「音声合成を研究すること」と「会社を作ること」という二つの軸がありました。

――その二つの軸があるなかで、研究してきた技術を仕事として形にしていくきっかけは何だったのでしょう。

中村:大きかったのは、2022年頃の「AI荒井由実」ですね。もともと東京大学と東映様が一緒に進めていたプロジェクトで、研究室に「興味のある人はいないか」という話が来たんです。当時、僕もちょうど起業を考えていたので、自分から手を挙げて参加しました。その途中でParakeetができたので、独立のひとつのきっかけになったプロジェクトでもあります。

松任谷由実 – Call me back/松任谷由実with 荒井由実

――実際に、どのように荒井由実さんの歌声を作っていったのでしょう。

中村:当時は、別の方に歌ってもらった声を、音声変換によって荒井由実さんの声へ変えるというアプローチを取りました。深層学習を使って、学習データやモデルを調整していく形ですね。ただ、最初に作ったものは求められる品質には届かなくて、関係者の方たちからフィードバックをいただきながら、1年くらい試行錯誤していました。

――完成度を高めていくうえでは、どんなところを意識していましたか。

中村:難しいのは、声色が似ていればいいわけではないことです。たとえば若い頃の荒井由実さんは、現在の松任谷由実さんと比べると、ビブラートをあまり強くかけない歌い方なんです。なので、声を似せるだけではなく、ビブラートを抑えたり、歌い方を当時に近づけたりしながら、「昔の荒井由実さんらしさ」を作っていきました。「ここは本人らしくない」「ここのビブラートは強すぎる」と、人間が聞きながら調整していくような作業ですね。

――その当時から現在までに、音声AIの技術はどのように変化したのでしょうか。

中村:全然違うものになってますね。昔は、出てきた結果を人間が聞いて、「ここが本人らしくない」と細かく調整していました。でも今は、大量のデータを学習させることでモデル自体の性能が上がっています。いろいろな歌手の歌声を学習しておけば、新しく再現したい人については少量のデータでも、かなり高い精度で声を作れるようになってきました。

 以前ほど人間が細かく手を入れなくても、一度出したものがそのまま使えるくらいの品質になることもあります。研究のサイクルそのものも、以前よりかなり速くなったと思います。

声色を変えても“話し方”は残す Paravoが広げる表現

Parakeet 中村泰貴

――貴社が開発するリアルタイムAIボイスチェンジャー「Paravo」も実際に試させていただきました。喋った直後には別の声になっていて、応答の速さに驚きましたが、一般のユーザーが使える形にするうえでは、どんなことを重視して開発しているのでしょうか。

中村:Paravoは、自分が喋った声をリアルタイムで別の声へ変換するAIボイスチェンジャーです。Parakeetでは独自の音声変換AIを作っていて、それを一般的なPCでも動かせるようにチューニングしています。

 AIは品質を上げようとすると、どうしてもモデルが大きくなりやすい。でも、高性能なマシンでしか動かないものを作っても、実際にはなかなか使ってもらえません。なので、PCのCPUでも速く動くようにAIの構造を工夫しています。軽さと品質、リアルタイム性のバランスをどう取るかは、かなり重要ですね。

――実際に使ってみると、声そのものは大きく変わる一方で、喋り方にはその人らしさが残っているように感じました。

Paravoの操作画面

中村:人間の音声には、大きく分けると「声色」と「話し方」があります。声色は、その人の声そのもの。一方で、喋るスピードや滑舌、抑揚などは、その人自身の話し方です。Paravoでは基本的に、声色は変えても話し方はあえて残しています。

 全部を変換して、誰が使ってもまったく同じ喋り方になってしまうと、喋っている人の持ち味がなくなってしまうんです。滑舌がいい人なら、変換後も滑舌がいい。その人なりの喋り方や演技が残ることで、表現の幅も広がると思っています。

――自分の喋り方は残っているのに、聞こえてくる声はまったく違う。この感覚は面白いですね。

中村:そうですね。「別人になる」というより、「別人格の自分」というのがひとつのコンセプトです。自分の声に自信がなくて、配信をしてみたいけれど踏み出せない人もいると思います。自分が望んでいる声になって、それが相手にも聞こえるし、自分の耳にも返ってくる。それによって少し自信を持って喋れるようになることもあるんじゃないかと思います。

――Paravoは、法人向けにも展開しているそうですね。BtoBでは、どのような活用が進んでいるのでしょう。

中村:法人向けではエンタメ企業のお客様が多いですね。具体的な企業名を出せない事例も多いのですが、たとえばキャラクターへの活用があります。イベントで着ぐるみを出すときに、中に入る人が誰であってもリアルタイムでそのキャラクターの声へ変換できる。そうすると、決められた音声を流すだけではなく、その場にいるお客さんと実際に会話できます。

 遊園地などでも、キャラクターがお客さんと喋ったり、「○○ちゃん」と来場者の名前を呼んだりできる。リアルタイムだからこそ、その場にいる人に合わせたコミュニケーションが作れます。

――エンタメ企業での活用に加えて、ほかの業界ではどのようなニーズがありますか。

中村:コールセンターでの実証もやっています。実際に相談をいただいたのが、女性のオペレーターの方が電話越しにセクハラを受け、それが離職につながってしまうという問題でした。そこで、「女性の声を男性の声に変えられないか」と。

 オペレーター本人はいつも通り喋っているけれど、お客様側には男性の声として聞こえるようにする。音声変換というとエンタメや配信を想像しやすいですが、こうした課題にも使えると思っています。

声を変える技術から“声を見分ける”技術へ

――Parakeetでは、Paravoに加えて、声の類似度を調べる「Paramatch」も開発しています。こちらはどのような発想から生まれたのでしょう。

中村:今、声優さんの音声が本人に無断でAIの学習に使われているのではないか、という問題があります。ただ、一般の方がAI音声を聞いても、「誰々さんの声に似ている」と必ず分かるわけではありません。

 そこでParamatchでは、疑わしい音声を入力すると、登録されている声優さんの中で誰の声と近いのかを調べられるようにしています。音声から特徴を取り出して比較し、誰の声に近いのかを名前や類似度で示す仕組みです。

Paramatch

――声を変換する技術と、声を見分ける技術にはつながりもあるのでしょうか。

中村:そうですね。声を変換するために研究してきた技術が、逆に声を見分ける側にも応用されています。今後は、「この音声がAIによって作られたものなのか」を判定する技術も重要になると思います。

 今の技術なら、著名人そっくりの声を作ることもできます。そうなれば、電話などで聞こえている声が本物なのか、AIで合成されたものなのかを検知する必要も出てくる。生成する技術と、それを見分ける技術の両方が必要になっていくと思います。

キャラクターとの会話から多言語化も 音声AIのこれから

Parakeet 中村泰貴

――ここからさらに音声技術が進化したとき、エンターテインメントの楽しみ方はどう変わっていくと思いますか。

中村:たとえばVR空間で好きなキャラクターと喋るときに、自分自身も別のキャラクターの声になって会話することができます。サービスを提供する側も、スタッフの声をリアルタイムでキャラクターの声へ変換すれば、本当にそのキャラクターと話しているような体験を作れる。そうした新しいエンターテインメントの中で、ボイスチェンジャーが使われる場面は増えていくと思います。

――日本のコンテンツを海外へ届けるという点では、どのような展開が考えられますか。

中村:そこはすでに取り組んでいて、アニメの吹き替え自体はまだ直接やっていませんが、VTuberでは、本人の声色を残したまま英語やアラビア語にするような取り組みをしています。

 ただ日本語を別の言語に置き換えるのではなく、その言語圏で自然に聞こえる話し方に合わせることもできます。声色としては本人だけれど、海外の人が聞いたときには自然に聞こえる。そういうところまで含めて作れるようになっています。

――ここまでのお話を聞いていると、声を再現する精度だけでなく、AIが人とどう会話するかという部分も今後さらに変わっていきそうです。

中村:そうですね。2018年頃は、テキストを入力して自然な音声が出てくること自体がひとつのテーマでした。そこから喜びや悲しみ、怒りといった感情を指定できるようになって、今はさらに、相手に合わせて喋る方向へ進んでいます。

 人間同士なら、相手が悲しそうに話していたら、こちらも少しトーンを合わせますよね。AIも相手の声や会話の流れを踏まえて、それに合った声で返したり、適切な「間」で喋ったりする。より自然なコミュニケーションを作る方向へ研究が進んでいます。

Parakeet 中村泰貴

――そうした変化も踏まえて、Parakeetとして今後さらに取り組んでいきたいことを教えてください。

中村:エンタメ領域もBtoBも、どちらも広げていきたいと思っています。法人向けでは音声変換だけでなく、テキストから音声を作る技術も開発していて、コールセンターの自動化などにも提供しています。

 一方で、BtoBで培った技術を一般の方にも使ってもらいたいと思っています。BtoCについては、利益だけではなく、「音声合成技術ってこういうものなんだ」と知ってもらう意味もあると思っているんです。Paravoを配信などで実際に使って、まずは楽しんでもらう。そうやって音声技術をもっと身近に感じてもらえたらと思っています。

■関連リンク
リアルタイム音声変換 Paravo:https://parakeet-inc.com/paravo
音声吹き替え Patra:https://patra.parakeet-inc.com/patra

AIボイチェンはバーチャルな存在に“魔法”をかけるのか? 「メタバース進化論」から2年後のバーチャル文化(後編)

2022年3月19日、技術評論社より『メタバース進化論――仮想現実の荒野に芽吹く「解放」と「創造」の新世界』(以下、『メタバース…

関連記事

リアルサウンド厳選記事

インタビュー

もっとみる

Pick Up!

「インタビュー」の最新記事

もっとみる

blueprint book store

もっとみる