DeepL Voiceが「音声から音声」の翻訳に対応 会議と対面で試した、その実力は?

韓国語の返答が日本語で届く Zoomで採用面接を体験
会場では、PCを用いたオンライン会議と、スマートフォンを用いた対面会話の2つのデモを実際に体験した。
まず、デスクトップアプリを用いた「DeepL Voice for Meetings」の検証として、遠隔地にいる韓国語話者のスタッフとZoomをつなぎ、用意された台本に沿って会話を行った。担当したシナリオは「海外プロジェクトの採用面接」だ。

筆者が日本語で「当社の海外プロジェクトに応募された理由を教えていただけますか」とマイクに向かって話すと、相手側には韓国語に翻訳された音声が届く。続いて相手が韓国語で応答すると、手元のスピーカーから流暢な日本語の音声が返ってきた。
出力された音声は機械的な棒読みではなく、相手の話し方のテンポや声のトーンが反映されており、肉声に近い感覚で聞き取ることができた。
アプリ不要で英語の説明を日本語に スマホで試す「グループ会話」
続いて、対面環境を想定した「グループ会話」のデモを試した。説明担当者が作成したバーチャルルームのQRコードを筆者のスマートフォンで読み取ると、ブラウザ上で名前と言語(日本語)を選択する画面が立ち上がり、すぐに入室できた。

ワイヤレスイヤホンを装着した状態で担当者が英語で説明を始めると、イヤホンからほぼリアルタイムで日本語の音声が再生された。同時に、スマートフォンの画面上には日本語に訳されたテキストが次々と表示されていく。
翻訳音声をマイクが拾い直してループするのを防ぐため、イヤホンの使用が推奨されているが、画面上のスピーカーアイコンをタップして音声をミュートにし、テキストの字幕表示だけで追うことも可能だった。それにより、周囲が騒がしい場所や、音声を流せない状況でも柔軟に使い分けられる。
翻訳音声の遅延をどう縮めるか 次世代モデルの開発も進む
DeepLの強みである高い翻訳精度に加え、今回のアップデートによって「話者の声やニュアンスを残した音声コミュニケーション」と「AIエージェント経由でのシームレスな文書・テキスト翻訳」の双方が実用段階に入った。
現状の音声対音声翻訳には処理の遅延が残るものの、DeepLでは現在、認識・翻訳・合成の3つのモデルを1つに統合し、遅延の大幅な削減と文脈判断の柔軟化を図る次世代モデルの開発も進めているという。言語の壁を感じさせない業務環境の実現に向け、今後のさらなる進化にも注目したい。























