DeepL Voiceが「音声から音声」の翻訳に対応 会議と対面で試した、その実力は?

韓国語の返答が日本語で届く Zoomで採用面接を体験

 会場では、PCを用いたオンライン会議と、スマートフォンを用いた対面会話の2つのデモを実際に体験した。

 まず、デスクトップアプリを用いた「DeepL Voice for Meetings」の検証として、遠隔地にいる韓国語話者のスタッフとZoomをつなぎ、用意された台本に沿って会話を行った。担当したシナリオは「海外プロジェクトの採用面接」だ。

会場で試したデスクトップアプリ。韓国語と日本語のやり取りが表示される(筆者撮影)

 筆者が日本語で「当社の海外プロジェクトに応募された理由を教えていただけますか」とマイクに向かって話すと、相手側には韓国語に翻訳された音声が届く。続いて相手が韓国語で応答すると、手元のスピーカーから流暢な日本語の音声が返ってきた。

 出力された音声は機械的な棒読みではなく、相手の話し方のテンポや声のトーンが反映されており、肉声に近い感覚で聞き取ることができた。

アプリ不要で英語の説明を日本語に スマホで試す「グループ会話」

 続いて、対面環境を想定した「グループ会話」のデモを試した。説明担当者が作成したバーチャルルームのQRコードを筆者のスマートフォンで読み取ると、ブラウザ上で名前と言語(日本語)を選択する画面が立ち上がり、すぐに入室できた。

スマートフォンで参加したグループ会話。英語の説明が日本語の字幕で表示される(筆者撮影)

 ワイヤレスイヤホンを装着した状態で担当者が英語で説明を始めると、イヤホンからほぼリアルタイムで日本語の音声が再生された。同時に、スマートフォンの画面上には日本語に訳されたテキストが次々と表示されていく。

 翻訳音声をマイクが拾い直してループするのを防ぐため、イヤホンの使用が推奨されているが、画面上のスピーカーアイコンをタップして音声をミュートにし、テキストの字幕表示だけで追うことも可能だった。それにより、周囲が騒がしい場所や、音声を流せない状況でも柔軟に使い分けられる。

翻訳音声の遅延をどう縮めるか 次世代モデルの開発も進む

 DeepLの強みである高い翻訳精度に加え、今回のアップデートによって「話者の声やニュアンスを残した音声コミュニケーション」と「AIエージェント経由でのシームレスな文書・テキスト翻訳」の双方が実用段階に入った。

 現状の音声対音声翻訳には処理の遅延が残るものの、DeepLでは現在、認識・翻訳・合成の3つのモデルを1つに統合し、遅延の大幅な削減と文脈判断の柔軟化を図る次世代モデルの開発も進めているという。言語の壁を感じさせない業務環境の実現に向け、今後のさらなる進化にも注目したい。

DeepLがChatGPT、Claude、Copilotと連携 会話の中から文書翻訳や用語集の適用が可能に

DeepLがChatGPT、Claude、Microsoft Copilotと連携。AIとの会話からテキストや文書を翻訳でき、用…

関連記事