DeepL Voiceが「音声から音声」の翻訳に対応 会議と対面で試した、その実力は?

言語AIサービスのDeepLが、リアルタイム音声翻訳ソリューション「DeepL Voice」の大幅なアップデートと、AIアシスタントとの接続規格「Model Context Protocol(MCP)」への対応に関する説明会を開催した。
これまで提供されてきた音声からテキスト(字幕)への変換に加え、話者の声質を維持したまま音声で出力する「音声から音声への翻訳」が正式に一般提供された。さらに、オンライン会議の利便性を高めるデスクトップアプリや、各種AIツールからDeepLの翻訳を呼び出せるMCP連携など、現場の業務効率化を見据えた機能が紹介された。

字幕から音声へ 声の特徴や抑揚も伝える会議翻訳
新たに提供が開始されたWindowsおよびMac向けの「DeepL Voice デスクトップアプリ」は、Zoom、Microsoft Teams、Google Meetといった主要なオンライン会議ツールと連動する。従来のブラウザ版では会議URLを手動で貼り付けてボットを招待する必要があったが、デスクトップアプリでは参加中の会議を検知して連携できるようになった。

目玉となるのが「音声から音声への直接翻訳(Voice to voice)」の実装だ。話者が発話した内容が、相手側のスピーカーから翻訳先の言語の音声として再生される。
あわせて搭載された「スピーカーマッチ」は、あらかじめ用意された無機質な合成音声ではなく、話者本人の声質をリアルタイムに解析して模倣した音声を生成する機能だ。これにより、複数人が参加する会議でも「誰が話しているか」を自然に識別しやすくなる。疑問文の抑揚や発話の強弱、トーンといったニュアンスも反映される。事前の音声サンプルのアップロードや登録は不要で、音声データは処理後にサーバーへ保持・蓄積されないセキュリティ設計となっている。

主な用途としては、海外拠点とのオンライン定例会議やプロジェクトの進捗確認、多国籍なメンバーを対象とした採用面接などが想定されている。
QRコードで参加し自分の言語で聞く 対面で活用できる「グループ会話」
対面コミュニケーション向けの「DeepL Voice for Conversations」には、複数人で使える「グループ会話」機能が追加された。従来の端末1台を交互に向ける方式から進化し、ホストが作成したバーチャルルームに各参加者が自身の端末から参加する形式をとる。
ホスト以外の参加者は、DeepLのライセンスや専用アプリを持っていなくても、QRコードを読み取ってブラウザから入室できる。

ChatGPTやClaudeからDeepLを呼び出す MCP連携で文書翻訳も
テキスト翻訳および文書翻訳の領域ではMCPへの対応が発表された。これにより、Claude、ChatGPT、Microsoft CopilotなどのAIアシスタントから、DeepLの翻訳エンジンを直接呼び出せる。
サーバーはDeepL側がホストするリモート形式で提供されるため、利用者が自前でサーバー環境を構築する必要はない。AIアシスタントで調査や文章作成を行いながら、画面を切り替えることなく「この文章をDeepLで翻訳して」「このPDF資料をフォーマットを維持して翻訳して」と指示を出すだけで完結する。

WordやExcel、PowerPoint、PDFなどのレイアウトを保った文書翻訳や、企業ごとの用語集の適用にも対応しており、外国語の請求書確認や契約書のチェックといったバックオフィス業務の負荷軽減につながる。





















