AIの“考え方”まで模倣の標的に OpenAIが推論抽出を阻止、「Kimi」開発元の関与を指摘

 OpenAIは9月30日、AIが回答を導き出す際の非公開の推論過程を、別のAIの学習や能力の再現に利用するために抽出しようとする組織的な活動を特定し、阻止したと発表した。関連する活動は7月に確認され、同月28日までに対処したという。

 同社が問題視しているのは、AIの出力や推論を無断で集め、別のモデルを訓練・改良する「敵対的蒸留」だ。最終回答だけでは分からない、AIが課題に取り組む内部の記録を取り出すことで、他社がその能力を再現しやすくなる可能性がある。

 OpenAIによると、実行者はモデルとの会話を操作し、本来は見えない推論内容を表示させようとしていた。暗号を破ったり、データベースへ侵入したり、保存済みの利用者の会話へ直接アクセスしたりした行為ではないと説明している。

 活動は7月1日に始まり、24日と25日に急増。この間に4000人超から約1万6000件の関連リクエストが送られ、その後の調査で1万5000人超のユーザー群による関連活動が見つかった。これらは抽出の試みを示す数字であり、すべて成功したことを意味するものではない。

 同社は、活動の中核をなす一群について、AIサービス「Kimi」の開発元Moonshot AIの関係者によるものと判断している。一方、確認された実行者全員が、同じ主体に属していたかは不明としている。

 OpenAIは不正なアカウントを停止・制限し、非公開の推論を復元できる経路を閉鎖した。推論が出力に混ざるおそれを検知し、送信を保留する仕組みも追加。活動が外部サービス経由へ移った際には、提供者と協力して対処したという。

 また、抽出した推論を別のAIの学習に使うと、元のAIが回答に適用している安全対策が引き継がれない可能性があると指摘。業界団体Frontier Model Forumや政府の情報共有経路を通じ、調査結果を共有した。追加の対策と調査は続いている。

Anthropicが「2028年の米中AI競争」予測論文を発表  提示された“2つのシナリオ”が示す未来とは

Anthropicは5月14日、米中のAI開発競争の行方を論じた政策論文「2028: Two scenarios for glo…

関連記事