AIの暗号化された思考が解読される攻撃 主要3社で成立
この記事の要点
AIが途中の思考を記した暗号化ブロックを、弱いモデルに解かせて平文に戻せる攻撃が論文で示された。Anthropic・OpenAI・Googleの3社で成立し、個人情報や認証情報が復元された。AIの中間出力を安全と見なす前提の危うさを実務目線で整理する。
結論
AIが答えを出す途中で記す「思考」の部分は、暗号化されていても安全とは限らない。研究者が公開した論文によれば、AI提供元が発行する暗号化された思考ブロックは、同じ系列の弱いモデルに渡すと平文に戻せる。この手法はAnthropic、OpenAI、Googleの3社で成立し、公開されていた記録から個人情報や認証情報が復元された。AIの中間出力やログを無条件に安全と見なす運用は、そのまま情報漏れの経路になりうる。
何が起きたのか
論文が示したのは、提供元が発行する暗号化された思考ブロックが、同じ提供元の中では利用者やセッションをまたいで通用してしまう点だ。攻撃者は、性能の高いモデルが作った暗号化ブロックを、同じ系列の性能の低いモデルに注入し、平文へ復号させられる。しかも、性能の高いモデル側の制限を破る必要はない。
研究者は、公開リポジトリから集めた31万5320件の思考ブロックを解読し、367件の個人情報と182件の認証情報を復元したと報告している。さらに、目に見えない不正な指示を埋め込み、それがAIの自律的な処理の中で残り続ける経路も示された。これは学術的な報告であり、各提供元が対策を進める可能性がある。最新の状況は公式情報で確認してほしい。
AIの出力に機密が紛れ込む問題は以前から指摘されてきた。基本的な考え方はAIが作った文章の情報漏洩リスクにまとめている。
現場の実務にどう効くか
この報告の実務的な教訓は、AIの中間出力やログを「見えないから安全」と扱わないことだ。多くの企業が、AIとのやり取りを記録として保存したり、開発の過程で公開の場所に置いたりしている。そこに暗号化された思考ブロックが含まれていれば、復元される恐れがあると考えて運用を組む必要がある。
まず、AIに渡す情報の線引きを徹底する。個人情報や認証情報、社外秘の数字を、そもそもAIとのやり取りに含めない。判断基準はAIに入れてはいけない情報の判断基準が使える。次に、ログの保存範囲とアクセス権を見直す。何を記録し、誰が見られるかを整理する考え方は生成AIのログ・監査の考え方にまとめている。やり取りの記録を、社外からアクセスできる場所に置かないことも重要だ。
とくに開発の現場では、AIとのやり取りを検証のために公開の場所へ置くことがある。今回、公開リポジトリから集めた記録が解読された事実は、こうした置き場所が漏れの経路になりうることを示している。テストや検証で使ったAIの記録に機密が混じっていないか、公開範囲が適切かを、あらためて点検したい。目に見えない指示が処理の中に残る経路が示された点は、外部データを扱う自動処理の危うさも突く。仕組みはプロンプトインジェクションとはで解説している。過度に恐れる必要はないが、中間出力も機密として扱う前提へ運用を寄せておくと安全だ。
FAQ
何が問題なのですか。 AIが途中の考えを記した暗号化部分を、同じ系列の弱いモデルに解かせて平文に戻せることが示されました。公開リポジトリから集めた記録から、個人情報や認証情報が復元されたと報告されています。提供元が対策を進める可能性があり、最新は公式で確認してください。
企業は何に注意すべきですか。 AIの中間出力やログを安全と見なさず、機密情報や認証情報を含むやり取りを外部の公開場所に保存しないことです。ログの保存範囲とアクセス権を見直すことが実務的な対策になります。
出典
よくある質問
何が問題なのですか
AIが途中の考えを記した暗号化部分を、同じ系列の弱いモデルに解かせて平文に戻せることが示されました。公開リポジトリから集めた記録から、個人情報や認証情報が復元されたと報告されています。
企業は何に注意すべきですか
AIの中間出力やログを安全と見なさず、機密情報や認証情報を含むやり取りを外部の公開場所に保存しないことです。ログの保存範囲とアクセス権を見直すことが実務的な対策になります。