「申し訳ありません、それはお答えできません」。AIチャットがきちんと断っていても、その直前に画面へ出ていた「考え中」の文に、隠しておきたい情報がそのまま書かれていた。そんなことが、いまのAIでは起こりえます。
- AIの「考え中」の表示とは何か。なぜそこから情報が漏れるのか
- 2025〜2026年の最新の研究で分かったこと(国際学会の論文や、大手3社のAIへの攻撃の報告)
- AIチャットを導入している、またはこれから導入する会社が確認すべき7つのこと
情報は2026年10月11日時点で公開されている論文と資料にもとづきます。図の会話は説明のためにAQUAが作った架空の例です。
1. AIの「考え中」の表示とは
最近のAIの多くは、答える前に頭の中で考える時間をとります。問題を分けて整理し、いくつかの答え方を比べ、間違いがないか確かめてから答える。この「考える過程」を持つAIは、推論モデルと呼ばれます。
ChatGPT・Claude・Geminiなどのサービスや、それらを組み込んだ会社のAIチャットでは、この過程の全部や要約を「考え中」「思考」として画面に表示できるものが増えています。利用者にとっては、AIがどう考えたかが分かって安心できる便利な機能です。
ところが、ここに見落とされやすい落とし穴があります。会社の安全対策は、たいてい「最後の答え」に向けて作られているということです。
2. 答えは守っても、「考え」から漏れる
会社がAIチャットを作るときは、利用者には見えない「裏の設定」(システムプロンプト)で、AIに役割や決まりを伝えます。たとえば「値引きの条件は答えない」「社内の道具の名前は出さない」といった決まりです。
AIは最後の答えではこの決まりを守ります。しかし考えている途中では、決まりを守るために、決まりの中身そのものを思い浮かべてしまうことがあります。その考えが画面に出ていれば、答えで断っても意味がありません。

考えの欄から漏れうるものは、大きく3つです。
裏の設定値引きの上限、社内ルール、使っている道具の名前、断るべき話題の一覧など
預かった個人情報答えを作るためにAIへ渡した、顧客の氏名・住所・購入履歴など
秘密の値裏の設定に書いてしまった鍵やパスワード、社内のURLなど
セキュリティの国際的な団体OWASPも、AIアプリの10大リスクの2025年版で、「システムプロンプトの漏えい」を新しく加えました。裏の設定は聞き出される前提で考え、パスワードや鍵のような秘密は書かないよう求めています。
3. 最新の研究で分かったこと
この問題は、いま世界の研究者が注目しているテーマです。代表的な3つの研究を紹介します。
大規模なAIを個人の代理として使う場面で、考えの過程を調べた研究です。考えの中には利用者の大事な情報が頻繁に含まれ、外から仕込まれた指示(プロンプトインジェクション)で引き出されたり、うっかり答えに混ざったりすることを示しました。さらに、考える量を増やすほど漏れも増えることが分かっています。著者らは「安全対策は、出力だけでなくAIの内側の考えにまで広げなければならない」と結論づけています。
ミュンヘン工科大学のチームが、11種類の個人情報について、考えの過程からどれだけ漏れるかを測りました。考えさせると漏えいは一貫して増え、特に危険度の高い情報で目立つという結果です。漏れを止める「門番」として、決まった言い回しで見つける方法、軽い分類器、名前や住所を見つけるAI、別のAIに判定させる方法の4つを比べましたが、どのAIや考える量でも勝てる万能の方法はなかったとしています。
Anthropic・OpenAI・Googleは、考えの中身を暗号にして利用者から隠す仕組みを使っています。研究チームは、この暗号にした考えを別のAIに読ませて、中身を書き出させる方法を見つけました。公開されていた31万5,320個の考えのかたまりから、個人情報367件、鍵やパスワードなどの認証情報182件を取り出せたと報告しています。研究チームは公開前に各社へ知らせ(責任ある開示)、対策も提案しています。
3つに共通するのは、「考え」は利用者に見えていなくても、見えていても、情報の出口になりうるという点です。そして、出口をふさぐ決定打はまだありません。
「考え」も、答えと同じ「出力」として扱う
多くの会社は、AIの答えに対しては「個人情報を出していないか」「不適切な言葉はないか」を確かめる仕組みを入れています。しかし画面に出る考えは、その検査を通っていないことが少なくありません。画面に出るものは、すべて出力です。考えの欄も、答えと同じか、それ以上に厳しく確かめるべきです。
一番確実なのは「知らせない」こと
研究が示すとおり、考えから漏れるのを完全に止める方法はまだありません。だからこそ、AIに知らせなくていい秘密は、そもそも渡さないのが一番確実です。値引きの上限のような判断は、AIではなく裏側のプログラムに持たせる。鍵やパスワードは設定に書かない。顧客の情報は、その答えに必要な分だけを渡す。漏れても困らない作りにしておけば、考えの表示はただの便利な機能のままでいられます。
表示する前に「文ごと」にふるいにかける
それでも考えを表示したい場合は、画面に出す直前に、1文ずつ確かめて、裏の設定に触れる文だけを落とす仕組みが有効です。考えの流れは残したまま、危ない文だけを取り除けます。ただし、言い回しは毎回変わるので、決まった言葉の一覧だけでは取りこぼします。実際の質問で試し、すり抜けた文から学んで、ふるいを育て続けることが欠かせません。
4. 導入企業が確認すべき7つのこと
AIチャットをすでに使っている会社も、これから導入する会社も、次の7つを確かめてみてください。
- 考えの表示がオンになっているか、誰に見えているか。社内向けだけなのか、お客さまにも見えるのかで、危険の大きさが変わります
- 裏の設定に秘密を書いていないか。鍵、パスワード、社内のURL、値引きの上限、取引先の名前などがないか、一度すべて読み直す
- AIに渡す顧客の情報は最小限か。答えに必要のない項目まで、まとめて渡していないか
- 考えの表示も、答えと同じ検査を通しているか。個人情報や裏の設定に触れる文を、表示の前に取り除けているか
- 考えが記録(ログ)に残るか。残るなら、保存する期間と、見られる人を決めているか
- テストで「裏の設定を聞き出す質問」を試しているか。そのとき、答えだけでなく考えの欄まで確認しているか
- 使っているAIの提供会社の資料を確認したか。考えの表示がどう作られ、何が含まれうるのか、設定で止められるのかを把握しておく
AIチャットの「漏れ口」、確かめてみませんか
AQUAでは、AIチャットの開発に加えて、攻撃者と同じ目線で弱いところを確かめるAI脆弱性診断を行っています。答えだけでなく考えの欄まで含めて、裏の設定や個人情報が漏れないかを確かめます。
まとめ
AIの「考え中」の表示は、利用者の安心につながる便利な機能です。しかし最新の研究は、答えをどれだけ守っても、考えの過程が新しい情報の出口になりうることを示しています。
大切なのは3つです。画面に出るものはすべて出力として確かめること。漏れて困る秘密は、そもそもAIに渡さないこと。そして、答えだけでなく考えまで含めて試すこと。AIを安心して使い続けるために、いまのうちに確かめておきましょう。
- Green et al.「Leaky Thoughts: Large Reasoning Models Are Not Private Thinkers」EMNLP 2025(arXiv:2506.15674)
- Ahrend et al.「Safer Reasoning Traces: Measuring and Mitigating Chain-of-Thought Leakage in LLMs」2026年3月(arXiv:2603.05618)
- Panfilov et al.「Stealing Reasoning Traces from Proprietary LLM APIs」2026年8月(arXiv:2608.09867)
- OWASP「LLM07:2025 System Prompt Leakage」(OWASP Top 10 for LLM Applications 2025)
画像について
- 見出し画像と図は、AQUAが作成しました。図の会話は説明のための架空の例です。