もどる HexScope Lens

AIが情報源を選ぶ回路は中間層のたった1個だと分かった研究の話

POINT この記事のポイント
  • AIが誤情報に飛ぶ引き金は中間層のごく少数のヘッド
  • 回路が狭い=監視できる、語られ方は追える対象

「AIに引用されたいなら、出典と数字を入れて書きなさい」。最近、この手のアドバイスをあちこちで見かけませんか。

へクス子も、素直になるほどと思って実践している側の人間です。

でも、前から一つ引っかかっていることがありまして。

その書き方が効くとして、AIの頭の中では何が起きて、こっちの文章のほうが選ばれているんでしょうね。

「なんとなく説得力があるほうを選んでいる」では、答えになっていない気がするわけです。

「なんとなく」で片づけるのは、味の感想を『おいしい』の一言で済ませるようなものでして、実のところ何も説明していないんですよね。

この「AIが情報源を選ぶ瞬間」を、モデルの回路レベルで解剖した研究が出ていました。今回はそのへんを掘ってみます。

そもそもAIは、どうやって「どっちを信じるか」を決めているのか

見ていくのは、2026年5月にarXivで公開された機械的解釈可能性の研究です(R)。

ってのは、AIの中身を配線レベルまで開けて「なぜこの答えになったか」を追う分野のことですね。

研究チームがやったのは、AIが説得されて正解を捨てる現象を、モデル内部の回路から突き止める作業でした。

AIに「わざと間違った説得」をぶつけてみたら

使ったモデルは、Llama-3・Qwen-3・Gemma-2・Gemma-3という4系統のオープンソースAIです。

そこに2種類の課題を投げています。1つ目はNQ2という、説得つきの事実クイズですね。

選択肢は4つ。正解、わざと仕込んだ誤りの誘導先、そしてダミーが2つ、という構成です。

もう1つがGeo-Benchで、こちらはAIにどの情報源を採るか選ばせる課題になります。

4つの候補ソースのうち1つだけを(生成エンジン最適化)済みの版に差し替えて、残りは据え置いたそうな。

そのうえで、介入ベースの因果分析という手法で、回路のどこが効いているかを一手ずつ潰していきました。

答えを決めていたのは、中間層のたった1個のヘッドだった

で、結果がなかなか衝撃でして。

モデルの最終的な答えは、中間層にあるごく少数の(注意ヘッド)が、ほぼ決めていたんですよ。

具体的に主役として名指しされたのが、17番目の層の24番目のヘッド、通称L17H24という1個の部品であります。

このヘッドには面白い性質がありまして、「自分の注意が向いた選択肢を、そのまま答えとしてコピーする」だけなんですね。

つまり、熟慮して正誤を吟味しているわけではない。注意がどっちを向くかで、答えが機械的に決まっていたわけです。

説得は「自信を削る」のではなく「飛び移らせる」

ここで気になるのが、説得されたAIの中で何が変わっているのか、です。

素朴に考えると、正解への自信がじわじわ下がって、最後に逆転する感じがするでしょうな。

ところが実際は違いまして、正解の山から誤答の山へ、いきなり飛び移る離散的なジャンプが起きていました。

引き金は、浅い層(8〜12層あたり)で作られる「証拠ルーティング特徴」という信号です。

これは説得的なキーワードに反応する浅い層のヘッドから生まれて、例の決定ヘッドの注意の向き先を付け替えます。

要は、キーワードが注意のポイントを切り替え、決定ヘッドがその先をコピーする、という一本道だったわけですね。

ただし、ここは正確に置いておきます。高ステークスな領域で、AIが正解を捨てて誘導先に乗り換えた率は29〜62%でした。

半分前後は引っかかるという無視できない数字である一方、裏を返せば毎回ではない、ということでもあります。

この回路、実際のAI検索でも動いていた

ここまでは事実クイズの話でした。でですね、本題はここからです。

NQ2で見つかった回路は、情報源を選ばせるGeo-Benchでも、そのまま動いていたんですよ。

これは「AIに読ませる書き方が効く」という通説に、メカニズム側の裏づけを与えます。

GEO最適化された1つのソースが浅い層のヘッドを刺激して注意を引き寄せ、決定ヘッドがそれを採用する、という流れですね。

「なんとなく説得力があった」ではなく、特定のキーワードが注意を付け替えた結果だった、という説明がつくわけです。

論文はこの回路を「狭く、監視可能(narrow, monitorable)」と表現しています。影響が広く薄く散っているのではなく、通り道がはっきりしている、と。

とはいえ、留保もきちんと置いておきましょう。この分析は統制された多肢選択の設定に限られていて、自由記述の実運用そのものではありません。

しかも、この回路を突いた防御手法が実際に効くかどうかは、まだ評価されていないそうです。

回路が狭いなら、AIの語られ方は測って手を打てる

そんなわけで、この研究がマーケターに教えてくれることは、意外とはっきりしています。

AIが自社をどう語るかは「気分」ではなく、特定可能な処理だ、ということです。

自社について事実と違う”説得力のある”情報が外に置かれていれば、AIはそちらへ飛びます。29〜62%という数字がそれを示しています。

逆に言えば、正しい事実が説得力のある形で置かれていれば、注意はそちらを向く余地がある、というわけですね。

そんなわけで、打ち手は2つに絞れるということになりましょう。

  • 正しい事実を、第三者の目につく場所に、説得力のある形で置いておく
  • AIが自社を今どう語っているかを、継続して測る

回路が狭いということは、監視できるということです。ブラックボックスで手が出せない相手ではない、と。

AIにどう語られているかは、諦めて眺めるものではなく、測って手を打てる対象なんですよ。まずは今の語られ方を数えるところから始めてみてくださいませ。


出典

  • Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang, “How LLMs Are Persuaded: A Few Attention Heads, Rerouted”, arXiv:2605.09314, 2026年5月10日, arxiv.org(Llama-3 / Qwen-3 / Gemma-2 / Gemma-3 の4系統で、説得付き事実QA「NQ2」とソース選択タスク「Geo-Bench」を介入ベースの因果分析。中間層の少数の注意ヘッド(主要 decision head は layer17 head24)が答えをほぼ決定し、説得は自信の低下ではなく正解から誘導先への離散的ジャンプを起こす。引き金は浅い層(layer8〜12)で説得的キーワードに反応して作られる rank-one の証拠ルーティング特徴。高ステークス領域での説得受容率29〜62%。同回路は Geo-Bench にも転移=実際の生成エンジンのソース選択でも作動。回路は narrow, monitorable。限界: 統制された多肢選択設定に限定、防御手法の評価は未実施)
この記事をシェア
Bluesky X
記事一覧にもどる