もどる HexScope Lens

AI対策のチェックリスト、研究45本で一貫して効いてたのはどれ?問題

POINT この記事のポイント
  • 研究45本を横断して残った要因は「関連性」と「位置」
  • AI対策リストを2軸で並べ替えるという順序の話

「で、この30項目、どれからやります?」

構造化データを入れる。引用を足す。統計を入れる。AI検索向けの対策を書き出していったら、へクス子の表は30行まで伸びておりました。

先月の定例では、その表を映したまま20分が過ぎましてね。誰も1行目を指させないまま、次の議題へ移りました。

ところが、AI向けの最適化を扱った研究を45本まとめて読み直した論文だと、どのプラットフォームでも一貫して効いていた要因は2つしか残っておりません。

2026年7月に投稿された、査読前のプレプリントであります。

GEOの施策のうち、一貫して効いているのはどれなのか

質問との関連性と、文脈の中での位置。この2つです(MartinezのR)。45本を横断して、条件が変わっても残ったのはここだけでした。

GEOってのは、AIの回答で自社のページが引用・参照されやすくなるようにする取り組みのこと。日本語では「生成エンジン最適化」と訳されます。

対象になったのは、2023年11月16日から2026年7月14日までに出た45本ですね。

効くと言われている2つは、実務でいうとどこを触る話なのか。

権威的に書くより、質問に答えているほうが選ばれます

1つ目は、質問と文書の関連性です。モデルは、人間が信頼性の手がかりとして見るものより、質問との明示的な一致を強く選ぶ。サーベイはそう整理しております。

具体の数字は、GEOという言葉を最初に定義した2024年の元論文のほうにあります。9つのデータセット由来・25領域にまたがる1万件の質問で、書き換えの手法ごとに可視性がどう動くかを測ったものですね(Aggarwalらの研究R)。

そこでの伸びは、引用文の追加が約44%、統計・数値の追加が約34%、出典の明記が約29%でした。いずれも応答内での出現量を位置で重み付けした指標で、ベースライン比の相対改善です。

いっぽう、権威的な書き方に寄せる手法は約13%。キーワードの詰め込みにいたっては、約8%のマイナスであります。

答えの中身を具体的にする手法が上に、書きぶりを寄せる手法が下に来ている。この並びを「モデルは権威の手がかりより、質問との一致を選ぶ」と読んだわけですな。

読んだのはサーベイの著者です。45本とは別に、新しい実験で確かめたものではありません。

実務側で動かせるのは、見出しと本文を質問の形に合わせるところ。読者が実際に打ち込む質問の平叙形を見出しに置いて、その直下で答え切る形ですね。

情報源を文脈の上へ動かすほうが、書き換えより効きます

2つ目が、文脈の中での位置です。情報源を文脈の上のほうへ動かすことは、大半の書き換えより効果が大きい。

ここでいうってのは、AIが回答を書く直前に手元へ集めた文書のかたまりのことですね。ここに入っていない情報は、どれだけ書き方を工夫しても回答には出てきません。

つまり位置の話は、集められたあとの並び順を指しております。誰の文書を上に置くかを決めるのは検索の側なので、こちらが直接いじれる場所ではない。

じゃあ、こちらから触れるところは無いのでしょうか。

集められた1本の中で、答えがどこに置かれているかは、こちらの持ち物であります。冒頭で答えている文書と、5画面ぶんスクロールしてやっと答えが出る文書とでは、切り出される断片が変わりますからね。

ただし、サーベイが測っているのは文書どうしの順番であって、ページの中の順番ではありません。ここは推測を1つ挟んでおります。

施策の数を増やす前に、取得される手前を通します

汎用の小技は、プラットフォームをまたいでは移りません。あるAIで効いた書き換えが、別のAIでも同じように効くという確認が取れていない。

サーベイには、もう少し厳しい書き方もしてありましてね。プラットフォームをまたいで時間的にも安定した「自然な見つかりやすさ」への因果効果を示せた手法は、45本の中に1つも無かった。

効いたと報告されている数字の多くは、すでに候補に入っている文書に対して測られたものだからです。候補に入る手前を動かした証拠ではない。

先に通すのは、どちらでしょうか。

取得される手前、つまり検索にページを見つけてもらって候補の一覧に入っているところと、質問との関連性が先です。そのうえで、取得されたあとの置かれ方を見る。

前段が通っていないと、後段の工夫は届きません。棚に並んでいない商品のPOPを何枚描き直しても、お客さんの目には入らないのと同じでありますな。

45本の中身を見ると、測り方に偏りがあります

著者はを5段階に置いております。いちばん上が現場で条件を無作為に割り振る試験、いちばん下が固定文脈の合成シナリオですね。

エビデンスの階層ってのは、その結果がどれくらい確からしいかを、研究のやり方の側から並べた物差しのこと。

で、45本の多くは下位の「固定文脈の合成シナリオ」に当たります。実際の検索から文書が取得される過程を含まない条件で測られた、ということですな。

そもそもこれは新しい測定ではありません。既存の研究45本を読み直したサーベイです。

査読前のプレプリントでもあります(arXiv:2607.14035、2026年7月15日投稿)。第三者の点検はまだ入っておりません。

著者の所属は、論文の1ページ目に書かれておりませんでした。連絡先のメールアドレスと、研究者ひとりずつに振られるORCIDという識別番号だけです。どこの誰がやったかで信頼度を測ることはできない、ということですね。

対象になった研究も、英語圏が中心でしてね。日本語での再現は含まれておりません。

日本語の回答で同じ2つが残るかは、まだ誰も測っていない。ここは自社で確かめる側に回るしかないところであります。

チェックリストを「関連性」「位置」「それ以外」の3つに割る

AI対策の表に、箱を3つ用意します。質問との関連性に効く行、取得されたあとの置かれ方に効く行、そのどちらでもない行。

どちらでもない行は、消さずに下へ回します。45本の中で一貫した効果が確認できなかっただけで、効かないと証明されたわけではありませんからね。

着手の順番は、関連性が先です。

位置の箱を開くのは、取得される手前が通ったあとですね。

個別の施策がどれだけ引用を動かすかはAIに引用される記事には「数字と出典」を足せ、と示した研究の話に、検索順位とAIの引用が別物である話は「うちは検索で勝てないからAIでも無理」?むしろ11位以下にこそチャンスありに置いてあります。

へクス子の30行は、9行と21行に割れました。会議で20分黙っていた表が、9行まで減ると急に指させるようになるもんですな。

出典

この記事をシェア
Bluesky X
記事一覧にもどる