「これ、うちのサイトに書いてましたっけ」
自社の名前でディープリサーチをかけたら、出典つきの調査レポートが返ってきた。出典欄には自社のページも並んでおります。
ところが本文のほうには、自社サイトのどこにも書いていない話が、自社の話として並んでいる。根拠として貼られているのは、自社のページなんですよ。
たぶん、その場でリンクを1つ開いたはずです。ページはちゃんと表示されて、話題も合っておりました。
それで2つ目は開かずに、本文を読み進めた。開いて確かめる作業は、たいていそこで終わるものですな。
へクス子はある測定を読んでから、自分の可視性レポートに足りない列を数え直しております。
AIが貼った出典リンクは、レポート本文の記述をどれくらい裏づけているのか
リンクが開ける率は94%超。話題として合っている率は80%超でした。そのうえで、引用先が本文の記述を事実として裏づけていた率は、最前線のモデルで39〜77%です。開くことと、合っていることは別だったわけですね。
測ったのは PricewaterhouseCoopers の6人で、14のAIモデルに130件の調査依頼をこなさせ、レポートに貼られた引用を1件ずつ開き直しております(R)。
論文が公開されたのは2026年5月7日。依頼のもとは英語の公開ベンチマーク2種です。
ディープリサーチ・エージェントってのは、AIが何十から何百ものページを自分で見に行って、出典リンクつきの調査レポートを書いてくれる機能のことですね。ChatGPTやGeminiの「深く調べる」モードがこれにあたります。
一致の判定に使ったのは、採点基準に沿って点を付けるAIでして、人手のレビュー50〜100件で目盛りを合わせたものだそうな。全件を人が読んで判定したわけではありません。
可視性レポートがふだん数えているのは、いちばん外側の層です
レポート本文の記述に、引用が1件貼られている。この測定は、その1件を3か所に分けて見ております。
- リンクが実際に開くか
- 引用先の話題が、その記述と合っているか
- 引用先の中身が、その記述を事実として裏づけているか
可視性のレポートで「引用◯件」と数えている数。たいていは1つ目を通った件数です。2つ目まで見ていれば、AIが自社ページを根拠として扱ったところまでは分かりますな。
3つ目だけが、AIの回答の中で自社について何と言われたかを見ています。層が別です。1つ目の件数をいくら積んでも、3つ目は見えてきません。
出典を辿ればページは実在するし、話題も合っている。ただ、レポート本文の数字が、自社ページの記述と食い違う。
取扱説明書の付いた家電を買ったら、その説明書だけ別の型番のものだった、みたいな話ですなぁ。型番は1つ違いですけどね。そちらのレポートの1件は、どの層まで通った1件でしょうか。
検索を150回まで増やしても、リンクと話題の一致は保たれていました
同じ測定で、AIに使わせる検索の回数を2回から150回まで動かした実験をやっております。
裏づけの一致は、2つのモデルの平均で約42ポイント下がりました。GPT-5.4は79%から17%へ、Claude Opus 4.6は80%から58%へ動いています。
深く調べさせれば正確になる、と思っていませんでしたかね。へクス子は思っておりました。
このとき、リンクが開ける率と話題の一致は下がっておりません。どの深さでも92%を超えたままです。落ちたのは3つ目の層だけでした。
で、こちらから動かせるのは、AIがどれだけ深く読むかではなく、読まれた1文が単独で正しく取れる形になっているかどうかです。
置き方の効果までは、この論文が測ったわけではありません。ただ、1文の中に次の3つを入れておくと崩れにくいですね。
- 数値そのもの(「32%増」)
- いつの数値か(「2026年8月」)
- 何と比べた数値か(「前年同月比」)
「2026年8月の出荷は前年同月比で32%増でした」と1文で完結させておく。この形なら、1文だけ抜き出されても意味が変わりません。
「昨年比で大きく伸びました」のほうは、前後の段落まで読んでもらえないと、何と比べた話なのか分からなくなるわけです。
この数字を自社へ当てるときに、どこで止めるか
この測定が見ているのは、ディープリサーチ機能が書いた調査レポートの引用です。ChatGPTに普通に質問したときの回答そのものは、この測定から外れます。
調査依頼130件のもとは英語のベンチマークで、日本語の質問は1つも入っておりません。日本語で聞いたときに同じ形になるかどうか。この論文の守備範囲の外ですね。
発行元の PricewaterhouseCoopers は、AI導入支援を事業に持つ会計・コンサルティング事務所です。査読前のプレプリントでもあります。
モデルは14バージョンで、評価した時点のもの。著者自身も、Webの引用は時間が経つと消えたり中身が変わったりする、と限界に挙げております。
ここまでの限定を差し引くと、自社へ残るのは何なのか。
数字をそのまま自社の値として持ち帰る使い方には向きません。持ち帰るなら、3つの層を分けて数えるという枠のほうでしょう。
月に10件でいいので、引用を1件ずつ開いて確かめる
今月AIの回答で自社が引かれた件数から、無作為に10件を選びます。目についた順に開くと、印象のいい引用ばかりが集まりますからね。
開いた先に書かれている自社の話が、自社ページの記述と合っているかを見て、合っていた件数を控えておく。
その10件は、リンクが開いた件数でも、話題が合った件数でもありません。3つ目の層を、自分の手で1回測った数になります。
引用が増えた月は、その中身も同じ調子で正確になっているのか。今回の測定が言っているのは、そこでしてね。回数の列だけを見て、投資の判断を通してしまう。すると、その差は最後まで見えないままです。
引用と言及を2列に分けるところまで来ている方なら、その隣にもう1列足す形になりますな(「引用」と「言及」を分けて数えてみよう!)。
出典
- Onweller, H. et al.(Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S.), “Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents”, arXiv:2605.06635, 2026-05-07, https://arxiv.org/abs/2605.06635