もどる HexScope Lens

AI推薦を2,961回調べたら「順位より出現率」だった研究の話

POINT この記事のポイント
  • 同一リスト一致1%未満、順序一致は約0.1%
  • 60〜100回の反復で出現率は実務指標になる

「昨日と今日でおすすめが違う」から始まる不信感

AIにブランド推薦を聞くと、昨日はA社、今日はB社、みたいな揺れが普通に起きますよね。これを見て「順位が変わるなら測定なんてムリだろう」と感じるのは、かなり自然な反応だと思います。

へクス子も、月曜に見た並び順をそのまま資料へ貼ってしまい、金曜に開き直して青くなっております。

ただ、単発の順位がブレることと、測定そのものが無効なことは、まったくの別問題なんですよ。見る単位をちょっと変えてやると、ちゃんと実務に残せる信号が出てきます。

2,961回の観測で、単発順位はほぼ再現しなかった

SparkToro/Gumshoeの調査(R)は、600人・2,961回というなかなかの規模で、推薦の揺れを測ったんだそうな。

  • 同一リスト一致は1%未満
  • 順序一致は約0.1%

この数字を見るかぎり、1回の回答画面をそのまま「今月の順位」として報告するのは危ういですね。サイコロを1回だけ振って「このサイコロは1が出やすい」と決めつけるようなもので、順位はノイズまみれと言ってよいでしょうな。

でも出現率は安定し、比較可能な差が残った

ところが、同じデータを出現率のほうから数え直すと、高可視性ブランドは71回中97%で名前が挙がっていました。「何位か」ではなく「どれくらい出るか」で見ると、ちゃんと再現性が出ています。

意味的に似ていないプロンプト群でも、返ってくるブランド集合は寄っていく傾向が観測されました。

これはErricaらの研究(Errica et al., NAACL 2025)が示した「表現の差より意味構造のほうが効きやすい」という結果とも、きれいに整合するわけですね。

勝負はモデル比較より「測定設計」の揃え方

実務でやりがちなのが、「どのモデルが優秀か」を先に語ってしまって、測定条件の差を見落とすパターンであります。

同じプロンプトを60〜100回まわす設計なのか、10回未満でエイッと結論を出しているのかで、読み取れる精度はまるで違ってくるんですよ。

もう一つ、平均値と一緒にが併記されているかどうかも確かめておきたいところです。差があるように見えて、実は誤差の帯どうしが重なっているだけ、なんてケースは珍しくありませんからね。

へクス子が真っ先に見るのは、順位の増減より、その数字が何回聞いた結果なのかというところなんですよ。60回まわした「1位」と、10回で決めた「1位」では、重みがまるで違いますからね。

順位の上下より「測定条件」をそろえる

AI推薦を月次で追うなら、順位の上下に一喜一憂するより、測定条件をそろえることのほうがずっと大事です。

2,961回の反復測定が教えてくれるのは、AIの答えにはそもそもブレがあるからこそ、単発順位ではなく出現率で見るべきだ、ということなんですよね。

ツールを選ぶときは、反復回数と出現率の集計ロジックが公開されているかどうかを、最初に確かめておきましょう。

社内レポートも同じで、質問設計・モデル条件・集計期間をそろえて並べる。

ここが崩れると、本当に改善したのか、それとも測り方が変わっただけなのか、区別がつかなくなりますからね。

7本の関連調査をまとめて俯瞰したい場合は、AI可視性ツールは「順位より出現率」を見れば外しにくい話 が全体の入口になりましょう。


出典

この記事をシェア
Bluesky X
記事一覧にもどる