「ChatGPT用とClaude用、対策は2セット作るんですか」
AI可視性の打ち手を並べていくと、この質問が必ず出てまいります。
へクス子も同じところで止まっておりました。手元の測定を開くと、ChatGPTで名前が挙がる会社とClaudeで名前が挙がる会社が、そもそも噛み合っていないんですよ。
数字がこれだけ食い違うなら、打ち手も分けるのが筋に見えます。ただ、そうすると作業量は素直に倍になりますね。
この分岐を、推薦の結果だけでなく「なぜ推薦されなかったか」の側から測った研究が出ております。
ChatGPTとClaudeで、AI可視性の対策は分けるべきか
推薦されるブランドそのものは約3分の2が食い違いますが、両方から落ちた理由の診断は95.1%が一致します(Unusual.aiのWill Jackら、2026年5月投稿、215本の商用プロンプト・7,763件の共同失敗を分析)。
つまり、プロバイダごとに戦略を作り分ける前に、共通の診断を1回済ませておけば足ります。
ここでいう診断ってのは、自社が「見つけてもらえていない」のか「見つかったうえで魅力が伝わっていない」のか「そもそも別の用途の会社だと思われている」のか、落ちている段階を切り分けることです。研究チームは共同失敗をこの3モードへ分類しました。
215本の商用プロンプトで、両方が落とした7,763件を突き合わせた
Unusual.aiの研究チームが調べたのは、ChatGPTとClaudeの両方を顧客が使っているブランドが、プロバイダ別の最適化をすべきかどうかという実務の分岐です(R)。
手順は素朴であります。商用文脈のプロンプトを215本投げ、両プロバイダの推薦結果を並べる。そのうえで、どちらからも推薦されなかった「共同失敗」を7,763件取り出し、失敗モードの診断が一致するかを数えました。
推薦の食い違いは、まず類似度で押さえてあります。プロバイダ間のJaccard類似度は0.35。同じプロンプトを投げ直したとき同士の類似度が0.50〜0.61なので、プロバイダの差は「聞き直したときのブレ」より大きいということですね。
知名度が低いブランドほど、診断は一致していく
診断の一致率は95.1%(信頼区間は94.3%〜95.7%)。ここに、もう一段面白い内訳が付いております。
- カテゴリリーダー級のブランドで81%
- ロングテールの地域ブランドで99.6%
無名なほうが、両プロバイダで同じ理由で落ちているわけです。逆に言うと、すでに名前が通っている会社ほど、落ち方がプロバイダごとにばらけてまいります。
自社がどちら寄りかで、この研究の使い方は変わりますね。名前が通りきっていないうちは、診断を1回で済ませられる期間だと読めます。
結果は違うのに診断が揃うのは、推薦までの経路が違うから
両プロバイダは、推薦へたどり着く道筋がはっきり違っております。学習時に持っている知識から推薦する割合は、Anthropicで43〜52%、OpenAIで8〜29%だそうな。
片方は記憶から答え、もう片方は探しに行く割合が高い。同じ質問に別々の道で来るので、出てくる社名が揃わないのは当然でしょう。
道順は違うのに、つまずいた原因の分類だけが揃う。通勤経路が全く違う2人が、遅刻の理由だけは同じ「そもそも家を出ていない」で一致するようなものでありますね。
家を出ていないなら、経路の最適化を2本作っても効きません。
この数字をどこまで持ち出せるか
留保は4つあります。どれも自社に当てはめる前に押さえておきたいところです。
- 対象はOpenAIとAnthropicの2プロバイダのみ。GeminiやPerplexityは入っていません
- 市場は米国・英国・EU中心の19業種。日本語圏の実測ではありません
- 単日の測定なので、時間が経ってからのドリフトは測られていません
- 著者4名は全員がUnusual.aiの所属で、同社はAI上のブランド可視性を扱う事業者です
とくに最後の1つは、結論の向きに効きます。「診断は共通化できる」という話は、診断を売る側にとって都合がよい結論ですからね。
そのうえで、推薦結果の食い違いという当社の既存記事の見立て(ChatGPT対策とPerplexity対策は別物)とは、矛盾しません。食い違うのは出てくる結果のほうで、原因の分類は共通、という切り分けになります。
打ち手を分ける前に、落ちている段階を1回だけ診断する
持ち帰るとしたら、順番の話です。
AIごとに打ち手表を作る作業は、その前に1つ工程を挟むと軽くなります。自社が落ちているのは、見つけてもらえていない段階なのか、見つかった先で選ばれていない段階なのか。ここを先に切り分けておく。
その診断結果は、少なくともOpenAIとAnthropicの間では95%の確からしさで使い回せます。名前が通りきっていない会社ほど、使い回せる確率は上がりました。
打ち手を分けるかどうかを考えるのは、診断で段階が見えたあとで十分です。姉妹研究で見た階層別の勝ち負け(AIに「見つかる」と「選ばれる」は別問題)と合わせて読むと、自社の位置が置きやすくなりますよ。
そんなわけで、今日はこのへんで。
出典
- Will Jack, Noah Lehman, Keller Maloney, Sarah Xu(Unusual.ai), “Divergent Recommendations, Convergent Diagnoses: Cross-Provider Failure-Mode Convergence in AI Commercial Recommendation”, arXiv:2606.26116v1, 2026-05-22, arxiv.org(OpenAI と Anthropic にまたがる商用の質問 215 件を対象に、両者で同時に起きた失敗 7,763 件を分析。推薦されたブランドの重なり(Jaccard 類似度)はプロバイダ間で 0.35 で、同じプロバイダで引き直したときの基準値 0.50〜0.61 を下回る。一方で失敗の診断は 95.1% [94.3%, 95.7%] で一致し、カテゴリ首位の 81% からロングテール・地域ブランドの 99.6% まで上がる。学習時の知識だけを頼りに推薦した割合は Anthropic が 43〜52%、OpenAI が 8〜29%。限界: 米国・英国・EU市場、19業種、単日の測定。著者4名は全員、AIでのブランド可視性の計測を売る Unusual.ai に所属している)