ChatGPTやGeminiに「おすすめの〇〇は」と聞いたとき、自社の名前は出てくるのか。この問いを、5つのAI検索と102のブランドで数えた論文があります。
2026年6月にarXivで公開された「Generative Engine Optimization at Scale: Measuring Brand Visibility Across AI Search Engines」です。
2026年3〜5月に集めた10万2,025件の回答と、14万9,912件の引用元を集計しています。
この記事は、その論文を原文から読んで整理します。先にお伝えしておくと、著者はAI検索での見え方を計測するサービスの共同創業者で、データはそのサービスの顧客データです。
また、ページを書き換えて効果を比べた実験とは違い、本番データを集計した観察研究です。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。自社の名前がAIの回答にどのくらい出るかを測るとき、どんな質問を、何回、どう分けて数えればよいのかを確かめておくために、この論文を読みました。
結論:3行で言うと
- 社名を入れないカテゴリの質問で、計測1回目に名前が出た割合は、知名度の高い順に73%・44%・11%でした。1段下がるごとに約30ポイント(割合の差)低くなっています
- AIが示した引用元の約78%は企業のサイトで、計測対象ブランド自身のドメインは2.9%でした。ページの形式では、「おすすめ〇選」のようなランキング記事が全引用の21.0%で最多です
- 名前が出るかどうかは、同じ質問ならほぼ毎回同じ結果でした。一方で、好意的に書かれるか否定的に書かれるかは揺れやすい結果です。著者は計測企業の共同創業者で、データは非公開、査読前の論文です
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Generative Engine Optimization at Scale: Measuring Brand Visibility Across AI Search Engines |
| 著者 | Pratyush Kumar(1人) |
| 所属 | AI検索でのブランドの見え方を計測・改善するサービスを提供する企業(著者は共同創業者で、株式を保有) |
| 公開日 | 2026年6月18日(arXivの初版で、現時点で唯一の版) |
| arXiv番号 | 2606.20065(主な分野はcs.IR、情報検索) |
| 掲載・採択状況 | arXivのコメント欄は「14ページ、表4つ、v1.0のプレプリント」。学会や論文誌の掲載情報は空欄です(2026年9月24日に確認)。査読前のプレプリントです |
| 種類 | 計測サービスの本番データを集計した観察研究。企業の自社報告 |
| 実験データ・コード | 非公開。顧客の商用データを使うため、データベースと分析コードは公開しないと書かれています |
論文はこちらで読めます。arXiv(2606.20065)、DOI。
著者の立場について補足します。論文の末尾には「利益相反と資金」の節があり、著者は、分析したサービスの共同創業者で株式を持っていること、データ・計測の仕組み・採点の設定・改善提案の仕組みはすべて同社の本番システムであることを明記しています。
読者には「ベンダーが作った計測研究として重みづけて読んでほしい」とも書いています。参考文献15本のうち10本は、同社のブログ記事です。
この記事では社名を伏せ、「著者の所属企業」と書きます。
この論文が答えた問い
AI検索でのブランドの見え方は、実際のサービスでどう測れるのか。そして、知名度の違うブランドの間で、見え方にどれだけの差があるのか。
著者は、有名なブランドは何もしなくても引用されやすく、難しいのは中小企業や創業間もない会社などそれ以外の層だと述べ、その層の立ち位置を数えることを目的の1つに挙げています。
どうやって調べたのか
| 項目 | 内容 |
|---|---|
| AI検索 | ChatGPT(GPT-5)、Gemini(Gemini-3)、Perplexity(Sonar)、Claude(Sonnet)、Grok(Grok-3)の5つ。各社の公式API(プログラムから呼び出す窓口)経由 |
| ウェブ検索の使い方 | Gemini、Perplexity、Grokは毎回ウェブ検索をします。ChatGPTとClaudeは費用を抑えるため、ブランドごとに週1回だけ検索し、その間は学習済みの知識だけで答えます |
| 期間 | 2026年3〜5月(本番データ) |
| 対象 | 102ブランド(5月30日時点でドメインの重複を除いた数)。業種は法人向けクラウドソフト、小売の現場支援、金融とIT、インドの消費者向け直販ブランドに偏っています |
| 規模 | 計測3,508回、回答10万2,025件、ブランドへの言及約1万5,815件、引用14万9,912件 |
| 質問 | AI(Claude Sonnet)が、ブランドの業種・キーワード・地域・直近30日の市場調査をもとに自動で作成。社名を入れない質問が基本です。本番データの質問の総数は書かれていません |
| 言語・国 | 質問の言語は明記がなく、例文はすべて英語です。地域は、APIの位置指定か、指示文への追記で渡しています。日本語・日本市場への言及は、原文にありませんでした |
質問は6種類に分けて作られています。論文はランニングシューズを例に説明しています。
- 社名を含まない4種類:発見(「おすすめのランニングシューズ」)、困りごとの解決(「足首が痛いときの靴」)、使う場面(「立ち仕事向けの靴」)、専門的な質問(「カーボンプレートで速くなるか」)
- 社名を含む2種類:比較(「AとBではどちらが良いか」)、ブランドの調査(「Aは良いブランドか」)
論文が主に使うのは、名前が出るのが当たり前にならない、社名なしの4種類です。見え方の中心の指標は、言及率(質問のうち、ブランドの名前が回答に出た割合)です。
ほかに、何番目に挙げられたか、好意的・中立・否定的のどれで書かれたか(AIの分類器が判定)、競合と比べた言及の取り分を記録しています。
ブランドの知名度は、著者が3段に分けました。1段目は、英語版Wikipediaの長い記事、米英の大手媒体での直近の報道、上場か大型の資金調達などをすべて満たすブランドです。
2段目は、Wikipediaの記事と一定の資金調達があるか、地域の分野で上位3社に入るブランド、3段目はそれ以外で自社のドメインを持つブランドです。
結果
1. 知名度の段ごとに、見え方がはっきり違った
論文の中心の結果です。各ブランドの最初の計測で、社名を含まない質問に名前が出た割合の平均です。
| 知名度の段 | ブランド数 | 社名なしの質問 | 95%信頼区間 | 全質問(社名ありを含む) |
|---|---|---|---|---|
| 1段目:世界的に知られた大手 | 11 | 72.9% | 60.1〜84.2 | 73.5% |
| 2段目:中堅・地域の有力ブランド | 36 | 43.6% | 36.4〜50.9 | 52.2% |
| 3段目:小規模・ニッチ | 55 | 11.4% | 4.2〜20.3 | 17.3% |
段の間の差は、1段目から2段目が29.3ポイント、2段目から3段目が32.2ポイントです(割合の差)。論文は、3つの段の差が統計的に有意で、効果量(差の大きさを示すコーエンのd)も1.31〜2.34と大きかったと報告しています。
1段目のブランドを1つずつ抜いて計算し直しても、1段目の平均は70.5〜76.7%の範囲に収まりました。
論文はこれを因果の証明とは呼んでいません。知名度は実験で割り振ったものではないので、「予想されていた差の大きさを数えた結果」と位置づけています。
2. 社名を入れると出る、入れないと出にくい
- 社名を含む質問では、5つのAIすべてで94.0〜100%の割合で名前が出ました
- 社名を含まない質問では、ChatGPT 22.1%、Gemini 18.7%、Perplexity 23.9%、Claude 51.5%、Grok 12.0%でした(各ブランドの最初の計測。AIごとに対象のブランド数が違う)
- Claudeが高いのは、上位の料金プランでだけ計測していて対象のブランド数が少なく、知名度の高いブランドに偏っているためでもある、と論文は注記しています
- 1段目・2段目以外の小さなブランドに絞ると、ChatGPT 9.9%、Gemini 8.9%、Perplexity 6.8%でした(1回しか計測していない見込み客のブランドも含む。1つのAIあたり169〜187ブランド)
名前を出せばAIは知っているのに、カテゴリで聞くと出てこない。この形は、新興112社を調べた論文の解説で見た結果とも重なります。
質問の種類別では、「発見」が22.9%で最も高く、「困りごとの解決」は10.8%、「使う場面」は11.4%でした。この集計だけは、1回しか計測していないブランドも含む156〜241ブランドの平均です。
「おすすめは」には出ても、具体的な悩みの質問には出にくいということです。
3. 何もしなければ、見え方はほぼ横ばい
2週間以上計測したブランドで、社名なしの言及率が計測1回ごとにどう動いたかを見ています。ChatGPTは1回あたり-1.34%(95%信頼区間-2.45〜-0.38)、Perplexityは-0.76%(-1.66〜-0.03)で、ゆるやかな下がり方でした。
Gemini、Claude、Grokは、信頼区間が0をまたいでいて、横ばいと読める結果です。
この期間に改善提案を実行したブランドはほとんどいなかったため、論文はこれを「何もしなかった場合の基準」として読んでいます。
社名を含まない質問で、同じブランド・同じ質問・同じAIの組み合わせを3回以上計測すると、結果は次のように分かれました。
- 毎回名前が出なかった:63.2%
- 毎回名前が出た:14.3%
- 7割以上で出た:7.0%、3割未満で出た:8.7%、3〜7割で出た:6.8%
ほとんどの組み合わせで結果は毎回同じで、最も多いのは「毎回出ない」でした。中間の組み合わせは、言及率が落ち着くまでに3回以上の計測が要ると論文は述べています。
4. 引用元の約78%は企業のサイト
名前が出た質問の回答から集めた、14万9,912件の引用元の内訳です。
| 引用元の種類 | 件数 | 割合 |
|---|---|---|
| 他社の企業サイト(競合・同業・取引先など) | 112,763 | 75.2% |
| YouTubeなどの動画 | 6,311 | 4.2% |
| IT・ビジネス系の報道媒体 | 5,666 | 3.8% |
| Redditなどの掲示板・コミュニティ | 4,992 | 3.3% |
| 学術・行政・SNS・開発者向けサイト | 4,617 | 3.1% |
| 計測対象ブランド自身のドメイン | 4,392 | 2.9% |
| Wikipediaなどの参考資料 | 3,882 | 2.6% |
| ソフトウェアの口コミ比較サイト | 1,604 | 1.1% |
| その他(まれなドメインの集まり) | 5,685 | 3.8% |
自社ドメインと他社の企業サイトを合わせると約78%で、そのうち自社ドメインは2.9%でした。企業サイト以外では、動画が最も多く、報道媒体、掲示板、Wikipediaの順です。
第三者のページが大半を占めるという点は、128ブランド・13言語を分析した論文の解説でも報告されています(第三者サイトが85.7%)。ただし、質問の種類や自社サイトの判定方法が違うため、数字をそのまま並べて比べるのは避けたほうが安全です。
5. ページの形式では、ランキング記事が最多
- 引用されたページの約59%は記事や動画などの「内容のあるページ」で、約41%はトップページや商品ページでした
- 内容のあるページの中では、ランキング記事が35.7%(全引用の21.0%)、一般的な記事が31.0%(同18.3%)、手順を説明するガイドが9.7%(同5.7%)でした
論文は、1本で多くの質問の引用元になり得るランキング記事を「最も効き目の大きいページ」と呼んでいます。
6. 評価の書かれ方は、言及より揺れやすい
社名を含まない質問で、3回以上名前が出た組み合わせでの、書かれ方の内訳です。常に好意的が29.9%、好意的と中立の混在が21.8%、常に中立が2.3%、否定的と中立の混在が0.5%、常に否定的が0.0%、好意的と否定的の間を行き来したのが45.5%でした。
論文は、45.5%と、言及の「3〜7割で出た」6.8%を比べて、評価は言及の6.7倍揺れやすいと述べています。そのため、評価を含む点数は、1つのAIにつき1ブランド10問以上で計算するまで安定しにくいとしています。
論文自身が書いている限界
- 改善提案がブランドの見え方を上げたという因果の主張はしていません。すべて観察した基準の数字で、効果の検証は次の版の課題です
- 対象のブランドは、計測サービスの利用企業で、業種に偏りがあります。1段目は11ブランドしかなく、ClaudeとGrokは計測したブランド数が少ない、と明記しています
- 知名度の段分けは、著者1人が公開情報から手作業で判定しました。Wikipediaや報道の量はウェブでの目立ち方の代わりの指標でもあるので、結果は「予想された差の大きさ」を数えたものだと述べています
- 結果はAPIの出力から推し量ったもので、AIごとに1つのモデルしか計測していません
- 評価の分類はAIの判定で、45.5%の揺れには、分類器自身のぶれも混ざっています
論文が最後に示す7つの追加検証(無作為に割り振った改善の効果など)は、「結果ではなく研究の予定」と明記されています。
原文を読んで気づいた点
- 計測サービスを売る企業の自社報告です。利益相反の申告と具体的な限界の記述はありますが、データとコードは非公開で、第三者が再計算する手段はありません
- 日本語・日本市場の検証は含まれていません。質問の言語は明記されていませんが、例文はすべて英語です。知名度の判定も英語版Wikipediaと米英の媒体を基準にしていて、対象はインドの直販ブランドなどに偏っています
- 質問の総数と中身は、ブランドごとに違います。質問はAIが自動で作るため、段の間の差には、質問の作られ方の違いも混ざり得ます。本番データの質問数も書かれていません
- 「6.7倍」は、別々の集団と定義の比です。評価の45.5%は「3回以上名前が出た組み合わせ」で、好意的と否定的の間を行き来した割合です。言及の6.8%は「3回以上計測した組み合わせ」で、3〜7割の範囲に入った割合です。分母も定義も違うので、倍率は目安として読むのが妥当だと私は考えます。45.5%が否定的な書かれ方を含むのに「否定は一時的」とまとめている点も、分類の定義が読み切れませんでした
- 「1回あたり-1.34%」を期間に直せません。3,508回を102ブランドで割ると、1ブランドあたり約34回です(概算)。方法の節には毎日計測する設定が例として書かれていますが、3か月毎日なら約90回になり合いません。実際の間隔は書かれておらず、1か月でどれだけ下がるかは計算できない状態です
- 引用元の集計は、AIごとの検索の頻度の違いを含んでいます。ChatGPTとClaudeは週1回しか検索しないので、内訳は毎回検索する3つのAIの影響を強く受けていると読めます。AI別の内訳は未掲載です
この論文から、言えること・言えないこと
| 言えること(論文のデータで観察された) | 言えないこと(論文では確かめられていない) |
|---|---|
| 業種に偏りのある102ブランドで、知名度の段ごとに、社名なしの質問での言及率が大きく違った | 知名度を上げれば言及率が上がること(因果) |
| 社名を含む質問ではほぼ毎回名前が出て、社名なしでは大きく下がった | 日本語の質問や日本の中小企業で、同じ割合になること |
| 引用元の大半は他社の企業サイトで、ランキング記事が最多の形式だった | ランキング記事に載れば、AIの回答に名前が出るようになること |
| 名前が出るかどうかは、同じ質問ならほぼ毎回同じだった | 著者の所属企業の改善提案が、見え方を上げること |
| 評価の書かれ方は、言及より揺れやすかった | 揺れがAIの回答によるものか、分類器によるものか |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 自社の見え方は、社名を入れない質問で測ります。社名入りの質問はほぼ必ず名前が出るので、「〇〇市でおすすめの〇〇」のように、お客様が実際に聞きそうな質問を使います
- 3段目の11%は、まだ恵まれた集団の数字です。3段目も、自社ドメインを持ち計測サービスを使う、特定業種のブランドです。日本の地域の中小企業が同じ測り方をすれば、もっと低い数字から始まる可能性を見込んでおくのが安全だと考えます
- 自社サイトの外に、正確な情報が載っているかを確かめます。引用の大半は他社のページとランキング記事でした。業界の比較記事や動画などに、自社の情報が正しく載っているかを点検します。AIをだます隠し文字などの操作は、著者も扱わないと明言しています
- 計測ツールの「総合点」は、作り方を確かめてから使います。この論文でも、5つのAIの点を混ぜる重み(ChatGPT 0.30、Grok 0.10など)は同社が決めた設定値です。AIごとの数字と並べて見るのが確実です
よくある質問
知名度の3段(73%・44%・11%)は、小さな会社はAI検索に出られないという意味ですか
論文が示したのは、計測1回目の時点での差です。手を打てば上の段に近づけるかは、論文も「次の版で無作為の実験をして確かめる問い」としています。
大きく伸びたブランドも少数ありましたが、論文はそれを逸話として扱い、証拠に数えていません。
AI検索の引用で「おすすめランキング記事」が最多だったのは、ランキング記事に載れば名前が出るという意味ですか
その因果は確かめられていません。論文が数えたのは、名前が出た回答でどんな形式のページが引用されていたかで、載ったあとに言及率が上がったかを比べた分析は含まれていません。
AI検索の見え方を計測する企業の自社報告であるこの論文の数字は、信用してよいですか
利益相反の申告と限界の節はあり、読み方の手がかりはそろっています。一方で、データとコードは非公開で、外部から検証する手段はありません。
「特定の業種に偏ったブランドで、ある計測サービスが観察した傾向」として受け取り、自社の判断は自社の計測で確かめるのが手堅い使い方です。
まとめ:今日できる1つのこと
自社の業種で、社名を入れない質問を3つ作ってください。論文の分け方にならって、「おすすめを探す質問」「困りごとの質問」「使う場面の質問」を1つずつ用意します。
それを2つ以上のAIで、日を変えて3回ずつ試し、自社の名前が出たか、どのページが引用されたかを表に記録します。名前が出ない質問と、代わりに引用されているページが分かれば、次に手を入れる場所が見えてきます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


