【2026年9月19日の訂正】原文の再確認にもとづき、検索トリガー率の解釈(引用される確率とは違い、検索が起動した割合)などを訂正しました。原文を精読した詳細版は、こちらの記事です。
「ChatGPTに自社サイトが引用された」という報告を見て安心していないだろうか。2026年4月に公開されたある研究は、この安心感に冷や水を浴びせる結果を示している。引用される回数と、その引用が実際に回答の中身にどれだけ影響を与えたかは、まったく別の指標だという発見だ。
この記事で紹介するのは、2026年4月28日にarXivへ投稿された論文(論文ID:2604.25707)である。「引用の選定から引用の吸収へ」という趣旨のタイトルで、生成AI検索プラットフォームを横断した測定手法を提案している。ChatGPT・Google AI Overview/Gemini・Perplexityという3つのプラットフォームを対象に、602件の制御プロンプトを使って、21,143件の検索層引用と18,151件の取得済みページを分析したものだ。なお、論文は質問を投げ直しておらず、共著者が公開しているデータを整理し直した分析である。なお、これは査読前のプレプリントである。以下の数値も、その前提で読んでいただきたい。
「引用される」と「使われる」は別の指標だ
この論文の核心は、生成AI検索における評価を2つの段階に分けて測定した点にある。1つ目は「引用選定」、つまり検索の過程でそのページが引用元として選ばれる段階。2つ目は「引用吸収」、つまり選ばれた情報が実際に回答の言語・根拠・構造にどれだけ取り込まれたかという段階だ。引用の有無だけでは分からない部分を、別の段階として測る枠組みを、この論文は提案している。
まず、検索が起動する割合は、3プラットフォームともほぼ天井に達している。検索トリガー率(プロンプトのうち、検索が起動した割合)は、ChatGPTで98.64%、Google AI Overviewで99.67%、Perplexityで100.00%だった。この論文の質問の条件では、どのサービスもほぼ毎回、検索を使っていたことになる。ただし、これは「自社のページが引用される確率」ではない。差がつくのは、その先だ。
論文は、出典の種類(公式・ニュース・業界サイトで79〜88%を占める)や、ドメインの権威を表すスコアが、候補に入るための強い条件だと述べている。つまり、検索が起動すること自体は競争の焦点ではないが、自社のページが出典に選ばれることは、確実ではない。焦点は、選ばれるかどうかと、選ばれた内容がどう扱われるかの両方にある。「引用された」という結果だけで判断しないほうがよい、というのがこの論文の出発点になる主張だ。
ChatGPTは少数を深く使い、他の2つは多数を浅く使う
1つのプロンプトあたりの平均引用数は、ChatGPTが6.88件、Googleが12.06件、Perplexityが16.35件だった(中央値はそれぞれ6件・12件・17件)。単純に見れば、ChatGPTは引用する情報源の数が他の2つよりずっと少ない。
ところが、取得済みページの「影響度スコア」(繰り返し・位置・段落の網羅・語の重なりという4種類の観測を合成した、代理の指標)の平均値を見ると、様子が一変する。ChatGPTが0.2713、Googleが0.0584、Perplexityが0.0646だった。ChatGPTは引用数こそ最少だが、引用した1件あたりの影響度は他の2プラットフォームの4〜5倍近く高い。つまりChatGPTは、少数の情報源を選び抜いて、その内容を深く回答に反映させるタイプであり、Google・Perplexityは多数の情報源に薄く触れる形で回答を構成するタイプだと言える。この逆転現象は、プラットフォームによって最適化の狙いどころが違うことを示している。「とにかく多くのプラットフォームに引用されること」を目標にすると、ChatGPTのような「深く使われるプラットフォーム」での機会を見誤る可能性がある。
この違いは、それぞれのプラットフォームがどう回答を組み立てているかの設計思想を反映しているのかもしれない。ただし論文は、引用の表示方法、回答の長さ、HTMLの読み取りの違いなど、別の要因の可能性も併記しており、この結果を恒久的な主張にしないよう求めている。多数の情報源を横断的に要約するタイプの検索と、少数の情報源をじっくり読み込んで根拠を組み立てるタイプの検索とでは、コンテンツ側が用意すべきものも変わってくる。前者では幅広いトピックを浅く網羅したページが拾われやすく、後者では特定のテーマを深く掘り下げたページが選ばれやすい、という仮説が成り立つ。この仮説は、論文にはない筆者の推測であり、論文は検証していない。
影響度の高いページに共通する特徴
論文では、影響度スコアが高いページに共通する特徴も分析されている。より長く、構造化されており、意味的な整合性が高く、定義・数値事実・比較・手順といった「抽出しやすい根拠」を多く含むページほど、回答への影響度が高い傾向が見られた。これは、「見出しを整理する」「具体的な数字を書く」「比較表を用意する」といった施策の方向と整合する相関だが、それらの施策の効果を確かめたものではない(論文自身も、見出しが原因かどうかは切り分けられないとしている)。
「FAQ形式にすれば良い」への反証
一方で、直感に反する発見もある。FAQ(よくある質問)形式のページの影響度は平均0.0947だったのに対し、FAQ形式でないページは平均0.1005で、FAQ形式のほうが5.74%低かった。「AI検索に選ばれるにはFAQ形式が有効」という主張はLLMO対策の解説記事でよく見かけるが、この論文の分析では、FAQ形式と分類されたページの平均が、わずかに低かった。論文の著者も、これを「反直感的な結果」として明記している。ただし原因は不明で、論文は、FAQの内容が有害だと証明したものとは言えず、質の低いFAQとの交絡があり得ると述べている。
なぜこのような結果になるのか、論文自体は因果関係までは示していない。ここからは筆者の推測になるが、1つ考えられる説明はこうだ。FAQ形式は質問と回答という決まった型に情報を押し込めるため、1つの回答あたりの情報量がどうしても短く断片化しやすい。一方、本文中に自然な文章として定義や数値、比較を織り込んだページは、文脈がつながった状態でより多くの根拠を提示できる。AIが回答を組み立てる際に参照しやすいのは、形式が整った短い断片よりも、文脈込みで根拠を示している文章なのかもしれない。
これは、FAQ形式自体が無意味だという意味ではない。FAQという「箱」を用意するだけでは効果が薄く、その中身が定義・数値・比較といった具体的な根拠を伴っているかどうかのほうが、形式そのものより重要だという理解のほうが正確だろう。形だけのFAQ設置に頼るより、質問への答えの中身の密度を高めることに力を割くべきだ、という示唆が読み取れる。
言語によってプラットフォームの反応が逆になる
もう1つ興味深いのが、プロンプトの言語による違いだ。中国語プロンプトの平均引用数は、ChatGPTでは7.77件(英語は7.03件)と中国語のほうが多かったが、Googleでは英語が11.57件、中国語が7.53件と逆の傾向を示した。プラットフォームによって、どの言語のプロンプトに対してより多くの引用を返すかの傾向が逆転しているということだ。著者は、言語の効果を単独で語るより、プラットフォームとの組み合わせ(交互作用)として捉えるべきだと述べている。日本語での対策を考える際も、「AI検索全般にこう効く」という一般化ではなく、プラットフォームごとに検証する視点が必要になりそうだ。
この研究の限界
この研究を紹介する上で、著者自身が明記している限界も正確に伝えておきたい。まず、602件のプロンプトは実際のユーザーの検索行動から無作為に抽出したものではなく、研究のために設計されたプロンプトである。実際のユーザートラフィック全体を代表する標本ではないと著者自身が断っている。言語の比較も中国語と英語の2言語に限られており、日本語を含む他の言語への一般化は避けるべきだとも注記されている。
また、影響度スコアは、観測されたテキストや引用位置の特徴を組み合わせて算出した「構成的な代理指標」であり、AIモデルの内部処理やプロンプトへの因果関係を直接測定したものではない。引用数の集計も、各プラットフォームの画面表示や重複除去のルールに左右される。ページの取得に失敗したものは分析から除外されているため、取得できなかったページが系統的に異なる特性を持っていた場合、分析結果に偏りが生じる可能性もある。研究時点でのスナップショットであり、AI検索の仕様は今後も変わり続けるため、継続的な検証が必要な分野だという前提で読む必要がある。
中小企業が今日からできること
この研究から中小企業のサイト運営者が持ち帰れる示唆は、大きく3つある。1つ目は、「引用された数」だけをLLMO対策の成果指標にしないことだ。検索が起動する割合はほぼ天井に達しており、差がつくのは、出典に選ばれるかどうかと、内容が取り込まれるかどうかだ。むしろ、引用された内容がどれだけ具体的で、定義・数値・比較といった抽出しやすい根拠を伴っているかに力を入れたほうが、実際の回答への影響力につながりやすい。
2つ目は、FAQ形式という「型」に頼りすぎないことだ。質問と回答の形式を整えること自体が目的化すると、FAQ形式と分類されたページの平均がわずかに低かった、というこの研究の結果を、軽く見ることになりかねない。形式よりも、その中身の情報密度を高めることを優先したい。
3つ目は、AI検索プラットフォームを一括りにしないことだ。ChatGPTとGoogle・Perplexityでは、情報の使われ方の傾向が異なる可能性がこの研究で示された。自社のターゲット顧客がどのプラットフォームで検索する傾向が強いかを踏まえて、対策の優先順位を考える視点が必要になる。
まとめ:引用数という「見た目の指標」から抜け出す
「AI検索に引用された」という事実だけで安心するのは、まだ早い。この研究が示したのは、引用される段階と、その引用が実際に回答へ影響を与える段階は別物だという構造だ。引用数という分かりやすい指標を追いかけるより、引用された内容がどれだけ回答の中身に反映されるかという、一段深いところに目を向ける必要がある。
この分野の研究はまだ発展途上で、今回紹介した論文もプレプリントの段階であり、著者自身がいくつもの限界を認めている。とはいえ、「FAQ形式にすれば良い」といった単純な通説に反証を示した点、そしてプラットフォームごとに情報の使われ方が違うことを定量的に示した点は、実務上のヒントとして十分に価値がある。数字を引くときは、こうして出典と限界をたどれる形で扱いたい。
海外LLMO研究シリーズ・関連記事
- AI検索で見えるブランドは36社だけ 1.26億件のプロンプト分析から
- AI Overviewsは1つの検索結果だけを見ていない
- AI検索の可視性は被リンクより言及数
- AIに引用されるページの条件 SIGIR 2026の実験研究から
- 未翻訳サイトはAI検索に見えない 130万件の引用データが示す言語の壁
- LLMO対策に新しい道具は要りません|LLMOとはSEOと何が違うのか
- AIの推薦を信じても、購入前には必ず確認する 3,848人調査から
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

