AI検索で自社のページが「出典として並ぶこと」と、回答の文章に「実際に使われること」は、同じでしょうか。2026年4月28日にarXivへ公開された論文「From Citation Selection to Citation Absorption」は、この2つを分けて測る枠組みを提案しています。著者は独立研究者の3人(Zhang Kai、He Xinyue、Yao Jingang)で、公開データをもとに、ChatGPT、Google AI Overview、Perplexityを比べています。
この記事は、論文を原文から読み、何を測り、何が分かり、何が分かっていないのかを整理します。とくに、論文が「引用の吸収」を測るために作った指標が、どの部品を合成したものかを平易に説明します。数値は論文の表と本文から拾い、私が計算した値には「概算」と付けています。なお、この論文は査読前のプレプリント(学会や雑誌の審査を受けていない原稿)です。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読むのは、「引用された」という数字だけで満足してよいのかを、測り方の側から確かめておくためです。
この論文を短く紹介した記事は、すでに引用されても効かない?AI検索の「引用吸収」研究からで公開しています。本記事は、原文を通読した詳細版です。
結論:3行で言うと
- AI検索の成果を、「どれだけ出典に選ばれたか(選択)」と「回答にどれだけ取り込まれたか(吸収)」の2段階に分けて測る枠組みを示した、測定の論文です
- 公開データでは、出典の数はPerplexityが最多(1質問あたり平均16.35件)、ChatGPTが最少(同6.88件)でした。ところが、取り込まれ具合の平均はChatGPTが最も高く(0.2713)、Perplexity(0.0646)やGoogle(0.0584)の約4倍でした
- 取り込まれやすかったのは、長く、見出しで区切られ、定義・数字・比較を含むページでした。質問と回答の形式と分類されたページは、平均でわずかに低い結果です。ただし、この「吸収」は論文が作った合成指標で、これらはいずれも相関であり、因果は不明です
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 原題 | From Citation Selection to Citation Absorption: A Measurement Framework for Generative Engine Optimization Across AI Search Platforms |
| 著者 | Zhang Kai、He Xinyue、Yao Jingang(3人とも所属は「独立研究者、中国」と書かれています) |
| 公開日 | 2026年4月28日(v1)。確認した版は2026年4月29日付のv2 |
| arXiv番号 | 2604.25707(分野はcs.IR、情報検索) |
| 掲載・採択状況 | arXivのプレプリントです。arXivのコメント欄は「27ページ、図11点。ACM形式のレイアウト」で、採択された学会や雑誌の記載はありません。査読を受けたことを示す記載は、確認できませんでした |
| 種類 | 既存データの再集計による、測定の枠組みの論文(新しい実験ではありません) |
| データ・コード | GitHubの公開リポジトリ「geo-citation-lab」と、その公開レポート。論文は、これらを出どころとして挙げています |
論文はこちらで読めます。arXiv(2604.25707)、DOI、データの公開先(GitHub)。
この論文が答えた問い
AI検索で出典として選ばれることと、回答に深く取り込まれることは、別々の現象なのか。別々なら、それぞれに効く条件は何か。
従来の検索では、成果は「順位」と「クリック」で測られました。生成AIの検索は、資料を集めて1つの回答に混ぜ、出典を添えます。論文は、出典の一覧に載っただけの弱い参照と、定義や数字を提供して回答の複数の段落を形づくったページを、同じ「引用」として数えてよいのかを問題にしました。
そこで論文は、2つの結果に名前を付けました。1つ目が引用選択で、AIが検索を起動し、出典を選ぶ段階です。2つ目が引用吸収で、出典になったページの言葉、根拠、構成、事実が、最終的な回答に取り込まれる段階です。
どうやって調べたのか
使ったデータ
論文が使ったのは、共著者のYao Jingang氏が公開しているデータセットです(原文は、元の研究の著者をZhang Kai氏、公開の担当をYao氏としています。arXivは、初版の後に著者リストが更新されています)。論文は質問を投げ直さず、公開レポートの集計値を整理し直しています。数値はすべて、公開レポートで追跡できる記述統計だと説明されています。
| 項目 | 内容 |
|---|---|
| 質問(プロンプト) | 602問。A層432問(分野・課題の種類を変えた主実験)、B層60問(聞き方の違い)、C層60問(中国語と英語の対)、D層50問(高リスク、あいまい、条件が多いなどの極端な場面) |
| 比べたサービス | ChatGPT、Google AI Overview/Gemini、Perplexityの3つ |
| 出典の記録 | 整理後の検索段階の記録が21,181行。そのうち有効な引用が21,143件 |
| ページの特徴量 | 23,745行の記録に、72の特徴。うち本文を取得できたページは18,151件(取得成功率76.44%) |
| 吸収の分析対象 | 本文を取得できた18,151件だけ。取得に失敗したページは、吸収の分析から外れています |
論文は、質問が設計された質問集で、現実の利用者の質問の無作為抽出とは違うと明記しています。ChatGPTだけ、整理後に15問ぶんの出力が欠けており、質問数は587です。
「吸収」の指標は何を合成しているか
ここが、この論文の中心です。論文は、ページが回答にどれだけ取り込まれたかを直接見ることができません。AIの内部で、どの資料をどれだけ参照したかは外から分からないためです。そこで、外から観察できる5つの手がかりを重みを付けて足し合わせ、0から1の「影響度スコア」を作りました。
| 部品 | 何を見るか | 重み |
|---|---|---|
| 繰り返し | 1つの回答の中で、そのページが何回引用されたか(3回で満点) | 0.20 |
| 位置 | 回答の前のほうで最初に引用されるほど高い | 0.15 |
| 網羅 | 回答の何割の段落で、そのページが引用されているか | 0.20 |
| 語の重なり(1) | ページと回答の文章の、語の珍しさで重みを付けた単語の一致度(TF-IDF) | 0.25 |
| 語の重なり(2) | 2語連続・3語連続の並びが一致する割合(の平均) | 0.20 |
重みの合計は1です。ほぼ半分(0.45)を、ページと回答の文章がどれだけ同じ語で書かれているかが占めています。残りの0.55が、回答の中での引用の数・位置・広がりです。
論文は、この指標の限界を自分で認めています。指標は「観察による代理の指標」で、モデルの隠れた注意や検索順位、因果的な依存を直接測るものではない、と書いています。また、5つの部品は結果を定義するものなので、同じスコアを説明する変数として回帰分析に入れると循環になる、とも述べています。論文は、その点を避ける手順も明記しています。
結果
出典の数と、取り込まれ具合は逆になった
| サービス | 1質問あたり平均の引用数 | 吸収の分析対象(本文取得済み) | 影響度の平均 | 影響度の中央値 |
|---|---|---|---|---|
| ChatGPT | 6.88件 | 3,323件 | 0.2713 | 0.2611 |
| Google AI Overview | 12.06件 | 6,385件 | 0.0584 | 0.0515 |
| Perplexity | 16.35件 | 8,443件 | 0.0646 | 0.0333 |
- 3つのサービスは、ほぼすべての質問で検索を起動しています(ChatGPT 98.64%、Google 99.67%、Perplexity 100%)。差がつくのは、何件の出典を選ぶかでした
- 引用数はPerplexityがChatGPTの約2.4倍です(16.35÷6.88、概算)。影響度の平均は、ChatGPTがGoogleの約4.6倍、Perplexityの約4.2倍でした(それぞれ0.2713÷0.0584、0.2713÷0.0646、概算)
- Perplexityは、平均0.0646に対して中央値が0.0333と、半分になっています。一部の高い値が平均を押し上げているとみられます(私の読み取り)
出典に選ばれやすい顔ぶれ
出典の種類は、公式サイト、ニュース、業界の専門サイトの3つで、全体の79.12%から87.52%を占めました。
ただし、ここでも選ばれやすさと吸収の深さは別でした。ニュース系のページは選ばれる件数が多い一方、影響度の平均は0.0726で、百科事典系(0.2144)より低い値でした。論文は、時事の情報源を見つけたあとに説明のページが必要になるためと推測しています。
取り込まれやすかったページの特徴
影響度が上位25%のページと下位25%のページを比べた表では、上位のほうが次のように大きい値でした。
- 語数:平均1,943語に対して170語(約11.4倍)
- 見出しの数:10.59に対して0.85(約12.5倍)
- 段落の数:47.49に対して8.34(約5.7倍)
- 回答との意味的な類似度:0.570に対して0.247(約2.3倍)
スコアの部品に入っていない変数との相関では、AIによる関連度の採点(r=0.4322)が最も強く、回答との埋め込み類似度(0.3561)、AIによる質の採点(0.2917)と続きました。論文は、長さより意味の合致のほうが強い手がかりだったと書いています。
含んでいる中身で見ると
ページが特定の種類の中身を含むかどうかで、影響度の平均を比べた表です。増減は、含まないページと比べた相対的な差です。
| ページの特徴 | 含む場合の平均 | 含まない場合の平均 | 相対差 |
|---|---|---|---|
| コードを含む | 0.1747 | 0.0988 | +76.88% |
| 数字・統計を含む | 0.1171 | 0.0725 | +61.55% |
| 定義の表現を含む | 0.1252 | 0.0795 | +57.33% |
| 比較の内容を含む | 0.1389 | 0.0894 | +55.28% |
| 手順(ハウツー)を含む | 0.1296 | 0.0918 | +41.20% |
| 質問と回答の形式(Q&A) | 0.0947 | 0.1005 | -5.74% |
なお、私の計算ではQ&Aの相対差は約-5.8%で、論文の-5.74%とわずかにずれます。表の平均の丸めによると思われます。
引用の役割で見ると、定義(0.1531)と比較(0.1524)が高く、参照として添えただけの引用(0.0529)は最も低い値でした。
Q&A形式について、論文は、FAQが有害だと示したわけではないと断っています。分類の粗さが混ざっている可能性があり、語数や質をそろえた分析が必要だとしています。
聞き方・言語の影響は、サービスごとに違った
- 出典の明示を求める聞き方は、GoogleとPerplexityで引用数を増やしましたが(Googleは14.05件から15.90件)、ChatGPTでは7.30件から6.15件に減りました。言語も、Googleは英語が多く(11.57件対7.53件)、ChatGPTは中国語が多い(7.77件対7.03件)結果でした
論文自身が書いている限界
論文は、妥当性を損なう要因の節を設けています。主な限界は、次のとおりです。
- 影響度スコアは、モデル内部の注意や因果の痕跡を直接見る代わりに構成した代理の指標です。解釈は計算式に結びつけて行う必要があります
- 吸収の分析は、本文の取得に成功したページだけが対象です。取得に失敗したページが成功したページと違う性質を持つなら、結果は「取得できた条件の下」のものになります
- 記録に統一された時刻がなく、AI検索は変化が速いため、この結果は静的な記録の断面であり、生きたサービスの監視には使えません
- 信頼区間、多重比較の補正、回帰分析は行っていません。論文はこれを意図した選択と明示し、生データを再集計する確認用の分析計画を提案するにとどめています
- 因果は示せていません。論文は主張を4段階に分け、直接の数え上げ(第1段階)と記述的な比較(第2段階)だけを実証された結果とし、「証拠を入れる器」という解釈(第3段階)はもっともらしい説明、「定義を足せば引用が増える」という処方(第4段階)はここでは確立していないとしています
原文を読んで気づいた点
ここからは、論文が書いた限界とは別に、私が原文を読んで気づいた点です。
- 査読の有無:プレプリントで、著者は独立研究者です。採択された会議や雑誌の記載は、見つけられませんでした。論文の書式は学会風(ACM形式)ですが、審査済みを意味しません
- 自分たちの公開レポートの整理:数値の出どころは、著者の一人が公開しているデータセットとレポートです。本文に、生データから再計算したという記述はなく、統計的な検定もありません
- 日本語での検証はありません:言語の比較は中国語と英語だけです。出典の国は米国が82.7%から86.8%、言語は英語が82.9%から95.1%(識別できたものの割合)で、英語圏が中心です
- 採点は自動です:影響度は式による自動計算で、ページの関連度や質の採点はAIによるものです。人が読んで確かめた結果は、本文に出てきません。人手の確認は、提案として書かれているだけです
- 「取り込み」の半分近くは語の一致です:スコアの0.45が、ページと回答が同じ語で書かれているかで決まります。回答がページの言葉を引き写した場合に高く出やすく、内容を言い換えて使った場合は低く出ることがあります。論文は、文単位の人手の注釈による検証を今後の課題としています。この点は、私の読み取りです
- サービスの間の差は、集計の仕組みの差かもしれません:論文自身が、ChatGPTの高い値は引用の表示方法、回答の長さ、回答HTMLの読み取り方の違いを映している可能性があると書いています。引用が少ないと1件あたりの引用回数や割合が大きくなりやすい構造も、指標にはあります(私の読み取り)
サーベイ論文の批判と、原文の照らし合わせ
当ブログのサーベイ論文の解説記事は、サーベイ論文6.1節の批判として、「吸収の指標は位置・繰り返し・網羅・文の類似を合成したもので、内部の因果の痕跡を示すものではない」という趣旨を紹介しています。原文と照らすと、この批判は概ね正確です。
- 合成している部品は、繰り返し、位置、段落の網羅、語の重なりです。「文の類似」は、正確には文の意味の類似ではなく、語や語の並びの一致です。意味を測る埋め込み類似度は、スコアには含まれておらず、説明側の変数として別に分析されています
- 「内部の因果の痕跡ではない」という点は、論文自身が同じことを述べています。この批判は、論文が自ら認めている限界と一致しています
- 論文は、この限界を理由に、部品を説明変数に使わない、部品を除いた指標で再確認する、重みを変えて順位が保たれるかを見るという確認計画を挙げています。ただし、これらは実行済みの結果ではなく、計画です
この論文から、言えること・言えないこと
| 言えること(論文の記録の範囲で) | 言えないこと(論文では確認されていない) |
|---|---|
| 出典の数と、回答への取り込まれ具合は、サービスによって食い違った | 取り込まれ具合の差が、AIの内部の使われ方の差であること |
| 取り込まれ具合の高いページは、長く、見出しが多く、定義・数字・比較を含む傾向があった | ページにそれらを足せば、取り込まれ具合や引用が増えること |
| Q&A形式のページは、平均でわずかに低かった | FAQが有害であること。あるいは、FAQに効果がないと断定すること |
| ニュース系は出典に頻繁に現れるが、平均の影響度は百科事典系より低かった | 日本のメディアやサイトでも同じであること |
| 聞き方や言語の効果は、サービスごとに違った | その違いが、いまのサービスにも当てはまること |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
1. 「引用された」の数を、成果の全部にしない
出典に載ることと、回答に使われることを分ける考え方は、自社の計測にも使えます。AI検索で自社ページが出典に並んだ回数と、回答文の中身にそのページの言葉や数字がどれだけ現れているかは、別々に確認する価値があります。後者は、この論文の指標を使わず、実際の回答文を人が読んで確かめるのが確実です。
2. ページは「取り出せる部品」で組み立てる
論文が示す方向は、1ページの中に、定義、数字、比較、手順のような、切り出して使える部品を用意することです。これは相関の結果に基づく仮説で、効果が実験で確認されたわけではありません。
3. FAQへの一斉変換は急がない
Q&A形式にするだけのページは、この記録では平均でわずかに低い値でした。FAQを作るなら、答えの中に定義、数字、比較のような中身を入れることが、論文の解釈と整合します。
4. 数字の出どころを、必ず確かめてから使う
論文自身が、数字や見出しが多いだけで有用とは限らないと述べています。数字を足す場合は、元の資料で確かめられるものに限るのが安全です。プレプリントであるこの論文の数値も、そのまま社内資料や提案書に引用せず、「未査読の論文による」と添える扱いが適切です。
よくある質問
引用選択と引用吸収は、どう違いますか
引用選択は、AIが検索を起動して、出典の一覧に載せるページを選ぶ段階です。引用吸収は、そのページの言葉や事実が、回答の文章にどれだけ取り込まれるかを指します。論文は、前者を数と種類で、後者を影響度スコアで測っています。
影響度スコアが高いページは、AIによく使われたページと考えてよいですか
そう読むのは慎重にしたほうがよい、と論文自身が述べています。スコアは、繰り返し、位置、網羅、語の重なりを合成した代理の指標で、AIの内部で何が起きたかを直接示すものではありません。
まとめ:今日できる1つのこと
AI検索で自社について尋ねる質問を1つ決め、回答に出てきた出典のうち、自社のページが載っているかを確かめます。載っていたら、回答の文章が自社ページの何を使っているか(定義、数字、比較のどれか)を、人の目で1つ書き出してください。載っていないなら、その質問に答える定義や数字が自社ページにあるかを見ます。この2つを分けて記録しておくと、「選ばれたか」と「使われたか」を別々に追いかけられます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

