生成AIの回答に引用されなかったとき、原因は1つではありません。ページがそもそも読み込めなかったのか、質問と噛み合っていなかったのか、それとも競合のほうが権威で勝っていたのか。
原因によって、直し方はまったく違います。この違いに正面から取り組んだのが、2026年3月に公開された論文「Diagnosing and Repairing Citation Failures in Generative Engine Optimization(AgentGEO)」です。
この記事は、その論文を原文から読み、引用されない原因をどう分類したか、そして原因ごとにどう直す仕組みを作ったかを整理します。あわせて、実験の対象・比較した手法・指標・診断カテゴリの内訳まで、原文の数値で追います。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文は、「なぜ引用されないのか」を型に分けて考える手がかりとして読む理由があります。
結論:3行で言うと
- この論文は、「どう書けば良いか」という一律のルールを当てはめる前に、「なぜこのページは引用されなかったのか」を診断してから、原因に合った修理を選ぶ仕組み(AgentGEO)を提案しています
- 引用されない原因を分析した結果、62.2%は質問との意味のずれ、27.1%はコンテンツの質、10.1%は技術的な読み込みの失敗でした。原因の重さはこの順でした
- AgentGEOは、引用率で比べた一律ルールの手法(AutoGEO)を上回り、書き換える範囲は5%と、一律ルールの手法の25%よりずっと小さく済みました
ただし、この実験は独自に組み立てた模擬環境で行われたものです。実際のChatGPTやPerplexityで検証したものではありません。
この点は、後の章で改めて整理します。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | Diagnosing and Repairing Citation Failures in Generative Engine Optimization |
| 著者 | Tian、Chen、Tang(3人が共同筆頭著者)、Liu、Jia(5人。所属はバージニア工科大学、浙江大学。責任著者はJia) |
| 公開 | 2026年3月10日(arXiv公開日)。arXiv:2603.09296(分野はcs.IR、情報検索) |
| 掲載/採択状況 | arXivのプレプリントです。学会や査読誌への採択は、arXivのコメント欄に記載がなく、確認できませんでした |
| 種類 | 手法提案の論文。診断の分類、修理の仕組み(AgentGEO)、評価用のベンチマーク(MIMIQ)の3つを提案しています |
| 実験データ・コード | 論文はプロジェクトページのURLを示しています(実際に確認するとコードとデータセットが公開されています) |
論文はこちらで読めます。arXiv(2603.09296)。
この論文が答えた問い
引用されなかったページに一律の改善ルールを当てはめる代わりに、ページごとに「なぜ引用されなかったのか」を診断してから直せば、引用率はどこまで上がるのか。そして、直しても引用されないページには、どんな共通点があるのか。
論文の背景にある問題意識は、こうです。生成AIの回答をまとめて答える仕組み(生成エンジン)は、ページへのクリックそのものを減らします。
ある調査では、AIの要約が出た検索のうち、引用元をクリックした人は1%でした。要約が出ない通常の検索結果をクリックした人は15%です(論文が引用する調査より)。
それでも、生成AIの検索から来た訪問者は、通常の検索より23倍高い割合で成約したという分析もあります(同じく論文が引用する調査より)。
クリックは減っても、来た人の価値は高い。だからこそ、引用されるかどうかが分かれ目になる、という考え方です。
論文はまず、既存のGEO(Generative Engine Optimization、生成エンジン向けの見え方対策)の手法が測っているのは「引用された後に、回答のどれだけを占めたか」という貢献度であって、「そもそも引用されたかどうか」という二択の事実ではない、と指摘します。
著者らの実験では、話題として関連するページのうち43%が、書き換えなしの状態でまったく引用されていませんでした。
この43%のページに必要なのは、貢献度の微調整より先に、なぜゼロなのかを知ることです。
どうやって調べたのか
診断カテゴリの作り方
論文は、既存のGEO研究のデータセット(GEO-Bench)から、健康・旅行・技術など10分野にまたがる質問を使い、「引用されなかったページ」と「同じ質問で引用された競合ページ」を1組ずつペアにしました。
できた組は949組です。同じ質問に対して、なぜ一方だけが選ばれたのかを分析することで、原因を絞り込んでいます。
この分析から、生成エンジンの処理の流れ(取得・解析・回答生成)に沿って、4つの大きな分類と、その中の12の失敗の型が作られました。
| 分類 | 割合 | 内容 |
|---|---|---|
| 技術的な健全性 | 10.1% | アクセス遮断、JavaScriptでの読み込み失敗、解析不能な文字化け、広告やナビゲーションに埋もれて信号が薄い |
| 意味の一致 | 62.2% | 質問の意図とのずれ、必要な固有名詞や文脈の欠落、情報が古い、地域が合わない |
| コンテンツの質 | 27.1% | 内容が薄すぎる、断片的で要約しにくい、冗長すぎる、表にすべき内容が読みにくい文章のまま |
| 構造的な排除 | 0.6% | Wikipedia等の権威あるページと内容が重複している、AIが読む範囲(コンテキストウィンドウ)の外に埋もれている |
いちばん多かったのは、質問と噛み合っていない「意味の一致」の失敗でした。中でも「文脈の欠落(32.3%)」と「意図のずれ(29.1%)」の2つが大半を占めています。
なお、この2つを含む「意味の一致」の内訳を原文の数値で足すと61.9%になり、分類全体の見出しにある62.2%とは、小数の四捨五入により0.3ポイントの差があります。
原文のまま書いています。
AgentGEOの仕組み
診断が終わったら、次は修理です。AgentGEOは、次の3段階で動きます。
- 診断と修理の繰り返し。学習用の質問1つごとに、対象ページと、実際に引用された競合ページを比べ、なぜ競合が選ばれたのかを、4分類の型に当てはめて診断します。診断結果に応じて、9種類の専用ツールの中から1つを選んで修理を試し、引用されるかを再テストします。うまくいかなければ、これまでに試して失敗した手を記録(メモリー)しておき、同じ失敗を繰り返さないようにして、診断からやり直します
- 複数の質問をまたいだ統合。1つの質問だけに合わせて直すと、別の質問では通用しない書き換えになりがちです。そこで、複数の質問での修理案をまとめて、質問によらず効く修正だけを選び、ページに反映します
- 局所的な編集。ページ全体を書き直すのではなく、HTMLの構造をもとにした小さなまとまり(段落や表など)ごとに、対象箇所だけを修正します。これにより、直していない部分の事実や言い回しが保たれます
修理に使う9種類のツールは、次の4つの役割に分かれています。情報を足す(欠けている固有名詞を挿入する、箇条書きの数値を表に変換する)、構造を整える(見出しや箇条書きを追加する、広告やナビゲーションと本文を区別する)、答えの位置を前に出す(冒頭で結論を先に述べる、埋もれた内容を要約として上に移す、質問の意図に合わせて書き出しを直す)、説得力を足す(根拠のある専門的な言い回しにする、古い情報に現在との関連づけを足す)です。
評価用のベンチマークと比較した手法
論文は、既存の評価方法(1つのページに1つの質問だけを対応させる)では、実際の書き手が「特定の質問にしか通用しない書き換え」をしていないかを確かめられない、と指摘します。
そこで、1つのページに複数の質問を対応させる評価用データセット「MIMIQ」を新しく作りました。204ページに、意図・想定読者・言い回しを変えた60問ずつ(学習用20問、テスト用40問)を用意し、合計12,240問です。
学習に使った質問とは別の、テスト用の質問だけで、書き換えの効果を確かめます。
比較した手法は、書き換えなしの基準、GEO原論文と同じ9種類の一律ルール(統計を足す、引用を足す、権威的な文体にするなど。
詳しくはGEO原論文の解説記事で紹介しています)、そしてこれらの一律ルールの中から効きそうな条件を自動で選ぶ手法「AutoGEO」です。
AutoGEOがいちばん強い比較相手として扱われています。
生成エンジンは実際のサービスが非公開のため、論文は自前の模擬環境を作りました。取得・解析・回答生成という3段階を再現し、引用の仕組みには2種類を試しています。
1つは、回答を作りながら根拠を決める方式(文中に「[1]」のような番号を振る、PerplexityやChatGPTの検索モードに近い方式)、もう1つは、先に根拠となる箇所を選んでから、その範囲だけで回答を作る方式です。
回答を作るAIには、GPT(gpt-4.1-mini)とClaude(Haiku 4.5)を使っています。
結果
引用率は上がり、書き換える範囲は小さく済んだ
| 手法 | 回答を作りながら根拠を決める方式の引用率 | 先に根拠を選んでから作る方式の引用率 |
|---|---|---|
| 書き換えなし | 56.58% | 60.20% |
| AutoGEO(一律ルールを自動選択) | 68.80% | 65.97% |
| AgentGEO(診断してから修理) | 79.52% | 70.00% |
回答を作りながら根拠を決める方式では、AgentGEOはAutoGEOを10.72ポイント上回りました。先に根拠を選んでから作る方式でも、4.03ポイント上回っています。
書き換えなしと比べた相対的な伸びは、前者で約41%です(56.58から79.52への伸びを、書き換えなしの値で割った概算)。
論文がまとめで述べる「40%を超える相対的な改善」は、この計算に基づいています。
あわせて重要なのは、書き換えた範囲の違いです。論文は、AutoGEOなどの一律ルールが平均で元の内容の25%を書き換えていたのに対し、AgentGEOは5%の書き換えで同等以上の引用率を達成した、と述べています。
実際、書き換え後の文章が元のページとどれだけ重なっているかを示す指標(Jaccard類似度)は、AgentGEOが82.40%だったのに対し、AutoGEOは17.97%でした。
診断して的を絞ったほうが、直す量は少なくて済む、という結果です。
使う生成AIによって、伸び方が違った
回答を作るAIをGPTからClaudeに変えた50ページの実験では、引用率の絶対値そのものが下がりました。GPTでは書き換えなし56.58%からAgentGEOで79.52%、Claudeでは書き換えなし42.40%からAgentGEOで54.80%です。
論文は、GPTのほうが書き換えた内容を引用に活かす力が強い可能性を挙げています。一方、適合率や再現率、文章の分かりやすさといった回答の質そのものは、手法によらずClaudeのほうが高い傾向でした。
すでに引用されやすい分野では、逆効果になることもあった
分野別に見ると、芸術・歴史・政治といった分野では大きく改善した一方、健康分野では改善がほとんどないか、むしろ下がりました。
理由として論文が挙げるのは2つです。健康分野はもともとの引用率がすでに約80%と高く、伸びしろが少なかったこと。
そして、残った未引用ページの一部で、直す過程が誤って専門的な情報を削ってしまい、かえって引用されにくくなったことです。一律ルールのAutoGEOは、もともとの引用率が高い分野で、書き換えなしより悪化することもありました。
すでに質の高いページに一律のルールを当てはめると、傷つけることがあるという指摘です。
直しても引用されないページがあった
50ページの実験では、学習用の質問での引用率は57.0%から83.7%まで上がりましたが、163件の質問は、直したあとも引用されないままでした。
論文が挙げる例は、大学のオンライン機械学習講座のページです。説明を詳しくして分かりやすさを改善しても、生成AIはCourseraやedXのような、すでに権威のある教育プラットフォームを選び続けました。
論文は、これは修理が効かなかったのではなく、ページの内容とは別の、ドメインの権威性という構造的な壁があるためだと述べています。
学習に使う質問を増やすほど、安定して伸びた
学習用の質問数を0問から80問まで変えた実験では、質問が増えるほど引用率の平均が上がり(0問で0.6837、80問で0.8044、相対で17.65%の伸び)、ばらつき(標準偏差)も0.2050から0.1625まで下がりました。診断と修理を繰り返すほど、効果が安定していく傾向です。
論文自身が書いている限界
論文自身は、次の点を今後の課題として挙げています。
- 実際の商用の生成エンジンではなく、独自に組み立てた模擬環境で実験しています。実際のChatGPTやPerplexity、Google AI Overviewでの検証は、今後の課題として書かれています
- 診断と修理の効率化(蒸留による軽量化など)も、今後の課題として挙げられています
加えて、この記事を書くために原文を読んで気づいた点があります。
- 使われたデータは、GEO-BenchとClueWeb22(英語圏中心のウェブ収集アーカイブ)から作られています。日本語での検証は、原文に記載がありませんでした
- 診断も、引用の判定も、質問の生成も、すべてAI(大規模言語モデル)が行っています。人手による評価は、確認した範囲では見当たりませんでした
- この論文はarXivのプレプリントで、査読を経たかどうかは確認できませんでした
- 健康分野での逆効果や、権威性の壁が原因で直っても引用されないページの存在は、論文の本文で明確に書かれています。「診断すれば必ず引用される」という論文ではありません
この論文から、言えること・言えないこと
| 言えること(論文の実験で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 診断してから直すほうが、一律のルールより引用率が上がり、書き換える範囲も小さかった | 実際のChatGPTやPerplexityでも同じ結果になること |
| 引用されない原因の多くは、質問との意味のずれだった | 日本語のページでも同じ分類・同じ割合になること |
| すでに引用されやすい分野への一律ルールは、逆効果になることがあった | 診断すれば、どんなページでも引用されるようになること |
| 権威性が理由で引用されないページは、内容を直しても引用されないことがあった | アクセス数や問い合わせ、売上が増えること |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 「引用されない」を1つの問題として扱わない。技術的に読み込めていないのか、質問と噛み合っていないのか、内容が薄いのかで、直す場所がまったく違います。自社のページも、まずどの型に近いかを分けて考える価値があります
- いちばん多い原因は、文章力ではなく「意味の一致」でした。この論文の実験では、意味の一致に関わる失敗が6割を占めています。読みやすさを整える前に、想定する質問とページの内容がずれていないかを確かめる方が近道かもしれません
- すでに評判の良いページに、一律のテコ入れをしない。健康分野の例のように、すでに引用されやすいページへ機械的な書き換えを重ねると、逆に情報が薄まることがあります
- 権威性で負けている場合は、コンテンツの修正だけでは変わらない可能性がある。大学講座の例のように、内容を直しても、より権威のある情報源が優先される場面があります。この場合の対策は、この論文の範囲の外です
よくある質問
AgentGEOは、誰でも使える仕組みですか
論文は研究用の枠組みとして提案しており、プロジェクトページのURLが示されています(実際に確認するとコードとデータセットが公開されています)。ただし、これは実際の商用サービスではなく、研究用の模擬環境の上で動く仕組みです。
この論文が言う「引用」とは何ですか
回答の中で、そのページが根拠として明示されることです。回答のどれだけを占めたかという貢献度とは分けて、引用されたか・されなかったかの二択で数えています。
結局、何から確かめればよいのですか
この論文の分類に沿うなら、まず自社のページが正しく読み込まれているかどうかです。次に、想定する質問と、ページの中身が本当に一致しているかどうかです。
文章の言い回しを整えるのは、その後の話になります。
まとめ:今日できる1つのこと
自社のいちばん見てほしいページを1つ選び、「このページは、どんな質問に答えるために書いたか」を1文で書き出してください。
そのうえで、実際のページの見出しと本文が、その質問に正面から答える形になっているかを確かめます。答えていない部分があれば、文章を整える前に、その質問への答えを先に足してください。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


