AIが答えを作るとき、引用に選ばれるのは、検索で見つけたページのごく一部です。では、似た内容の2つのページが競り合ったとき、AIは何を手がかりに片方を選ぶのでしょうか。この問いを、条件を1つずつ変えながら25万2,000回の実験で調べた論文があります。2026年5月25日にarXivで公開され、同年7月の国際会議SIGIR 2026(メルボルン開催)向けとして、ACMの書式とDOIが付いた「What Gets Cited: Competitive GEO in AI Answer Engines」です。
この論文は、自社ブログの「AIに引用されるページの条件 SIGIR 2026の実験研究から」でも紹介しています。この記事はその詳細版として、原文の本文、表、限界の節まで読み直しました。どんな設計で、どの数字が出て、どこまで言えるのかが分かります。数値は論文の表と本文から拾い、私が計算した値には「概算」と添えました。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文は「文章の見た目を整えるより先に、何を直すべきか」に実験で答えようとしているので、自社の優先順位を考える材料として読みました。
結論:3行で言うと
- 2つのページを並べる実験で、最初の引用を大きく左右したのは、質問との関連、リストの中での位置、価格の記載、日付の新しさの4つでした
- 見出しや段落の整え方といった書式だけの違いは、6つのAIのどれでも、統計的に意味のある差に届きませんでした
- ただし実験は、候補2件だけ、AI側の手順を固定した、商品レビュー記事の実験室です。実際のAI検索で同じ順に効くかは、論文が示した範囲の外です
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 原題 | What Gets Cited: Competitive GEO in AI Answer Engines |
| 著者 | Rahul Vishwakarma、Shushant Kumar、Ratnesh Jamidar(3人。全員の所属が同じ企業。産業界の論文です) |
| 公開日 | 2026年5月25日(arXiv、v1) |
| arXiv番号 | 2605.25517(分野はcs.AI) |
| 掲載 | 第49回ACM SIGIR会議(2026年7月20〜24日、オーストラリア・メルボルン)の会議録。論文は5ページ |
| 種類 | 企業所属の研究者による、統制した比較実験 |
| 実験データとコード | データとコードの公開の記載は見当たりません。抄録にあるのは、評価手順とチェックリストの公開のみです |
論文はこちらで読めます。arXiv(2605.25517)、会議録のDOI。SIGIRに載った根拠は、論文冒頭の引用書式に、第49回の国際ACM SIGIR会議(2026年7月20〜24日)の会議録と明記されていること、そしてarXivのページが上記DOI(ACMのもの)を関連DOIとして載せていることです。ACM側のページは、私の環境では開けませんでした。
この論文が答えた問い
2つの似たページが同じ引用枠を争うとき、内容のどの違いが「最初に引用される」ことを左右するのか。
2024年のGEO原論文(解説はこちら)は、書き換えたページが回答の中でどれだけ目立つかを測りました。ただ、それは1つのページの目立ち方を、決まった検索結果の中で見る設計でした。この論文の著者は、実際の場面はもっと厳しいと述べます。AIが引用するのは少数なので、ページは単独で十分に良いだけでなく、競合より選ばれる必要があるからです。ライブのAI検索を外から観察する分析は、検索順位や画面上の並びと内容の効果が混ざってしまう、とも指摘しています。
どうやって調べたのか
ここでの「引用」は、AIが回答の中で示したリンク(URL)を指します。研究は、実験室の中に「2件しか検索結果がないAI検索」を作り、その2件の違いを1か所だけにして、どちらが先に引用されるかを数えました。
| 項目 | 内容 |
|---|---|
| 素材 | 50カテゴリの一般消費者向け商品について、商品レビュー記事を2本ずつ、計100本。GPT-4oがWeb検索付きで集め、2026年の価格・仕様・日付を含みます |
| 匿名化 | ブランド名、型番、媒体名を架空の名前に置換。「有名だから選ぶ」効果を消すためです |
| 比較ペア | 18の要因ごとに20本を選び、1本から4つの場面を作成。要因あたり80、合計1,440の場面。2つの版は1つの要因だけが違い、事実、価格、仕様、長さ(±5%)はそろえます |
| 質問の言い換え | 1場面につき3通り。合計4,320 |
| 順番の入れ替え | 17要因は「A、B」と「B、A」の両方で実施。位置の要因だけは、順番そのものが処置なので固定です |
| 繰り返し | 同じ条件を5回ずつ |
| AIへの指示 | 全試行で同じ。「必ず検索ツールを使い、検索結果のURLをそのまま引用し、ほかの情報源や事前知識は使わない」という趣旨の文です |
| 結果の判定 | 回答の中で最初に出てくるURLが、どちらの版か。最初のURLが2版のどちらにも当たらない約3.4%は分析から除きました |
| 試行の数 | 17要因は各2,400、位置は1,200で、1モデル42,000。6モデルで25万2,000 |
| 統計手法 | 要因ごとに1本のロジスティック混合効果モデル(場面の違いによるばらつきを織り込む統計手法)。有意水準5% |
| 品質確認 | 著者3人が、1,440場面の21%にあたる300場面を独立に確認。ブランド名の残りや、意図しない差は見つからなかったと書かれています |
調べた6つのAIは、Gemini 2.5 Flash、Claude 3.5 Sonnet、Kimi K2 Thinking、GPT-5 Nano、GPT-5 Mini、GPT-5.2です。18の要因は、次の6分類に入ります。
| 分類 | 試した要因(優れた版 対 劣る版) |
|---|---|
| 内容の一致(2) | 質問に合う話題か、無関係な商品の話か/質問の語を含むか、欠くか |
| 網羅性(3) | 価格の記載の有無/仕様の記載の有無/他製品との比較の有無 |
| 信頼性(4) | 言い切りか、弱気な言い回しか/根拠(試験、認証)の有無/内部の矛盾の有無/売り込みの強さ |
| 読みやすさ(2) | 節に整理された構成か、密な段落か/情報がまとまっているか、散らばっているか |
| 競合上の立ち位置(4) | 価値の訴えの強さ/分析の深さ/評価やレビューの多さ/リストの1番目か2番目か |
| 鮮度(3) | 2026年の日付か2019年の日付か/日付なしか2019年か/2026年か日付なしか |
結果を読む前に、数字の見方を1つだけ押さえます。論文はオッズ比(勝ちやすさの倍率)で結果を示します。これは「優れた版が先に引用される確率を、劣る版が先に引用される確率で割った値」です。オッズ比が5なら、優れた版が先に引用される確率は5÷(5+1)で約83%になります(私の概算です。順番の偏りを調整したあとの値と論文は説明しています)。オッズ比が1に近いほど、差は小さくなります。
結果
4つの「関門」は、全モデルで有意でした
論文は、6モデルすべてで有意だった4要因を「ゲートキーパー(関門)」と呼びます。話題のずれ、価格の記載なし、古い日付、リストの2番目の4つで、どれか1つを外すと、ほかの内容が良くても引用の見込みが消えかねない、という位置づけです。表2から、モデルごとの倍率を拾います。
| 要因(優れた版 対 劣る版) | Gemini 2.5 Flash | Claude 3.5 Sonnet | Kimi K2 Thinking | GPT-5 Nano | GPT-5 Mini | GPT-5.2 |
|---|---|---|---|---|---|---|
| 関連する話題 対 無関係 | >10k | >10k | >10k | 221 | >10k | >10k |
| 価格あり 対 なし | >10k | >10k | 36.1 | 7.82 | 6.26 | 30.4 |
| 2026年 対 2019年の日付 | >10k | >10k | 68.7 | 14.4 | 1,494 | >10k |
| リストの1番目 対 2番目 | >10k | >10k | >10k | 2,002 | 1,795 | >10k |
「>10k」は、ほぼ毎回優れた版が勝ち、倍率を細かく推定できなかった場合の表記です。論文は「決定的な勝ち」と読むもので、1万倍という正確な値ではない、と断っています。
- 話題の一致と位置は、6モデルで倍率が非常に大きい結果でした。位置は、同じ内容でも1番目に置かれた版がほぼ毎回先に引用されています
- 価格は、6モデルすべてで有意でしたが、倍率には幅があります。Gemini、Claudeは1万倍超、GPT-5 Miniは6.26倍です
- 日付は、2026年の日付と2019年の日付の比較で大きな差が出ました。Kimiは68.7、GPT-5 Nanoは14.4と、モデルによる差があります
2番手の要因と、効かなかった要因
次の表は、表2の太字(有意)を私が数えた、6モデル中の有意な数です。論文は、4モデル以上で有意だった11要因を中心の要因として扱っています。
| 要因 | 有意だったモデル数(6中) |
|---|---|
| 話題の一致/価格/古い日付との比較/リスト位置 | 6 |
| 言い切り(弱気な言い回しとの比較)/分析の深さ | 5 |
| 仕様の記載/質問の語を含む/比較の有無/根拠の有無/内部矛盾のなさ | 4 |
| 価値の訴え/レビューの多さ/2026年の日付と日付なしの比較 | 3 |
| 売り込みの弱さ/日付なしと2019年の日付の比較 | 2 |
| 節に整理された構成/情報のまとまり | 0 |
表2の一部の値には、収束の警告(ヘッセ行列の退化、特異なあてはめ)が付いています。倍率は目安として読んでください。
- 書式の2要因は、6モデルのすべてで有意に届きませんでした。倍率は、構成の整った版と密な段落の版の比較で0.78〜1.68、情報がまとまった版と散らばった版の比較で1.13〜3.87でした。論文は、AIが見た目の整理にかかわらず内容を読み取るためだろう、と解釈しています
- 日付は、「古い」ことのほうが効いています。2026年と2019年の比較は大きな差でしたが、日付なしと2019年の比較は、有意だったのが2モデル、倍率は1.3〜2.3でした。これは表から読み取れる傾向で、理由の説明は論文にあるとは言えません
- 言い切りは、弱気な言い回しとの比較で有意でした。Claudeでは754倍ながら有意とは判定されておらず、モデルによる不安定さがあります
モデルによる違い
有意になった要因の割合は、Kimiが83%(18中15)と最も高く、GPT系がそれに続き、Claudeは50%、Geminiは33%でした。GeminiとClaudeは、有意な要因の67〜78%で倍率が1万を超え、「勝つか負けるか」に近い判断をしていると論文は述べます。GPT系の3モデルは、規模が違っても似た傾向でした。
論文自身が書いている限界
原文の限界の節には、3点が書かれています。
- 候補が2件だけであること。実際のAI検索は、しばしば5〜10件以上を取得します。著者は、1つの要因の効果を切り分けるために2件にしたと説明し、結果は「対戦の好み」であって、複数の候補が競り合う状況そのものではないと認めています
- ブランドと媒体名を匿名化していること。実サービスでは、有名なブランドや信頼されるサイトが選ばれやすい可能性が残ります。実名に戻した追加実験を、今後の課題として挙げています
- コーパスの作成にGPT-4oを使ったこと。素材の収集、匿名化、書き換えの生成にGPT-4oが関わっています。著者は、この設定は書き手としての質の判断ではないと述べ、300場面の人手の確認で偏りを減らしたと説明しています
将来の課題として、より多くの候補、複数の引用枠、検索から推薦までの一連の流れを含む検討を挙げています。
原文を読んで気づいた点(私の読み取りです)
- 本文の書き方と、表2の数字が食い違っています。本文は4つの関門を「全モデルで倍率100超」と書きますが、表2の価格はKimi 36.1、GPT-5 Nano 7.82、GPT-5 Mini 6.26、GPT-5.2 30.4で、4モデルが100を下回ります。日付もKimi 68.7とGPT-5 Nano 14.4です。6モデルすべてで有意という点は表と合いますが、「すべて100超」が当てはまるのは話題と位置だけです。抄録が価格と日付を「一貫して助ける」と書くのは、この表に近い書き方です
- 比べた2つの版の差が大きい要因があります。「無関係な商品の話」と「関連する話」の比較は、負けて当然の版との比較です。倍率の大きさを、現実のページの差にそのまま当てはめるのは慎重にすべきです
- 日本語は検証の対象外です。論文は対象言語を明記しておらず、示されている例文は英語です。対象は一般消費者向けの商品レビュー記事だけで、サービス業やBtoBの記事は範囲の外です
- 採点は自動です。「最初に出てくるURL」を機械で判定しており、その引用が回答の中で推薦されたか、ユーザーに読まれたかは対象外です。約3.4%の除外と、引用が2件以上あった10.5%の扱い(最初のURLのみ採用)も、結果に影響しうる約束事です
- 実サービスとの差があります。検索ツールを呼ぶ手順も検索結果も研究者が用意し、AIには「ほかの知識を使うな」と指示しています。実際のAI検索は、この指示のない状態で答えを作っています。各モデルを試した時期やバージョンの固定方法も、本文の記述の外です
- 信頼区間が示されていません。表2にあるのは倍率と有意かどうかの印だけです。要因ごとに別のモデルを当てはめ、多重比較の補正の記述は本文の範囲外です。モデルごとの倍率の差は、大まかな序列として読むほうが安全です
- 企業所属の研究で、現場での検証は質的な報告だけです。抄録は、著者の所属企業の社内の試験導入で「使いやすさについて前向きな感想があった」とだけ述べます。結論は「検証した」と書きますが、効果の裏づけは質的な感想の範囲にとどまります
- 査読の形式は、私の確認の範囲外でした。SIGIRの会議録に載ったことは、引用書式とDOIから確かめられます。ただ5ページの短い論文で、arXivの備考欄に採択の種別(本会議、短報、産業向け発表など)の記載はなく、論文の末尾には発表者の略歴の欄があります。どの形式で採択されたかは、原文からは分かりません
なお、GEO研究45本のサーベイがこの論文を「6つのAIモデル、18の要因、25万2,000回の試行」と紹介している点は、原文の記述と一致していました。
この論文から、言えること・言えないこと
| 言えること(論文の根拠あり) | 言えないこと |
|---|---|
| この実験の設定では、話題の一致、リストの1番目、価格の記載、新しい日付が、最初の引用を大きく左右した | 実際のChatGPTやGoogleのAI回答で、同じ順序で効くこと |
| 節の整理や段落の分け方だけの違いは、6モデルのどれでも有意な差に届いた例がなかった | 書式が読者にとって無意味であること。この実験はAIの引用だけを見ています |
| 2026年と2019年の日付の比較は、日付なしと2019年の比較より大きな差が出た | 「日付を書けば選ばれる」こと。日付なしと2026年の比較は3モデルでしか有意ではなく、有意だった3モデルの倍率は1.99〜3.67 |
| モデルによって、効く要因の数も倍率も違った | 特定のAIについて、この順序が今後も変わらないこと |
| 2つの候補の勝敗を、1要因ずつ切り分けて測る設計は可能 | 候補が5〜10件ある場合の勝敗。日本語ページや商品以外の記事への当てはまり |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 価格と日付は、手間の割に確かめやすい項目です。「詳細はお問い合わせください」で済ませているページは、目安の金額を書けるか見直す価値があります。更新日は、中身を見直した日だけを正直に書きます。実験は日付表記だけを変えた比較なので、日付の効果は示されています。ただし2019年と2026年という大きな差で、数か月の更新でも効くかは分かりません。見直していない日付の更新は、正直さの面でもおすすめしません
- 「1番目に置く」は、記事の中でも同じかもしれません。この実験は候補ページの順番の話ですが、AIが先に読んだ情報を重く扱う傾向は、ページ内の並べ方にも関係しうると私は考えます。ただし論文が調べたのは、候補ページの順番だけです。仮説として、結論と価格を先頭に置くページを1つ試す程度が適切です
- 見出しの付け方に時間をかける前に、質問に直接答えているかを見直します。関連性は、この実験で最も強く効いた要因の1つです。書式の2要因が効かなかった結果と合わせると、優先順位は「質問への直接の答え」が先、「見た目の整理」が後になります。人間の読者にとっての読みやすさは別の話で、そちらは引き続き大切です
- 「取得されること」は別の課題として残ります。この実験は、AIがすでに2件を受け取った後の話です。論文の実務手順も、自社が引用元に出てこないときは検索での取得(従来のSEO)が課題で、引用されているのに推薦されないときに内容を診断する、という順で書かれています
よくある質問
Q. 価格を書けば、AIに引用されるようになりますか。
論文が示したのは、価格の有無だけが違う2つの版のうち、価格のある版が先に引用されやすい、という実験結果です。引用の保証とは別の話です。取得される段階を通ったうえでの話で、対象も商品レビュー記事に限られます。
Q. 見出しや箇条書きを整える作業は、無駄になるのでしょうか。
この実験の範囲では、書式の違いだけでは、引用の勝ち負けは動きませんでした。ただし、読者の読みやすさは測定の対象外です。AIの引用対策としての優先度は低い、という読み方が妥当です。
Q. 日本の中小企業のページにも当てはまりますか。
未確認です。論文は日本語のページを調べておらず、対象は商品レビュー記事です。まずは自社の主要な質問を数件選び、実際のAIに聞いて、引用されるページの共通点を自分の目で確かめるのが確実です。
まとめ:今日できる1つのこと
「詳細はお問い合わせください」と書いている主力ページを1つ選び、目安の価格と、内容を見直した日付を書き足してください。書き足す前と後で、同じ質問をAIに投げ、引用される様子を記録しておくと、自社のページで何が起きたのかを自分の数字で確かめられます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

