「文章に統計や出典を足せば、AIの回答に載りやすくなる」。LLMO対策の話で、よく聞く説明です。ただ、この説明が確かめられた実験の多くは、AIに渡すページがあらかじめ決まっている状態で行われました。実際の検索では、ページはまず拾われ、並べ替えられ、その上位だけがAIに渡されます。この前半まで含めて調べたのが、2026年2月公開の「SAGEO Arena」です。
この記事は、その論文を原文から読み、何が分かり、何が分かっていないのかを整理します。サーベイ論文の解説記事で触れた数値(17万1,003本の文書、2,700問、減少率)が原文と合っているかも確かめました。ページの構造情報(タイトル、メタディスクリプション、見出し、スキーママークアップ)を最適化した結果も、原文の表から拾っています。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文は、「本文を書き換えた効果」と「そもそも拾われるか」を別々に測る考え方を、数字で見せてくれます。
結論:3行で言うと
- 検索、再ランク(並べ替え)、回答生成をつないだ実験環境で、本文だけを書き換えると、検索段階と再ランク段階で順位が下がることが多く、回答での引用率も平均でわずかに下がりました
- タイトル、メタディスクリプション、見出し、スキーマ(JSON-LD)をまとめて書き換えると、検索段階で拾われる割合は平均で相対22%上がりました。ただし再ランク段階では、こちらも下がっています
- 著者たちは、段階ごとに狙いを変える「stage-aware」という書き換え方を試し、実験した組み合わせで最も高い引用率を得ました。ただし、実験環境は商用のAI検索とは別物です
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 原題 | SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization |
| 著者 | Sunghwan Kim、Wooseok Jeong、Serin Kim、Sangam Lee、Dongha Lee(5人。延世大学、建国大学。韓国) |
| 公開日 | 2026年2月12日(arXiv初版)。私が読んだのは2026年8月7日付のv2です |
| arXiv番号 | 2602.12187(分野はcs.IR、情報検索) |
| 掲載・採択状況 | arXivのcomment欄に「Accepted at KDD 2026」。書式もKDD 2026(2026年8月、韓国・済州島)の会議録の形です |
| 種類 | 評価環境(ベンチマーク)の提案と、それを使った実験。学術論文で、企業の自社報告ではありません |
| データとコード | Zenodo(DOI: 10.5281/zenodo.20423531)とGitHub(happysnail06/SAGEO_Arena)で公開と、論文に書かれています |
論文はこちらで読めます。arXiv(2602.12187)、会議録(DOI)。
SAGEOは、「検索を使って回答を作るAIの中での、見え方の最適化」を指す論文の用語です。
この論文が答えた問い
ページの文章を書き換える最適化は、検索、再ランク、回答生成のすべての段階を通したときにも、見え方を良くするのか。ページの構造情報を書き換えると、何が変わるのか。
背景として論文が挙げる点です。GEOの原論文をはじめ、これまでの評価環境は、AIに渡す候補ページを最初から固定していました。そのため、書き換えたページが、渡される前の段階で落ちるかどうかは、未検証でした。また、従来の環境は本文の文字だけを扱い、スキーママークアップのような構造情報を捨てていました。
どうやって調べたのか
論文は、実際の検索エンジンに近い3段階の仕組みを自前で組み、その中で1本のページを書き換えて、前後の順位を比べました。
| 項目 | 内容 |
|---|---|
| 質問 | 9つの既存データセットから300問ずつ、計2,700問。分野は、ウェブ検索、一般QA、複数文書にまたがる推論、生物医学、コミュニティQA、金融、討論、ショッピング、学術です |
| 文書 | 質問ごとにGoogleのCustom Search APIで最大100件を取得し、ページを収集。不正な内容を除いて、17万1,003本(1問あたり平均63本) |
| 保存した情報 | 本文に加え、構造情報としてタイトル、メタディスクリプション、見出し(H1〜H6)、スキーマ(JSON-LD)を、別々のフィールドとして保持 |
| 検索段階 | BM25(単語の一致で点数をつける古典的な方式)で上位100件 |
| 再ランク段階 | Qwen3-Reranker-4Bという別のAIが、質問との関連で並べ替え、上位10件を残す |
| 回答段階 | GPT-5-miniが、上位10件から出典つきの回答を作る |
| 書き換え | 10種類。GEO原論文の8手法(権威的な文体、出典の追記、引用の追記、平易化、滑らかな文章、統計の追記、専門用語、珍しい語)、8つを全部使うAll-in-One、AutoGEO(AIの引用の傾向から学んだルールで書き換える手法) |
| 書き換える範囲 | 本文のみ、構造情報のみ、両方の3通り |
手順は次のとおりです。質問ごとにまず仕組みを動かし、再ランク後の上位10件に入ったページから、1本をランダムに選んで「対象ページ」にします。そのページを書き換えて索引に戻し、同じ質問でもう一度動かして、各段階での前後を比べます。
指標は2つです。1つ目は、上位k件に入った質問の割合(Hit Rate、H@k)です。検索段階は上位20件に入る割合(H@20)、再ランク段階は上位10件に入る割合(H@10)で見ています。回答段階は、対象ページが引用された質問の割合(Citation Rate)です。2つ目は、順位が書き換え前から何位動いたか(順位変化)で、プラスなら順位が上がったことを表します。
これから出てくる「%」は、原則として書き換え前の基準値に対する相対的な変化です。基準値は、検索段階のH@20が0.58、再ランク段階のH@10が1.00、引用率が0.50です。再ランクのH@10は、対象ページを再ランク後の上位10件から選んだため、書き換え前は必ず1.00になります。この段階は、構造上「下がるか、変わらないか」の比較になります。
結果
本文だけ、構造だけ、両方:10手法の平均
| 書き換える範囲 | 検索段階 H@20 | 再ランク段階 H@10 | 回答段階 引用率 |
|---|---|---|---|
| 書き換え前(基準) | 0.58 | 1.00 | 0.50 |
| 本文のみ | 0.53(-9%) | 0.84(-16%) | 0.47(-6%) |
| 構造情報のみ | 0.71(+22%) | 0.83(-17%) | 0.52(+2%) |
| 両方 | 0.67(+15%) | 0.75(-25%) | 0.48(-5%) |
- 本文のみの書き換えは、3段階すべてで平均が基準を下回りました
- 構造情報だけを書き換えると、検索段階で大きく上がり、引用率も平均で少し上がりました。再ランク段階は、本文のみとほぼ同じ水準で下がっています
- 両方を書き換えると、構造情報だけのときより成績が落ちました。論文は、本文の書き換えの悪影響が、構造情報の利点を一部打ち消している可能性があると述べています
手法ごとの違い(抜粋)
| 手法 | 本文のみ:検索 / 再ランク / 引用 | 構造のみ:検索 / 再ランク / 引用 |
|---|---|---|
| 滑らかな文章 | -1% / -9% / -1% | +30% / -12% / +5% |
| 統計の追記 | -2% / -10% / -4% | +29% / -14% / +7% |
| 引用の追記 | -1% / -10% / -7% | +27% / -15% / +4% |
| 専門用語 | -14% / -20% / -6% | +13% / -21% / +1% |
| All-in-One | -14% / -17% / -2% | +22% / -18% / -1% |
| AutoGEO | -36% / -42% / -22% | +4% / -27% / +0% |
- 本文のみで最も落ちたのはAutoGEOです。論文は、書き換えで文章が大きく膨らみ、質問に出てくる言葉との重なりが薄まったためと説明しています。検索段階の順位は、平均で22.35位下がりました
- 専門用語や珍しい語への置き換えも、大きく落ちました。質問で使われる言葉から離れると、単語の一致で点数をつける方式には不利になります
- 構造情報の書き換えで伸びた理由について、論文は、タイトルなどが本来、質問に関係する語を詰めた欄であり、質問との単語の重なりが増えるためと述べています。
再ランク段階が、最後まで残る壁だった
論文は、再ランクを「持続的なボトルネック」と呼んでいます。上位10件の点数は接近しているため、小さな書き換えでも順位が入れ替わります。書き換えた対象ページの5.8%は、再ランクで10位から11位に落ち、回答を作るAIに渡される枠からこぼれました。渡される枠から外れたページは、内容が良くても、回答の材料になる機会を失います。
事例の分析では、次の傾向が示されています。
- 質問が知りたいことに直接答える内容を足すと、順位が上がる
- 質問が求める範囲を超えて内容を広げると、順位が下がる
- 答えを文書の前のほうに置くと点数が高く、答えを後ろの段落に移すと、答えが残っていても大きく下がる
引用されるのは、本文の内容だった
引用した部分を回答AIに引用文つきで示させ、元のページのどこから来たかを調べた結果、引用の大半は本文からでした。構造情報は、検索段階の貢献に比べて引用されることが少なかったと論文は述べます。論文は、構造情報が「ページを表に出す」役割、本文が「回答の材料になる」役割で、補い合う関係だと整理しています。
stage-aware(段階ごとに狙いを変える)書き換え
著者たちは、これらの結果をもとに、次の4つの指針で書き換える方法を作りました。
- 本文の重要な語、数字、固有名詞を、構造情報の欄に映す(entity mirroring)
- 主張を本文の冒頭に置き、1つ1つの文を、前後を読まなくても分かる形にする
- 指示語を減らし、主語を明示して、段落どうしのつながりを保つ
- 先にページの分野を判断し、すでに良い欄は変えない
| 方法(両方を書き換える設定) | 検索 H@20 | 再ランク H@10 | 引用率 |
|---|---|---|---|
| 書き換え前(基準) | 0.58 | 1.00 | 0.50 |
| 滑らかな文章+引用の追記 | 0.66(+13%) | 0.77 | 0.54 |
| 平易化+引用の追記 | 0.67(+14%) | 0.78 | 0.54 |
| stage-aware | 0.75(+28%) | 0.80 | 0.58 |
stage-awareの引用率は0.58で、基準の0.50から8ポイント上がっています。相対では約16%です(0.08÷0.50の概算)。再ランク段階のH@10は0.80で、基準の1.00より低いままです。組み合わせの比較は、平易化や滑らかな文章に引用や統計を組み合わせた4通りとの間で行われています。比較したのは表3の4通りで、検定や信頼区間は原文にありません。「最も高い」は、この比較の範囲内の話です。
追加の確認
- 検索方式を替えた場合:本文のみの書き換えでのH@20の平均は、BM25で-9%、意味の近さで探す方式で-2%、両者の混合で-5%でした。下がる傾向は残っています
- 再ランクや回答AIを替えた場合:別の再ランクモデルでは、平均の落ち幅が大きくなりました(-16%が-19%)。回答AIを替えても、引用率は平均で-12%と下がりました(基準は0.77)
- 分野別:幅広い調べものの質問で効果が出やすい一方、ショッピングは、すべての手法で引用が下がりました。論文は、商品ページがすでに整理されているためと考察しています
- 書き換えAIを替えた場合:短くキーワードが詰まった文章を作るモデルは、検索段階の勝率が最も高くなりました。ところが再ランクと回答の段階では、質問に実質的に答える文章を作るGPT-5-miniが勝ち、回答段階の勝率は73.2%でした
- 質問の言い換え:付録では、質問を言い換えると見え方が下がり、元の言い方から遠いほど大きく下がりました
論文自身が書いている限界
論文の付録には、次の限界と前提が書かれています。
- SAGEO Arenaによる再現は、商用の検索エンジンの一部にとどまります。商用エンジン独自の順位づけの信号や、利用者の行動の信号は、入手も再現も難しいため含まれていません
- 再現できる範囲として、コンテンツ制作者が見て、直接変えられる要素に絞っています。より豊かな順位づけ信号と行動信号の取り込みは、今後の課題とされています
- 索引では、構造情報の各欄と本文に同じ重みをつけています。実際の検索エンジンは欄ごとに重みが違うが、効果を純粋に見るために均等にしたと、論文は説明しています
原文を読んで気づいた点
ここから先は、論文が書いていない、私が読んで気づいた点です。
- 日本語での検証は、原文の範囲の外です。質問データセットの名前から英語が中心と読み取れますが、言語の記述そのものが見当たりませんでした。日本語のページへの当てはまりは、この論文から判断できません
- 構造情報の欄ごとの効果は、分けて測られていません。結果は、タイトル、メタディスクリプション、見出し、スキーマをまとめた「構造情報」として報告されています。スキーマだけを書き換えた結果は、表にありません。スキーマ(JSON-LD)は、論文の実験では、文字として取り出されて単語一致の索引に入っています。実際の検索エンジンが、スキーママークアップをどう読むかを、再現した実験ではありません
- 再ランク段階の比較には、設計上の制約があります。対象ページを再ランク後の上位10件から選んでいるため、基準のH@10は1.00で、書き換え後は下がるほかありません。この段階の落ち幅は、その分だけ厳しく出る設計です。検索段階の基準0.58も、再ランク後に上位10件へ入ったページを対象にした値である点は同じです
- 表と本文で、記述がずれている箇所があります。本文は、構造情報のみの書き換えが「再ランクと回答段階でも見え方を良くする」と述べていますが、表2では、構造情報のみの再ランクH@10は平均0.83(-17%)で、基準を下回っています。引用率も平均+2%と小さな値です。同じ5.1節の別の段落は、再ランク段階ではどの範囲を書き換えても劣化すると述べており、論文の本文どうしも食い違っています。表2は劣化を示しています。また、本文は本文のみの書き換えで回答段階の「伸びは限られる」と書きますが、表2の平均は-6%で、プラスではありません。5.1節の冒頭にある、すべての段階で見え方が下がるという記述とも、食い違っています。この記事は、表の数字を優先しました
- 自動採点です。順位と引用は機械で数えており、人が読んだ評価ではありません
- 査読を経た学会論文です。arXivのcomment欄に、KDD 2026採択とあります。原文にも会議録のDOIがあります。ただし、私が読んだのは会議の開催直前(2026年8月)に更新されたv2で、初版のarXivから内容が変わっている可能性があります
- 競争は含まれていません。対象ページは1質問に1本だけ書き換えられます。複数のサイトが同時に書き換える状況は、この実験にありません
この論文から、言えること・言えないこと
| 言えること(論文の実験の範囲) | 言えないこと |
|---|---|
| この実験環境では、本文だけの書き換えは、検索段階と再ランク段階で平均して順位を下げた | 実際のChatGPTやGoogleのAI検索でも、同じように順位が下がる |
| タイトルなどの構造情報をまとめて書き換えると、検索段階で拾われる割合が平均で相対22%上がった | スキーママークアップだけを足せば、拾われやすくなる |
| 引用されたのは、大半が本文の内容だった | 構造情報は、回答の内容に影響しない |
| 質問が知りたいことに直接答える内容と、答えを文書の前に置くことが、再ランクで有利に働いた例がある | 日本語のページ、日本のサービスでも同じ強さで効く |
| 分野によって効き方が違う。ショッピングは、すべての手法で引用が下がった | 書き換えれば、問い合わせや売上が増える |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 「回答で目立たせる」前に、「拾われる」ことを先に確かめます。実験で、書き換えた本文が回答段階の前に落ちていたことは、文章を磨く前に、そのページが検索で拾われる状態かを見る理由になります。自社のページが、狙う質問の言葉で検索に出ているかは、通常の検索でも確かめられます
- 質問で使われる言葉から離れないようにします。専門用語や珍しい語への置き換えで大きく落ちた結果は、利用者が検索で使う言葉を、そのまま本文に残す価値を示しています。ただし、これは単語の一致で探す方式での結果です
- タイトル、メタディスクリプション、見出しは、本文の内容を正確に映す場所として見直せます。この実験で伸びたのは、本文の重要な語を、これらの欄に映した書き換えでした。同じことを、内容を偽らない範囲で行うのは、通常のSEOの基本作業でもあります。スキーマの記述は、この論文だけを根拠に優先度を決めないほうが安全です
- 答えは、ページの前のほうに置きます。再ランクで、答えを前に置いたページが有利だった事例は、日本語のページでも試す価値があります。ただし、事例の分析であり、統計的な検証ではありません
よくある質問
スキーママークアップを入れれば、AI検索で見えやすくなりますか
この論文からは、そこまで言えません。論文の「構造情報」は、タイトル、メタディスクリプション、見出し、スキーマをまとめた指標で、スキーマ単体の効果は表にありません。また、論文の実験ではスキーマが文字として取り出されて単語の一致で探す索引に入っており、実際の検索エンジンがマークアップとして読む処理とは別物です。
サーベイ記事に書いた数字は、原文と合っていますか
17万1,003本、2,700問、上位20件(検索段階H@20)の約9%、再ランク後の上位10件の約16%、最終的な引用の約6%は、いずれも原文の表と一致しました。これらは、本文のみを書き換えたときの、10手法の平均の相対的な減少率です。検索はBM25、再ランクはQwen3-Reranker-4B、回答はGPT-5-miniという標準設定での値です。
本文を書き換えるのは、やめたほうがいいのでしょうか
論文は、本文の書き換えを不要とは述べていません。むしろ、回答での引用は本文の内容から起きており、本文と構造情報は役割が違うとしています。実験で下がったのは、質問の言葉から離れる書き換えや、大きく膨らませる書き換えでした。
まとめ:今日できる1つのこと
自社のいちばん大事なページを開いて、タイトル、メタディスクリプション、見出しを、本文の中身と見比べてください。本文で答えている質問の言葉が、これらの欄に入っていなければ、書き足す価値があります。内容を偽らず、質問に出てくる言葉のまま、短くまとめるのが要点です。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

