生成AIの検索エンジンに引用されやすくするための工夫として、これまでよく紹介されてきたのは「統計を足す」「権威的な言い回しにする」といった、文章の中身を書き換える方法です。
今回取り上げる論文は、視点を変えて、文章の中身には手を付けず「構造」だけを変えたときに何が起きるかを調べています。東京大学・筑波大学・広島大学・国立情報学研究所の研究者らによる「GEO-SFE」という枠組みで、見出しの付け方や段落の長さ、箇条書きや表の使い方、強調表現の入れ方を、6つの生成AI検索エンジンを相手に検証したものです。
この記事では、原文のPDFを通読し、論文の表と本文に載っている数値だけを拾って、何が分かって何が分かっていないのかを整理します。
論文の主張と、書き手であるこちらの読み取りは分けて書きます。特に、論文の中で出典が確認できなかった数値や、査読の有無といった、原文を読まないと気づけない点も併せて記載します。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、文章の中身を一切変えずに構造だけを整えるという、自社でも今すぐ試せる範囲の工夫に、どこまでの根拠があるのかを確かめておくためです。
結論:3行で言うと
- 見出しの深さ、段落の長さ、箇条書きや表の使用比率、強調表現の量、内部リンクの密度という「文章の形」に関する5つの数値を論文が示す範囲に近づけると、6つの生成AI検索エンジンで引用される割合が上がったと報告されています
- 全体では引用率が平均17.3%(相対)改善し、改善の内訳を分解すると、見出しやナビゲーションなど文書全体の骨格(マクロ構造)の寄与が最も大きく、強調表現などの細部(ミクロ構造)の寄与は相対的に小さいという結果でした
- この論文には掲載先の学会名の記載がなく、確認できた範囲ではarXivのプレプリント段階です。また、数値の一部は出典や対応する実験結果の表が本文中で確認できませんでした
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Structural Feature Engineering for Generative Engine Optimization: How Content Structure Shapes Citation Behavior |
| 著者 | Junwei Yu、Yang MuFeng、Yepeng Ding、Hiroyuki Sato(4人。所属は東京大学、筑波大学、広島大学、東京大学/国立情報学研究所) |
| 公開日 | 2026年3月31日(arXiv初版v1) |
| arXiv番号 | 2603.29979 |
| 掲載/採択状況 | arXivプレプリント。学会名の記載は本文・コメント欄になく、確認できた範囲では未採択 |
| 種類 | 大学に所属する研究者による研究(企業の自社報告ではない) |
| 実験データ/コードの公開先 | 論文中に記載なし |
論文はこちらで読めます。arXiv(2603.29979)。
この論文が答えた問い
文章の意味内容をそのままにして、見出しの付け方・段落の長さ・箇条書きや表の使い方・強調の入れ方といった「構造」だけを変えると、生成AIの検索エンジンがその文章を引用する確率は変わるのか、変わるならどの構造要素がどれだけ効くのか。
論文は、この問いを立てた背景として、既存のGEO(生成エンジン最適化)研究が「統計を足す」「引用を足す」といった意味内容の書き換えに集中してきたことを挙げています。
この分野の出発点となったGEO原論文の解説記事で扱った研究がその代表例です。
論文は、構造だけを独立した変数として扱い、意味内容とは別に測定した研究がこれまで無かったとしています。
どうやって調べたのか
論文は文章の構造を3つの階層に分けています。上位の階層ほど文書全体に関わり、下位の階層ほど1文の中の細部に関わるという整理です。
| 階層 | 何を指すか | 具体例 |
|---|---|---|
| マクロ構造 | 文書全体の骨格 | 見出しの階層の深さとバランス、ページ内のリンク構成、段落間の話の流れ |
| メソ構造 | セクション単位の情報のまとめ方 | 段落の長さ、箇条書きや表への言い換え、情報の詰め込み具合 |
| ミクロ構造 | 文単位の見せ方 | 太字・斜体などの強調、キーワードを置く位置、文の読みやすさ |
この3階層をもとに、論文は5つの最適化の目安を示しています。それぞれ、どの範囲に収めると引用率が上がりやすいかという数値付きの指針です。
| 原則 | 対象 | 論文が示す目安 |
|---|---|---|
| 見出しの階層 | マクロ構造 | 見出しの深さ3〜5階層。深すぎると情報が分散し、浅すぎると整理の手がかりが不足するとしています |
| 段落の長さ | メソ構造 | 1段落あたり150〜300語(英語の語数基準) |
| 構造化要素の比率 | メソ構造 | 箇条書き・表・コードブロックが全体の25〜35% |
| 強調表現の比率 | ミクロ構造 | 太字や斜体などの強調を全体の5〜10%に収める |
| 内部リンクの密度 | マクロ構造 | 概念同士のリンク密度15〜20%、平均の経由段数3未満 |
これらの目安に沿って文章を書き換えるアルゴリズムを組み、書き換え前後を6つの生成AI検索エンジンで比較する、という実験設計です。実験の設定は次のとおりです。
| 項目 | 設定 |
|---|---|
| 記事データ | GEO原論文の実験に使われた「GEO-bench」から200記事を抽出(6分野からおよそ33記事ずつ。分野は伝記・健康・技術・金融・旅行・科学)。記事の平均語数は2,547語 |
| 質問データ | 実世界の質問377件 |
| 比較対象の生成AI検索エンジン | Google SGE・Bing Chat(検索してから一括で答えるタイプ)、Perplexity AI・Phind(何度も検索を繰り返すタイプ)、ChatGPT・Claude(検索と生成を同時に進めるタイプ)の6つ |
| テストケース数 | 200記事×6エンジン×2バージョン(書き換え前後)=2,400件 |
| 意味内容が保たれているかの確認 | 文の埋め込み表現(BGE-m3)による類似度で確認。平均0.843 |
主な評価指標は、質問に対する回答の中でその記事が引用された割合を示す「引用率」と、引用の範囲・位置・影響力を合成した「可視性スコア」の2つです。
これに加えて、Gemini 2.5 Proという生成AIに、関連性や独自性など7つの観点を採点させる主観評価も行っています。
採点は温度0.3で5回行い、その中央値を使っています。
結果
まず引用率と可視性スコアの変化です。論文の表(Table IV)から、書き換え前後の数値と、その相対的な伸び(論文本文に記載の値)を示します。
| 検索エンジンの種類 | 引用率:書き換え前 | 引用率:書き換え後 | 相対的な伸び |
|---|---|---|---|
| 検索してから一括で答えるタイプ | 43.7% | 52.1% | +19.2% |
| 何度も検索を繰り返すタイプ | 52.3% | 59.6% | +14.0% |
| 検索と生成を同時に進めるタイプ | 39.1% | 46.8% | +19.7% |
| 全体平均 | 45.0% | 52.8% | +17.3% |
この伸びは、200記事のペアを比べた統計的検定で有意(p<0.001)とされ、効果量はCohenのdで0.64(中程度からやや大きい水準)と報告されています。何度も検索を繰り返すタイプは、そもそもの引用率が高いため伸び幅は相対的に小さいものの、それでも14.0%の改善が見られています。
主観評価でも同じ方向の結果が出ています。7つの観点の平均は書き換え前19.5から書き換え後23.1に上がり、相対的な伸びは18.5%です。
観点別に見ると、回答への影響力を示す「Influence」が32.0%、クリックされそうかを示す「Click Probability」が31.4%と、他の観点より大きく伸びています。
ただし、この評価はGemini 2.5 Proという単一のAIモデルによる自動採点です。
3階層のうち、どれがどれだけ効いたかを見るために、論文は各階層を1つずつ除いた比較(アブレーション分析)も行っています。
| 設定 | 引用率 | 全体からの下がり幅 | 寄与率 |
|---|---|---|---|
| 3階層すべてを最適化 | 52.8% | – | 100% |
| マクロ構造を除く | 49.3% | -3.5 | 44.9% |
| メソ構造を除く | 49.7% | -3.1 | 39.7% |
| ミクロ構造を除く | 51.6% | -1.2 | 15.4% |
| 書き換え前(基準) | 45.0% | -7.8 | – |
この表から読み取れることをまとめます。
- 見出し階層やリンク構成など文書全体の骨格(マクロ構造)の寄与が最も大きく、全体の改善幅のおよそ45%を占めています
- 段落や箇条書きの整え方(メソ構造)がそれに次ぎ、およそ40%を占めています
- 強調表現やキーワードの位置(ミクロ構造)の寄与はおよそ15%と、他の2つより小さいという結果でした
- 論文は3つの寄与率を足すとほぼ100%になることから、3階層は独立して効いていると解釈しています
論文自身が書いている限界と、原文を読んで気づいた点
この論文には、他の多くの研究論文にあるような独立した「限界」の節がありません。本文と結論で触れられている留保点は、何度も検索を繰り返すタイプの検索エンジンはもともとの引用率が高いため伸び幅が相対的に小さくなる、という説明にとどまります。
そのため、ここからは原文を通読して気づいた点を記載します。
- 掲載先は未確認です。本文はIEEE系の学会論文でよく見る2段組の書式で書かれていますが、arXivのコメント欄には学会名の記載がなく、DBLPとSemantic Scholarへの照会は接続制限のため実施できませんでした。Web検索でも、この論文の掲載先を示す情報は見つからず、確認できたのはarXiv本体とその複製を掲載するサイトのみでした
- 一部の数値に出典や対応する表が見当たりません。「段落が150語を下回ると引用確率が23%下がる」という数値には出典番号が付いておらず、対応する実験結果の表も本文中では不明です。「300語を超えると注意力が31%低下する」という数値には出典[27](他の研究者による論文)が付いており、この論文自身の実測ではなく既存研究の引用です。「構造化された形式はプレーンな文章より43%高い抽出精度を示す」という数値も「本実験で」と書かれていますが、対応する表が確認できませんでした
- 主観評価は人手ではなくAIによる採点です。Gemini 2.5 Proという生成AIが、別の生成AIが書き換えた文章を採点する構図になっており、評価はAIによる自動採点にとどまります
- 対象は英語の記事のみです。使われた200記事はGEO-bench由来で、日本語での検証は論文に含まれていません
- 実サービスを計測した時期は不明です。Google SGE・Bing Chat・Perplexity AI・Phind・ChatGPT・Claudeという実際のサービスを対象にしていますが、これらは仕様変更が頻繁なサービスであるにもかかわらず、いつの時点の挙動を計測したかという日付は本文で確認できませんでした
- 構造の書き換えはすべて自動処理です。見出しの併合や分割、段落の分割・結合、強調の付与は、いずれもアルゴリズム(論文中のAlgorithm 2〜5)によって自動で行われており、人が手作業で構造を整えた場合に同じ効果が出るかどうかは検証されていません
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 見出し階層・段落長・構造化要素の比率・強調表現の量・内部リンク密度という5つの目安に近づけると、この実験の設定では引用率が上がった | 日本語のページで同じ大きさの効果が出ること |
| 文章の意味内容を変えなくても、構造だけの変更が引用率に影響した | いま(2026年9月時点)のGoogle SGEやChatGPTでも同じ数値が再現されること |
| 6つの生成AI検索エンジンいずれでも、方向としては同じ改善が見られた | 人の手で構造を整えても同じ効果が出ること(実験はアルゴリズムによる自動変換) |
| 3階層のうち、見出しやリンクなど文書全体の骨格(マクロ構造)の寄与が最も大きかった | Gemini以外のAIや、人が採点しても同じ評価になること |
| 効果量は中程度(Cohenのd=0.64)で、統計的に有意だった | 検索順位、アクセス数、問い合わせ件数が増えること(測定対象は引用率と可視性スコアのみ) |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 見出しの深さと段落の長さは、今日から手を付けられる範囲です。見出しをH2の下にH3を並べる形で3〜5階層程度に整え、1段落を長くしすぎないようにする調整は、専用のツールがなくても記事の編集画面で直せます
- 箇条書きや表には、増やしすぎない範囲の上限があります。論文は構造化要素の比率を25〜35%という上限付きの範囲で示しており、比率に上限があるという点が実務では参考になります
- 強調(太字)も上限が示されている点は、自社の運用方針と方向が一致します。論文が示す強調表現の目安は文章全体の5〜10%で、1割を超えない範囲です。当社が記事の機械チェックで太字の使用量に上限を設けているのも、近い考え方です
- 数値をそのまま輸入するのは避けたい点です。この論文の目安は英語の記事と海外の生成AIを対象にしたもので、語数の基準を日本語の文字数へ換算するには別の検討が必要です。自社の記事で少数から試し、AIの回答に引用される頻度が変わるかを見るという、検証の手順を挟む必要があります
よくある質問
GEO-SFEが示した構造の最適化は、統計や引用を足す従来のGEO対策と両立しますか
論文は、構造の最適化を、意味内容の書き換え(GEO原論文が示した「統計を足す」「引用を足す」といった方法)を置き換えるものではなく、補完するものと位置づけています。ただし、この論文の実験は構造の変更だけを検証したもので、意味内容の書き換えと組み合わせた場合の数値は今後の検証課題として残されています。
見出しの深さや段落の長さの目安は、日本語の記事にもそのまま当てはめてよいですか
論文が示す目安(見出し階層3〜5、段落150〜300語)は、英語の記事を対象にしたものです。日本語は文字数と語数の関係が英語と異なるため、この語数の範囲を文字数へ換算するには別の検討が必要です。
対象は英語の記事のみで、日本語での検証は今後の課題です。
強調表現(太字)は、増やせば増やすほど生成AIに引用されやすくなりますか
論文が示す目安は文章全体の5〜10%で、上限が設けられています。またアブレーション分析では、強調表現などのミクロ構造の寄与は改善幅全体のおよそ15%にとどまり、見出し構造(マクロ構造)や段落構成(メソ構造)より小さいと報告されています。
まとめ:今日できる1つのこと
自社の直近の記事を1本開き、見出し(H2・H3)の階層が3〜5段程度に収まっているか、極端に長い段落が残っていないかを確認してください。
整っていなければ、見出しを整理し、長い段落を2つに割るところから始められます。構造だけの調整は、意味内容を変えずに試せる範囲の作業です。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


