「これを読むのは誰で、何を知りたいのか」を先に読み取ってから、コンテンツを書き換える。そんな手順を試した論文があります。
2025年8月に公開された「Role-Augmented Intent-Driven Generative Search Engine Optimization」で、著者は中国科学技術大学の研究者6人です。
ChatGPTやPerplexity.aiのような生成AI検索(この記事では原論文にならい、生成検索エンジン・GSEと呼びます)は、どのコンテンツをどう選んで回答に混ぜているかが、外部からは不透明です。
論文は、このブラックボックスを前提に、検索する人の意図をまず推定し、その推定を4つの視点で読み直してから文章を書き換える手法、RAID G-SEOを提案しています。
この記事では、原文のPDFを通読し、手法のしくみ、比較実験の設定と結果、論文自身が挙げる限界までを整理します。数値はすべて論文の表と本文から拾いました。
論文が計算した相対的な伸び率はそのまま引用し、こちらで検算し直した値には「概算」と添えます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、「検索意図を先に読み取る」という一見当たり前の工程が、実験でどこまで裏づけられているかを確かめておくためです。
結論:3行で言うと
- 検索する人の意図を「だれが・何を求め・なぜずれ・どう組み直すか」の4つの視点で読み直してから文章を書き換える手法(RAID G-SEO)を提案し、従来型のキーワード挿入を含む9つの比較手法より、目立ち方の指標で上回ったと報告しています
- 客観指標(引用された語数と位置)は15.79、主観指標(7つの観点の平均)は13.27で、比較手法の平均よりそれぞれ57.98%、286.91%高いと論文は計算しています
- ただし500件の追加検証では、目立ち方が改善した割合は最も良い手法でも6割に届かず、意図を広げすぎると個々の質問への当てはまりが弱くなるという課題も、論文自身のアブレーション実験に表れています
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Role-Augmented Intent-Driven Generative Search Engine Optimization |
| 著者 | Xiaolu Chen、Haojie Wu、Jie Bao、Zhen Chen、Yong Liao、Hu Huang(6人。全員が中国科学技術大学サイバー科学技術学院に所属。通信著者はZhen Chen) |
| 公開日 | 2025年8月15日(v1)。今回確認した版は2026年3月18日改訂のv2 |
| arXiv番号 | 2508.11158(分野はcs.IR、副分野cs.AI) |
| 掲載/採択状況 | arXivプレプリント。学会や査読誌への掲載は確認できず、arXivのコメント欄にも会議名の記載はありません。論文の脚注には「コードとデータセットは、論文の採択後に公開する」とあり、確認した時点では未採択とみられます |
| 種類 | 大学の学術研究(特定企業による自社報告ではありません) |
| 実験データ/コードの公開先 | 論文の脚注にある「採択後に公開」という記載以外になく、現時点で確認できる公開先はありません |
論文はこちらで読めます。arXiv(2508.11158)。
この論文が答えた問い
論文が立てた問いは、次の1つです。
検索する人が何を打ち込んだかが分からない状態(ブラックボックス)で、生成AI検索の回答に取り上げられやすくするには、コンテンツをどう書き換えればよいか。
生成検索エンジン(GSE)の動き方と、この論文が置いた前提
論文が描くGSEの動き方は、次の順番です。質問を受け取る、関連するコンテンツを5件ほど検索で集める、それをAIに読ませて1つの回答文にまとめる、回答の各文にどのコンテンツを根拠にしたかを添える。
ページの持ち主から見ると、自分のコンテンツが「回答の中でどれだけ取り上げられたか」だけが手がかりで、途中の判断基準は外から見えません。
ここで論文が置いた前提が重要です。コンテンツを作る側には、検索する人がどんな質問を打ち込んだかが見えないという設定です。
従来のSEOはキーワードや被リンクといった外から観察できる手がかりに頼ってきましたが、この前提のもとではその手がかりが使えません。
論文は、GEO(KDD2024の原論文。解説記事はこちら)がこの課題に先鞭をつけたものの、書き換えのパターンが固定的で、多様な検索意図には対応しきれていないと位置づけ、意図そのものを推定して書き換えを導く枠組みを提案しています。
どうやって調べたのか
提案手法:4段階の書き換えパイプライン
RAID G-SEOは、次の4段階でコンテンツを書き換えます。
- 内容の要約:AIに元のコンテンツを簡潔に要約させ、書き手が本来伝えたい核を取り出します
- 検索意図の推定と精緻化:要約から検索意図をまず1つ推定し、続けて「だれが読みたいか」「その人は何を求めているか」「なぜ最初の推定とずれるのか」「どう意図を組み直すべきか」という4つの視点で読み直します。論文はこれを4W多役割の内省と呼び、社会学の問題設定の枠組みを参考にしたとしています
- 手順の計画:精緻化した意図をもとに、書き換えの具体的な手順をAIに立てさせます
- 内容の書き換え:立てた手順に沿って、元の意味や重要な情報を保ったまま文章を書き換えます
この4段階はすべて、人手による確認や追加の学習を挟まない、AIへのプロンプト(指示文)による自動処理です。
比較した9つの手法
比較対象は、先行研究GEOが提案した9つの書き換え手法です。すべて論文と同じGLM-4-9Bというモデルで実装し、条件をそろえています。
- 従来のSEO(質問に出てくる語を増やす、キーワード挿入)
- 珍しい語の追加(独自の語で認識されやすくする)
- 表現の平易化
- 権威的な文体への書き換え
- 流暢さの改善
- 専門用語の追加
- 権威ある情報源への言及の追加
- 引用の追加
- 統計の追加
実験の設定
| 項目 | 設定 |
|---|---|
| 生成AI検索の模擬 | 先行研究GEOと同じ設定。1つの質問につき関連コンテンツを5件だけ使い、1回で応答を作る |
| 使用モデル | オープンソースのGLM-4-9B-0414。書き換え・応答生成・採点の全工程に同じモデル系列を使用 |
| データセット | 先行研究GEOのGEO-Benchを拡張。元の質問1件につき、GPT-4で作った言い換えを4件加え、1サンプルを「原質問+言い換え4件、コンテンツ5件」の組み合わせとした。言い換えと原質問の平均コサイン類似度は0.33 |
| データの品質確認 | 生成した質問の20%を2人の評価者が1〜5点で採点。全サンプルが3点以上で、評価者間の一致度を示すカッパ係数は0.62 |
| 評価に使った件数 | 主要な比較は無作為に選んだ100サンプル、後述の適応力の分析は500件 |
| 評価指標 | 客観指標PAWC(引用された語数と、回答内での位置を加味した指標)と、主観指標(関連性・流暢さ・多様性・独自性・クリックされやすさなど7つの観点をG-EVAL 2.0という採点基準で0〜5点評価) |
| 採点の担当 | 採点基準の文面生成はGPT-4o、実際の採点はGLM-4-9Bが担う。人手ではなくAIによる自動採点 |
結果
主要な結果:9つの比較手法との差
論文の表3(表番号はローマ数字で表記されていますが、この記事ではアラビア数字で示します)から、客観指標の総合値と、主観指標7観点の平均値を拾います。
| 手法 | 客観指標(総合) | 主観指標(平均) |
|---|---|---|
| 従来のSEO | 0.77 | 2.06 |
| 珍しい語の追加 | -10.77 | -6.02 |
| 表現の平易化 | -9.52 | -0.66 |
| 権威的な文体 | 12.86 | 4.82 |
| 流暢さの改善 | 16.84 | 3.95 |
| 専門用語の追加 | 15.51 | 7.13 |
| 権威ある情報源への言及 | 14.90 | 5.04 |
| 引用の追加 | 26.20 | 8.23 |
| 統計の追加 | 23.17 | 6.33 |
| RAID G-SEO(提案手法) | 15.79 | 13.27 |
読み取れることは、次のとおりです。
- 主観指標(平均13.27)ではRAID G-SEOが10手法中もっとも高く、比較手法平均(概算3.43)より286.91%高いと論文は報告しています。7つの観点すべてでRAID G-SEOが最高値でした。伸びが最も小さかったのは独自性の観点(2番目に良い手法比+36.75%)で、最も大きかったのは多様性の観点(+84.63%)です
- 客観指標では、引用の追加(26.20)と統計の追加(23.17)がRAID G-SEO(15.79)を上回りました。論文はこの2手法が、引用や数値という「客観的に数えやすい手がかり」に強く依存しているためと考察しています
- 従来のSEO(キーワード挿入)は、客観・主観のどちらも伸びがわずかでした(0.77、2.06)。論文は、生成AI検索が語の一致よりも意味的なまとまりを重視するためと解釈しています
- 珍しい語の追加と表現の平易化は、書き換え前よりも数値が下がりました。書き換えの方向を誤ると、逆効果になり得ることを示しています
500件で見た「効いた割合」
500件の最適化タスクを対象に、客観・主観のどちらかの指標が改善した回数を数えた分析もあります。RAID G-SEOは平均288件で改善が見られ、改善率は57.6%でした。
これは2番目に良かった専門用語の追加(56.6%)より1.0ポイント高い数字です。主観指標だけで見るとRAID G-SEOの改善件数は298件で最多でしたが、客観指標では中程度にとどまっています。
論文はすべての手法を通じて、改善率が6割を超えたものはなかったと述べており、生成AI検索での目立ち方を安定して改善する難しさを認めています。
どの工程が効いているか(アブレーション)
提案手法の各工程を1つずつ足していく実験の結果です。
| 構成 | 客観指標(総合) | 主観指標(平均) |
|---|---|---|
| 簡易版(手順計画なし) | 7.97 | 6.51 |
| 簡易版(手順計画あり) | 15.81 | 11.29 |
| 意図推定を追加(要約なし) | 16.69 | 11.29 |
| 意図推定を追加(要約あり) | 19.51 | 12.95 |
| RAID G-SEO(4W多役割の内省を追加。完成形) | 15.79 | 13.27 |
主観指標は工程を足すたびに一貫して伸びています。一方、客観指標は最後の「4W多役割の内省」を足した段階で、その手前の版(19.51)より下がっています(15.79)。
論文自身も、客観と主観を合算した総合力では4W内省を使わない版のほうが高くなると認めており、要旨で述べられる大幅な改善は、主観指標側の伸びに支えられている面が大きいと読めます。
論文は、意図を広く一般化するほど個々の質問への精密な一致が犠牲になる、というトレードオフとして説明しています。
役割の傾向と、書き換えの中身
4W多役割の内省が生成した役割は、8,030件・219種類の役割に分類されました。分布を見ると、教育者や政策立案者のような「知識を扱う専門職」と、日曜大工愛好家や家庭料理を作る人のような「日常の生活者」の2群で、全体の3分の2以上を占めています。
医療・介護の関係者は6%、文化・創作の専門職は3%にとどまりました。書き換えの手順そのものについては、8割以上が完全性や分かりやすさといった内容の質を高める方向を向いており、操作としては情報の補強・拡張が全体の3割以上を占めています。
事例:うまくいった例と、うまくいかなかった例
論文は成功例と失敗例を1件ずつ紹介しています。成功例では、百科事典的だった説明を、要点を冒頭に前出しした読み物風の文章に書き換え、見出しと太字で情報を整理しました。
客観指標の総合値は0.09から0.32に、主観指標の平均は27.9から28.2に上がっています。失敗例では、レシピの説明を要約風に再構成しましたが、内容が他の候補コンテンツと大きく重なっていたため、生成AIが複数の情報源をまとめて引用する形になり、個々のコンテンツとしての目立ち方はかえって下がりました。
客観指標は0.75から0.52に、主観指標は26.70から23.90に下がっています。ここは1件ずつの事例紹介であり、統計的な代表例ではない点に注意が必要です。
論文自身が書いている限界
論文が「限界」の章で自ら挙げているのは、次の点です。
- 意図を狭く絞り込みすぎると、特定の質問にだけ合わせた書き換えになり、汎用性が下がります。意図の精密さと汎用性の両立は、残された課題だとしています
- 意図の抽出は主にプロンプト設計に頼っており、粒度の制御や文脈の一貫性には限界があります
- 手法は文章のみを対象にしており、画像や図表、表といった視覚要素は扱っていません。マルチモーダルへの拡張は今後の課題としています
加えて、原文を通読して気づいた点を挙げます。
- 最終的な「目立ち方」のスコアは、人ではなくAI(GLM-4-9B)が採点しています。人手による確認は、生成した質問文の20%を2人の評価者が1〜5点でチェックしたものにとどまり、書き換え後のコンテンツを人が読んで判定した工程は見当たりません
- 論文は「複数回の無作為な試行の平均で偶然のばらつきを抑えたが、追加の統計的有意性検定は行わない」と明記しています。手法どうしの数値差が偶然の範囲かどうかは、この論文単体では判断できません
- アブレーション実験では、提案手法の核である4W多役割の内省を足した完成形が、それを除いた版より客観指標で下回っています。要旨で強調される大幅な改善は、主観指標側の伸びによるところが大きいという点は、本文を読まないと分かりません
- コンテンツの書き換え、GSEの応答生成、採点のすべてに同じGLM-4-9Bという1つのモデル系列を使っています。書き換えた文章を、同じモデル自身が高く評価しやすくなる可能性は、論文では検討されていません
- 先行研究GEOは実サービスのPerplexity.aiでも追試していますが、この論文は実験用のシミュレーション環境のみで検証しており、商用の生成AI検索サービスでの追試は見当たりません
- 質問と質問の言い換えはすべて英語で、GPT-4が生成したものです。日本語での検証は報告されていません
- 要旨(アブストラクト)は手法名を単に「(G-SEO)」と略記していますが、本文以降は一貫して「RAID G-SEO」と表記しています。この記事は本文の表記に合わせました
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 検索意図を推定してから書き換えると、比較した9つの手法より目立ち方の指標(客観・主観)が高かった(実験室設定) | 日本語のコンテンツや、いまの商用生成AI検索で同じ差が出ること |
| 主観指標(7つの観点)ではすべてでRAID G-SEOが最も高かった | 実際のアクセス数や問い合わせが増えること |
| 従来型のキーワード挿入は、この設定では伸びがわずかだった | 数値の差が統計的に有意であること(論文は有意性検定を行っていない) |
| 意図を4つの視点で読み直す工程を足すと、主観指標は一貫して伸びた | 意図を推定する工程を足せば客観指標も一緒に伸びること(アブレーションでは逆に下がった) |
| 500件の追加検証でも、比較した手法の中では改善率がもっとも高かった | 改善率が6割を超えて安定して効くこと |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 「だれが読むのか」「その人は何を求めているのか」「最初に思い浮かべた読者像とずれていないか」「どう書き直せば広い読者に届くか」という4つの問いは、AI向けのライティングチェックリストとしてそのまま使える発想です。ただし論文は書き換えの主体をAIに任せており、人が同じ手順で同じ効果を再現できるかは検証されていません
- 客観指標より主観指標のほうが大きく伸びるという結果は、意図を広く読み取るほど「読みやすさ」や「幅広さ」は上がりやすい一方、「特定の質問に的確に答える」精度は落ちうることを示しています。多くの検索意図に広く当てる記事と、1つの検索意図に深く刺す記事は、両立しない場面があるという読み方ができます
- 効果が確認された割合は、最も良い手法でも6割に届いていません。書き換えれば必ず良くなるという保証はなく、試して確かめる前提で取り組む必要があります
- 生成AI検索そのものの好みを直接ルール化して書き換えに使うアプローチは、別の論文(AutoGEO)で扱っています。意図を推定する今回の手法と、生成AIの好みを直接学習する手法は、補い合う関係にあると読めます
よくある質問
RAID G-SEOの「4W多役割の内省」とは、具体的に何をする工程ですか
要約したコンテンツから検索意図をまず1つ推定したうえで、「だれが読みたいか」「その人は何を求めているか」「なぜ最初の推定とずれるのか」「どう意図を組み直すべきか」の4つの視点でAIに読み直させる工程です。これによって、書き手1人の想定にとどまらない、幅広い読者像を反映した意図に精緻化します。
RAID G-SEOは、Googleの検索順位にも効果がありますか
論文はこの点を評価していません。測っているのは、生成AI検索の回答の中でコンテンツがどれだけ取り上げられ、目立つかという指標だけです。
従来の検索順位への影響は、この論文の対象外です。
目立ち方の評価は、人が行ったのですか
最終的な評価はAI(GLM-4-9B)による自動採点です。人が確認したのは、実験用に生成した質問文の一部(20%)が意味として妥当かどうかだけで、書き換え後のコンテンツの目立ち方そのものを人が採点した工程はありません。
この論文は査読を受けていますか
確認した時点では、arXivに公開されたプレプリントで、学会や査読誌への掲載は確認できません。論文の脚注には「コードとデータセットは採択後に公開する」とあり、まだ採択されていないとみられます。
まとめ:今日できる1つのこと
自社のいちばん読まれているページを1つ選び、「これを読むのは誰か」「その人が本当に知りたいことは何か」を紙やメモに書き出してみてください。
論文の手法の核は、この問い直しをAIに複数の視点から行わせ、書き換えの方針を決める点にあります。人手で行う場合も、まずはこの2つの問いを立てるところから始められます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


