「文章に統計や出典を足すと、AIの回答に取り上げられやすくなる」。LLMO対策の話で、ほぼ必ず出てくる説明です。この説明の根拠としてよく引用される論文があります。2023年11月に公開され、2024年8月のKDD(データマイニング分野の主要な国際会議)で発表された「GEO: Generative Engine Optimization」です。
この記事は、その論文を原文から読み、何を測って、何が分かり、何が分かっていないのかを整理します。数値はすべて論文の表から拾い、相対的な伸びは私が計算し直しました。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。論文を読むのは、その手前にある「何が実験で確かめられていて、何がまだ確かめられていないのか」を自分たちで確かめておくためです。
結論:3行で言うと
- AIが検索結果をまとめて答える環境で、ページの文章を書き換えると回答の中での目立ち方が変わるかを、評価用の質問集1万問を作って測った論文です。この分野の枠組みを初めてまとめて示したと、論文自身が述べています
- 効いたのは、信頼できる情報源の発言を引用する、数字で書ける所を数字にする、出典を示すの3つと、文章を滑らかにすることでした
- 従来のSEOで使われてきたキーワードの詰め込みは、効果が出ませんでした(語数と位置の指標では、書き換え前より下がっています。主観的な目立ち方の指標では、わずかに上がっています)
ただし、この結果は実験室の設定で得られたものです。日本語のページや、いま使われているChatGPTにそのまま当てはまるとは、論文自身が言っていません。この点は後の章で整理します。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | GEO: Generative Engine Optimization |
| 著者 | Aggarwal、Murahari、Rajpurohit、Kalyan、Narasimhan、Deshpande(6人。所属はプリンストン大学、インド工科大学デリー校ほか) |
| 発表 | KDD 2024(2024年8月25〜29日、スペイン・バルセロナ)。ACM SIGKDD の会議録 |
| arXiv | 2311.09735(初版は2023年11月16日、確認した版は2024年6月28日のv3) |
| 実験データとコード | generative-engines.com/GEO/ で公開されていると論文に書かれています |
論文はこちらで読めます。arXiv(2311.09735)、会議録(DOI)。
この論文が答えた問い
論文が立てた問いは、1つです。
AIが検索結果をまとめて答えるとき、あるページの文章を書き換えると、そのページが回答の中でどれだけ目立つかは変わるのか。変わるなら、何をどう書き換えると効くのか。
「生成エンジン」とは何か
論文は、ChatGPTやPerplexityのような仕組みを「生成エンジン」と呼んでいます。動き方は次の順番です。
- 質問を受け取る
- 検索エンジンで関連するページを集める
- 集めたページをAIが読んで、1つの回答文にまとめる
- 回答の文ごとに、どのページを根拠にしたかを添える
従来の検索では、ページは順位のついた一覧に並びました。生成エンジンでは、複数のページが1つの回答に混ぜ合わされます。ページの持ち主から見ると、自分のページが「何番目に出たか」ではなく「回答のどれだけを占めたか」が問題になります。論文が「目立ち方」を測り直した理由は、ここにあります。
どうやって測ったのか
目立ち方の測り方は2種類
| 指標 | 何を数えるか |
|---|---|
| 語数と位置 | 回答の中で、そのページを根拠にした文が何語分あるか。回答の前のほうにあるほど大きく数える |
| 主観的な目立ち方 | AI(GPT-3.5)が7つの観点で採点する。質問との関連、回答への影響、独自性、位置、量、クリックされそうか、内容の多様さ |
前者は機械的に数えられる指標で、後者は採点をAIに任せた指標です。この記事で主に使う数字は、前者の「語数と位置」です。
論文は各回答の出典の合計が1になるよう数値を揃えています。表の数字は、その割合を百分率のように表したものと読めます。出典が5件あって均等に分け合えば20前後になります。
実験の舞台
| 項目 | 設定 |
|---|---|
| 質問集(GEO-bench) | 1万問。学習用8千、検証用1千、テスト用1千。25分野。情報探しが8割、取引と案内が1割ずつ |
| 質問に付けた材料 | Google検索の上位5件の本文 |
| 回答を作るモデル | gpt-3.5-turbo。5回作って平均を取る |
| 書き換える対象 | 上位5件のうち、ランダムに選んだ1件。方法ごとに同じページを書き換えて比べる |
| 書き換えの実行者 | AI(大規模言語モデル)に「この方針で書き換えて」と指示する |
ここで押さえておきたい点が2つあります。1つ目は、AIに渡すページは最初から上位5件に決まっていることです。検索で拾われるかどうかは、この実験では問われていません。2つ目は、書き換えた文章の正確さは評価項目に入っていないことです。評価しているのは、目立ち方だけです。
試した9つの書き換え方
| 方法 | やること | 中身の追加 |
|---|---|---|
| 引用を足す | 信頼できる情報源の発言を引用として加える | 要る |
| 統計を足す | 文章で書いていた所を、数字で書き直す | 要らない(書き直し) |
| 出典を示す | 信頼できる出典への言及を加える | 要る |
| 流暢さの改善 | 文章を滑らかにする | 要らない |
| 専門用語を足す | 専門用語を入れる | 要らない |
| やさしい言葉にする | 言葉を平易にする | 要らない |
| 権威的な文体にする | 説得力のある、断定的な文体にする | 要らない |
| 珍しい語を足す | 独自の語を入れる | 要らない |
| キーワードを詰め込む | 質問に出てくる語を増やす(従来のSEOの手法) | 要らない |
結果:何が効いて、何が効かなかったか
論文の表1から、「語数と位置」の総合値を拾います。書き換えなしの値は19.3です。右の列は、この19.3と比べた伸びを、私が計算した概算です(表が小数第1位までなので、誤差があります)。
| 方法 | 総合値 | 書き換えなしとの差(概算) |
|---|---|---|
| 書き換えなし | 19.3 | 基準 |
| 引用を足す | 27.2 | +41% |
| 統計を足す | 25.2 | +31% |
| 流暢さの改善 | 24.7 | +28% |
| 出典を示す | 24.6 | +27% |
| 専門用語を足す | 22.7 | +18% |
| やさしい言葉にする | 22.0 | +14% |
| 権威的な文体にする | 21.3 | +10% |
| 珍しい語を足す | 20.5 | +6% |
| キーワードを詰め込む | 17.7 | -8% |
論文の見出しにある「最大40%」は、この表の最上段、引用を足した場合の数字です。3つのうち引用と統計と出典は、論文本文が「わずかな変更で大きく効く」と述べています。
読み取れること
- 中身の裏づけを足す方法が上位を占めました。引用、統計、出典は、文章の見せ方ではなく「この主張にはこういう根拠がある」を足す方法です
- 文章を滑らかにするだけでも、約28%伸びました。論文は、生成エンジンが内容だけでなく見せ方も見ている可能性を指摘しています
- キーワードの詰め込みは、書き換えなしより低くなりました。従来のSEOで定番だった手法が、この設定では通用しませんでした
- 権威的な文体は、全体では伸びが小さいものでした。討論や歴史の質問では効いています(後述)
検索順位が低いページほど、伸びた
論文は、5件すべてのページが同時に書き換えられた場合も調べました。全員が同じ手法を使う世界です。表2から、3つの方法の結果を拾います。数字は、検索順位ごとの目立ち方の変化(%)です。
| 方法 | 1位のページ | 2位 | 3位 | 4位 | 5位のページ |
|---|---|---|---|---|---|
| 出典を示す | -30.3 | +2.5 | +20.4 | +15.5 | +115.1 |
| 引用を足す | -22.9 | -7.0 | +3.5 | +25.1 | +99.7 |
| 統計を足す | -20.6 | -3.9 | +8.1 | +10.0 | +97.9 |
1位のページは下がり、5位のページは約2倍になっています。論文は、従来の検索では被リンクなどの要素が順位を決め、小さな事業者には不利だった。一方、生成エンジンはページの本文を読んで答えを作るので、被リンクの数で差がつきにくい、と解釈しています。
これは魅力的な結果ですが、条件を確かめておく必要があります。全員が最適化した場合の話であって、5位のページが自分だけ書き換えた場合の数字ではありません。
質問の分野によって、効く方法が違う
論文は、質問を分野や種類で分類して、方法ごとに最も効いた分類を調べました(表3)。
| 方法 | 特に効いた質問の種類(上位3つ) |
|---|---|
| 権威的な文体にする | 討論、歴史、科学 |
| 流暢さの改善 | ビジネス、科学、健康 |
| 出典を示す | 陳述、事実、法律・行政 |
| 引用を足す | 人物・社会、説明、歴史 |
| 統計を足す | 法律・行政、討論、意見を問う質問 |
論文は、事実を確かめたい質問には出典が、意見を問う質問には統計が効いたと読んでいます。歴史や人物の話では、直接の引用が内容に厚みを出すからだと推測しています。万能の方法はなく、質問の種類に合わせて選ぶ必要がある、というのが論文の結論です。
組み合わせると、さらに伸びた
上位4つの方法(引用、流暢さ、統計、出典)を2つずつ組み合わせた実験もあります。最も良かったのは「流暢さの改善」と「統計を足す」の組み合わせで、単独で最高だった方法を5.5%以上上回りました。
ただし、この実験は費用の都合でテストの一部(200問)だけを使っています。表1とは数字が違うのはそのためです。
実際のサービスでも試した
論文は、実験用に作った環境だけでなく、実際に使われているPerplexityでも試しています。ただし、ページの本文をファイルとして渡す形で、テストの200問だけを使った検証です。
| 方法 | 語数と位置 | 主観的な目立ち方 |
|---|---|---|
| 書き換えなし | 24.1 | 24.7 |
| キーワードを詰め込む | 21.9 | 28.1 |
| 引用を足す | 29.1 | 32.1 |
| 統計を足す | 26.2 | 33.9 |
語数と位置では、引用を足した場合が最も高く、キーワードの詰め込みは書き換えなしを下回りました。論文は、主観的な目立ち方で最大37%の伸びが見られたと述べています。実験用の環境で得た傾向が、実際のサービスでも大筋で見られたことになります。ただしPerplexityは1つのサービスで、通常の検索経路ではなくファイルを渡す形での検証であり、論文執筆時点の動作です。
論文自身が書いている限界
論文は最後に、限界を自分で挙げています。
- 試した生成エンジンは2つ(実験用の環境とPerplexity)だけです
- 生成エンジンは変化するので、方法も見直していく必要があります
- 質問の性質も時間とともに変わります
- 検索順位への影響は評価していません。ただし本文だけの変更なので、順位への影響は小さいだろうと論文は見ています
- 質問の分類には、主観による誤りが入り得ます
加えて、この記事を書くために原文を読んで気づいた点があります。
- 質問集の元になったデータセット(MS MARCO、Natural Questions、ELI5など)は英語圏のものです。日本語での検証は報告されていません
- 回答を作るAIはgpt-3.5-turboです。現在のChatGPTやGeminiと同じ挙動とは限りません
- AIに渡すのは、最初から上位5件に決まったページです。そのページが検索で拾われるかどうかは、この実験の対象外です
- 統計や引用の書き換えはAIが行っています。足された数字や出典が実在するかどうかは、評価の対象に入っていません
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 引用・統計・出典を足した文章は、回答の中で目立ちやすかった | 日本語のページでも同じ大きさで効くこと |
| キーワードの詰め込みは、語数と位置の指標を下げた | いまのChatGPTやGeminiで同じ結果になること |
| 検索順位が低いページのほうが、伸びる余地が大きかった(全員が最適化した場合) | 自分のページだけ書き換えて「40%増える」こと |
| 質問の種類によって、効く方法が違った | 検索順位、アクセス数、問い合わせが増えること |
| 同じ傾向が、実サービスのPerplexityでも見られた | 足した数字や引用の正しさが評価されること |
「40%」は、19.3という指標値が27.2になった相対的な伸びです。回答に載る確率が4割上がる、あるいはアクセスが4割増えるという意味ではありません。
足す前に確認しておきたいこと
この論文を読んで最も気をつけたいのは、「統計を足す」「引用を足す」が実験ではAIによる書き換え作業だったことです。実験の評価は目立ち方だけで、足された数字が本当にあるものかどうかは見ていません。
自社のページに足す場合は、次の順番で確かめてください。
- 足したい数字や発言の、元の資料を開く
- 数字が「何と何を比べたものか」を確かめる。前年比なのか、他社比なのかで意味が変わります
- 出典として書く名前と年が、元の資料と一致しているか確かめる
- 元の資料が見つからない数字は、足さない
やりすぎたページは、機械で見分けられる段階に入っています。関連する研究は、AI検索向けに整えたページは94%の精度で見分けられるという別の論文の記事でまとめています。
よくある質問
GEOとLLMOは同じ意味ですか
この論文が作った言葉はGEO(Generative Engine Optimization)です。日本ではLLMOと呼ばれることが多く、ほぼ同じ意味で使われています。論文はGEOと書いているので、この記事でも原文の用語を使っています。
キーワードを増やすのは逆効果ですか
この論文の設定では、語数と位置の指標が書き換えなしより低くなりました。実サービスのPerplexityでも、語数と位置の指標では同じ結果でした。ただし、従来の検索エンジンで効くかどうかは、この論文の対象外です。
統計は、何でもよいので足せばよいですか
足せません。実験では効果がありましたが、それは書き換えられた数字の真偽を問わない実験だったからです。元の資料で確かめられる数字だけを足してください。
中小企業に不利な話ではないですか
論文の結果は、逆の方向でした。全員が最適化した場合、検索順位が低いページのほうが伸びています。ただし、これは実験室での結果です。
まとめ:今日できる1つのこと
自社のいちばん読まれているページを1つ開き、主張の文に「根拠」が付いているかを確かめてください。根拠が付いていない主張があれば、元の資料を探して、実在する数字か出典を1つだけ足します。見つからなければ、その主張は断定をやわらげます。
この論文は、LLMO(GEO)の代表的な研究として引用されることの多い論文です。次に読む論文は、この結果を前提に、さらに何が分かったのかを追います。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

