AIが検索の答えを1つの文章にまとめて返す時代になり、GEO(Generative Engine Optimization、生成エンジン最適化)という考え方が広がっています。
ページの文章に引用や統計を足すと、AIの回答での扱いが変わる、という研究はすでにあります。今回取り上げる論文は、その「足す作業」そのものを、人が毎回プロンプトで指示するのではなく、小さな言語モデルに学習させて自動化できるかを試したものです。
ロンドン・スクール・オブ・エコノミクス(LSE)の学生グループが2025年7月にarXivへ投稿した、旅行・観光サイトの文章を対象にした実験報告です。
この記事は、原文のPDFを通読して書きました。数値はすべて論文の本文・表から拾い、論文の言葉で書かれている主張と、私たちの読み取りとを分けて示します。
特に、この論文がまだ査読を経ていないプレプリントであること、そして評価に使った件数がとても小さいことは、著者自身が明記している点です。
この2つは結果の受け取り方を左右するので、早めにお伝えします。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、「GEOの書き換え作業を、外部のAIサービスに頼らず自社のモデルで肩代わりできるか」という、運用コストに直結する問いへの、最初の小さな答えを確かめるためです。
結論:3行で言うと
- 信頼できる引用・統計・出典を足すというGEOの書き換え作業を、小さな言語モデル(BART-base)を微調整するだけで自動化できることを、旅行・観光サイトのデータで示しました
- 微調整したモデルは、文章の質を測る指標(ROUGE-L、BLEU)で元のモデルを上回り、生成AIの回答の中での目立ち方も、絶対語数で15.63%、位置を考えた語数で30.96%伸びました(いずれも書き換え前との比較、著者独自の概算)
- この結果は旅行・観光の1分野だけ、評価件数はわずか50問で得られたものです。著者自身が「統計的な有意性を示すには小さすぎる」と書いています
「小さすぎる」という言葉は誇張ではなく、論文の第7.2節にそのまま書かれている一文です。この記事では、その前後の文脈も含めて紹介します。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Beyond SEO: A Transformer-Based Approach for Reinventing Web Content Optimisation |
| 著者 | Florian Lüttgenau(LSEマネジメント学部)、Imar Colic、Gervasio Ramirez(LSE統計学部)の3名 |
| 公開日 | 2025年7月3日(初版v1) |
| arXiv番号 | 2507.03169 |
| 掲載・採択状況 | プレプリント。arXivのコメント欄は「9 pages, 3 figures」のみで、学会名や論文誌名の記載はありません |
| 種類 | 大学の研究報告。本文末尾の「個別貢献の記載」には「4名のグループで作業した」とありますが、著者として名前が挙がっているのは3名だけで、人数が一致していません |
| 実験データ・コードの公開先 | 本文中に、学習データのファイル名(X_final_filtered_labelled_dataset.csv)やノートブックの社内的なファイルパスへの言及はありますが、公開URLの記載は見当たりません |
論文はarXiv(2507.03169)で読めます。GEOという考え方の出どころは、この論文が繰り返し参照しているGEO原論文の解説記事で紹介しています。
この論文が答えた問い
GEOの書き換え作業(引用の追加、統計の追加、文章を滑らかにする、といった作業)を、人がその都度プロンプトで指示する代わりに、特定の業界のデータだけで微調整した小さな言語モデルに自動でやらせることはできるか。
GEOという考え方を最初に示した論文(Aggarwal et al., 2024、KDD発表)は、大規模言語モデルに「この方針で書き換えて」と指示する方式でした。
指示を出す側にはコストがかかりますし、業界によって効く方法が違うことも、その論文自身が課題として挙げています。今回の論文は、旅行・観光という1つの業界に絞って学習データを作り、BARTという比較的小さなモデルを微調整することで、書き換え作業そのものをモデルに覚えさせようとしました。
どうやって調べたのか
学習に使うデータが世の中に存在しないため、著者らは次の手順ですべて自作しています。
- 旅行・観光の11分野にわたる質問文を、Meta-Llama-3-8B-Instructという言語モデルに生成させる
- それぞれの質問についてGoogle検索の上位5件のページ本文を取得する。スクレイピングを拒否するサイトや、本文が100文字未満のサイトは除外する
- 取得した生の文章を、HTMLタグの除去やナビゲーション・広告部分の削除など前処理し、最大4000文字に切り詰める
- 前処理した生の文章を、Llama-3.3-70Bという別の言語モデルに、(1)信頼できそうな引用を加える、(2)言い回しを滑らかにする、(3)統計を効果的な位置に配置する、という3段階の指示で書き換えさせ、これを「正解」として扱う
この手順で、最終的に1905組の「生の文章・書き換え後の文章」のペアができました。ここで注意したいのは、「正解」として使った書き換え後の文章自体が、別の言語モデル(Llama-3.3-70B)の出力であり、人が書いたり事実確認したりしたものではないことです。
データは、生の文章の長さで10段階に分けたうえで、学習用80%・検証用20%に分割し、さらに学習に使っていない50件の質問(1問あたり5サイトで計250件)をテスト用として別に確保しています。
モデルにはBARTという構造を使っています。BARTは、文章を読み取る部分(BERT由来)と、文章を生成する部分(GPT由来)を組み合わせたモデルで、文章の要約や言い換えに向いた設計です。
著者らは、BARTを一から学習させる方法も試しましたが、学習データが1905件しかなく、市販のノートパソコン(16GBメモリのApple M1 Pro)では3エポックの学習に1.5時間かかり、計算資源の制約でうまくいかなかったため、あらかじめ大量の文章で事前学習済みのBART-baseモデルを微調整する方法に切り替えたと説明しています。
| 設定 | 提案モデル(微調整後) | 比較対象(BART-base、微調整前) |
|---|---|---|
| エンコーダーの入力上限 | 384トークン | 256トークン |
| デコーダーの出力上限 | 384トークン | 448トークン |
| 層の数(エンコーダー・デコーダーとも) | 各6層 | 各6層 |
| 埋め込みの次元・注意ヘッド数 | 768次元・12ヘッド | 768次元・12ヘッド |
この表で気づくのは、比較対象のほうが出力の上限が長い(448トークン)ことです。論文は「入力の窓を広げた効果を見る実験」と位置づけていますが、出力側の上限も同時に変わっているため、差が入力窓だけによるものとは言い切れません。
結果
まず、生成した文章の質を測る指標です。ROUGE-Lは生成文と正解文で共通する語のつながりの長さを、BLEUは1〜4語のまとまりがどれだけ一致するかを表す指標で、どちらも値が高いほど正解に近いと解釈されます。
PPL(パープレキシティ)は文章の予測しやすさを表し、値が低いほど流暢とされます。
| モデル | ROUGE-L | BLEU | PPL | 長さの比率 |
|---|---|---|---|---|
| 比較対象(BART-base) | 0.226 | 0.173 | 1.71 | 1.01 |
| 提案モデル(微調整後) | 0.249 | 0.200 | 1.50 | 1.00 |
テスト用の250件で見た最良のチェックポイント(7エポック目)の数字です。論文本文は、この差を「ROUGE-Lが2.3ポイント、BLEUが2.7ポイント上がり、PPLは12%下がった」と自ら計算して述べています(いずれも比較対象の数字との差)。
長さの比率はどちらも1に近く、出力の文字数を正解に近づける工夫(長さのペナルティや同じ3語の繰り返しを禁じる設定)が機能したことがうかがえます。
次に、生成AIの回答での目立ち方です。テスト用の250件から50問を選び、各問いにつき「生の文章5件」を使う場合と、そのうち1件を「提案モデルが書き換えた文章」に差し替える場合とで、Llama-3.3-70Bに回答を作らせ、番号付きで出典を引用させています。
差し替えた1件が、回答の中でどれだけの語数を占めたかを比べました。
| 指標 | 何を数えるか | 変化(書き換え前との比較、概算) |
|---|---|---|
| 絶対語数 | そのページを根拠にした文の語数の合計 | +15.63% |
| 位置調整語数 | 同じ語数を、回答の前のほうに出てくるほど重く数えた値 | +30.96% |
読み取れることは、次の3点です。
- 文章の質を測る指標と、生成AIの回答での目立ち方の指標が、同じ方向にそろって改善しました。書き換えの質が上がることと、回答での扱いが増えることが、この実験ではつながっていました
- 位置調整語数(30.96%)のほうが絶対語数(15.63%)より伸びが大きく、書き換えた文章が回答の早い位置で引用されやすくなった可能性を示しています
- ただし、この評価は50問だけで行われました。著者自身が、統計的な有意性を確かめるには足りない件数だと書いています
論文自身が書いている限界
著者らが本文で挙げている限界は、次のとおりです。
- 評価に使った質問は50問で、統計的な有意性を示すには小さすぎる
- Llama-3.3-70Bに渡せる文章量には上限があり、極端な値が出ることがあった
- 合成した学習データにノイズがあり、質問と元ページの内容がかみ合っていない事例が、モデルの性能や評価結果に影響した
- 計算資源の制約で、学習に使えるモデルの規模やエポック数が限られた
- この分野向けのラベル付きデータが世の中に存在せず、すべて自作する必要があった
ここからは、原文を読んで気づいた点です。
- この論文はプレプリントで、査読を経た形跡が見当たりません。会議録番号や採録の記載もありません
- 「正解」として学習に使った書き換え文自体が、Llama-3.3-70Bという言語モデルの出力です。人による事実確認や品質確認を経たという記載はなく、足された引用・統計が実在するかどうかは評価の対象になっていません
- 実験に使った質問と学習データは、すべて英語圏のもの(Meta-Llama-3-8B-Instructが生成した英語の質問、英語の旅行サイト)です。日本語での検証は行われていません
- 「目立ち方」の評価は、実際に稼働しているChatGPTやPerplexityではなく、著者らが独自に組んだ実験環境(Llama-3.3-70Bに5つの情報源を渡して回答させる仕組み)で行われています
- 比較対象(BART-base)のほうが出力の上限トークン数が長いという、前の章で触れた設定の違いも、結果に影響した可能性を否定できません
この論文から、言えること・言えないこと
| 言えること(論文の実験で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 旅行・観光ドメインのデータで、BARTを微調整すると、文章の質を測る指標が比較対象より上がった | 他の業種でも同じ幅の改善が得られること |
| その書き換えたページは、実験環境の中でLlama-3.3-70Bの回答に、より多くの語数で登場した | 実際に稼働しているChatGPTやPerplexityでも同じ結果になること |
| 本番の微調整は、1つの市販GPUで完了した(機種の記載はなし) | 50問という件数で、この結果が偶然ではないと言えること(著者自身が認めている) |
| 文章の質の指標(ROUGE-L・BLEU)と、目立ち方の指標が、同じ方向に動いた | 足された統計や引用が事実として正しいこと |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- この論文が示したのは、「GEOの書き換えを、外部のAIサービスへの都度の指示ではなく、自社データで学習させた小さなモデルに任せられる可能性がある」という方向性です。ただし1905件・1業種というデータ規模での話で、そのまま自社に当てはめられる結果ではありません
- 学習の「正解」自体がAIの出力である以上、この方式を自社で使う場合、生成された統計や引用を人が確認する工程は省けません。むしろ、この論文が確認していない部分こそ、実務では確認が要る部分です
- 評価の物差しが「生成AIの回答内での語数シェア」である点は、押さえておく必要があります。問い合わせや売上が増えるかどうかは、この論文の対象外です
- 本番の微調整は「1つの市販GPU」とだけ書かれており、具体的な機種は不明です。なお、別途試して断念した「BARTを一から学習させる」方式では、市販ノートパソコン(M1 Pro・16GBメモリ)で3エポックの学習に1.5時間かかったと記載されています。大がかりな環境を用意しなくても試せる可能性を示す記述ですが、両者は別の実験だと区別して読む必要があります
よくある質問
BARTの微調整によるGEO自動化は、GEO原論文(Aggarwal et al., 2024)のプロンプト方式と何が違いますか
GEO原論文は、大規模言語モデルに毎回プロンプトで指示を出し、文章を書き換える方式でした。今回の論文は、あらかじめ特定の業界のデータで小さなモデル(BART-base)を微調整し、指示なしで自動的に書き換えを生成できるようにした点が異なります。ただし、その「正解」データ自体は、GEO原論文と同じ発想の書き換え作業を、別の言語モデル(Llama-3.3-70B)にやらせて作ったものです
旅行・観光ドメイン以外の業種にも、同じ効果が期待できますか
論文はこの点を確認していません。学習データもテストデータも旅行・観光の1業種に限られており、著者自身も「他の業種での評価」を今後の課題として挙げています
絶対語数15.63%・位置調整語数30.96%という数字は、そのままアクセス増加や問い合わせ増加を意味しますか
意味しません。この数字は、実験用に組んだ環境の中で、Llama-3.3-70Bが作った回答の中の語数シェアを比べたものです。
評価に使った質問はわずか50問で、著者自身が統計的な有意性を示すには小さすぎると書いています。検索順位やアクセス数、問い合わせ件数への影響は、この論文では調べられていません
まとめ:今日できる1つのこと
自社のページを1つ選び、生成AIに質問を投げて、そのページの内容がどこまで拾われて答えに反映されるかを確かめてください。
この論文が測ったのと同じ「目立ち方」という物差しを、自分の目で試すことができます。書き換えを自動化する技術は研究段階にありますが、まず自社の現状を知ることは、今すぐ始められます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


