ページを1つ書き換えて終わり、という進め方には限界があります。同じ「AIに引用されやすくする」作業でも、効く直し方は記事ごとに違うからです。
この違いに、人が9通りの直し方を毎回全部試すのではなく、エージェント(自律的に判断して動くプログラム)に選ばせようとした論文があります。
米アドビの研究チームとカリフォルニア大学サンディエゴ校が2026年8月に公開した「Agent2UCB」です。
この記事は、その論文を原文から読み、何を作ったのか、どう測ったのか、何が分かって何が分かっていないのかを整理します。数値はすべて論文の本文と図表から拾い、論文自身が明記していない計算は「概算」と書き分けます。
この論文はシステムの実演を目的とした短い論文(デモ論文)で、限界の指摘は独立した章ではなく、結果を説明する本文の中にまとまっています。
その点も含めて後の章で説明します。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、「9つの直し方のどれが効くか」を人手で試す作業を、機械にどこまで任せられるのかを見ておくためです。
結論:3行で言うと
- 記事を1本ずつ、9種類の改善策のうちどれが効くかを自動で見つけて適用するシステムを、著者たちは実際に動くデモとして作りました
- 全部を試す代わりに、「バンディット」という統計の手法とAIの下読みを組み合わせて、約15回のやり取りで効く改善策にたどり着き、総当たりに比べて呼び出し回数を10分の1程度に減らしています
- 目立ち方を上げる一方で、読みやすさはわずかに下がりました。この論文はその下がり方も含めて画面に表示する仕組みまで作っています
ただし、この論文で確かめられたのは、実験用に組んだ評価の仕組みの中での結果です。実際のGoogleのAI Overviews(検索結果の上にAIが要約を出す機能)やPerplexityでの効果は、この論文の検証範囲の外にあります。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | Agent2UCB: Agentic System for Generative Engine Optimization |
| 著者 | Sheldon Yu、Rui Wang、Tong Yu、Sungchul Kim、Doga Dogan、Junda Wu、Julian McAuley(7人。Sheldon YuとJulian McAuleyはカリフォルニア大学サンディエゴ校、残る5人は米国の大手ソフトウェア企業の研究部門。以下、著者の所属企業) |
| 公開日 | 2026年8月29日(arXiv初版) |
| arXiv番号 | 2608.29063 |
| 掲載・採択状況 | 学会名や採択の記載が本文になく、冒頭で著者自身が「デモ論文」と呼んでいる、システムの実演を主目的とした短い論文という位置づけです。 |
| 種類 | 企業(著者の所属企業)と大学の共同研究。査読つき論文誌への掲載の有無は、今回確認した版の本文には記載がなく、未確認です。 |
| 実験データ・コードの公開先 | コードやデータの公開先は、本文の記載からは未確認です。 |
論文はこちらで読めます。arXiv(2608.29063)。
この論文が答えた問い
AIが検索結果をまとめて答えるとき、記事ごとに一番効く直し方は違う。それなら、全部を試さずに、効く直し方を自動で見つける仕組みを作れないか。
この問いの背景には、先行研究への指摘があります。2024年のKDDで発表されたGEO(生成エンジン最適化)の原論文は、質問の分野ごとに「平均的に一番効く直し方」を1つ選ぶやり方でした。
この論文は、そのやり方には2つの弱点があると述べています。1つは、分野の平均に合わせるため、記事ごとの違いを無視してしまうこと。
もう1つは、逆に全部の手を毎回試すやり方(総当たり)だと、AIへの問い合わせ回数がかさみ、費用と時間がかかりすぎることです。
どうやって作ったのか
4つの部品でできている
Agent2UCBは、質問と比較したいページのURLを受け取り、最適化したページとGEO(生成エンジンでの目立ちやすさ)・SEO両方の分析結果を返します。仕組みは4つの部品に分かれています。
| 部品 | やること |
|---|---|
| 入力とGEOの採点 | 質問と複数のURLを受け取り、各ページの本文を抜き出す。AIに「このページ群を見て質問に答えて」と指示し、どのページがどれだけ根拠として使われたかを測る |
| EEAT-R診断 | 選んだ1ページについて、経験・専門性・権威性・信頼性・読みやすさの5項目を採点し、弱い項目に対する直し方の提案文を作る |
| 改善策の道具箱と実行エージェント | 9種類の改善策(下記)をAIへの指示文として持ち、選ばれた1つを適用して新しい原稿を作る |
| Agent2UCBのバンディット制御 | どの改善策を次に試すかを、統計的な手法で決める。詳しくは次の章で説明する |
EEAT-R(Experience/Expertise/Authoritativeness/Trustworthiness/Readabilityの頭文字に、読みやすさを表すRを加えた論文の造語)は、Googleが2022年に示したE-E-A-Tの考え方を土台にしています。
論文の図には、経験18点、専門性16点、権威性17点、信頼性8点、読みやすさ18点(いずれも20点満点)という表示例が載っており、信頼性が弱い項目として「改善を提案」というボタンが添えられています。
この数字は、実験全体の平均値ではなく、システムの動作例として示されたものです。
試した9つの改善策
論文は「9種類の改善策を評価する」と述べたうえで、次の5つを例として挙げています。権威性を高める書き換え、根拠となる情報の追加、引用と出典の明示、読みやすさの調整、SEOを意識した文章構成です。
残り4つの名前は本文中に明記されていませんが、選ばれた回数の分布を示す図の項目名からは、2024年のGEO原論文が定義した9つの手法(出典を示す、引用を足す、統計を足す、流暢さの改善、専門用語を足す、やさしい言葉にする、権威的な文体にする、珍しい語を足す、キーワードを詰め込む)と重なる並びに見えます。
ただしこの図の文字は抽出時につぶれているため、一致は参考程度の対応にとどまります。
バンディット制御の仕組み
「バンディット」は、複数の選択肢(ここでは9つの改善策)から、試行を重ねながら一番良い選択肢を見つけていく統計の手法です。
各改善策を、当たり外れの分からないスロットマシンの1本の「アーム」に見立てます。論文が使う手法は、UCB(信頼区間の上限を使う方式)という考え方を2つ組み合わせた「デュアルUCB」です。
- 1つ目のUCBは、これまでの結果だけを見て、まだ試行回数の少ないアームを優先的に選びます
- 2つ目のUCBは、AIに「どの改善策が効きそうか」を先読みで聞いた予測を、あらかじめ試した実績のように加えて計算します
- この2つの小さいほうの値を比べて、次に試す改善策を決めます
AIの先読みが外れていた場合でも、実際の結果(オンラインの手応え)が優先されるように、小さいほうの値を採用する形にしていると論文は説明しています。この制御を使うと、10〜15回ほどのやり取りで、安定して効果の高い改善策に落ち着くと論文は述べています。
結果
目立ち方は、バンディットを使うと最も高かった
論文は3つの問いを立てています。バンディット制御は基準より目立ち方を上げるか(問い1)、そこに何回のやり取りが必要か(問い2)、その伸びはSEOの質を犠牲にしていないか(問い3)です。
図2から、平均のGEOスコア(目立ち方の指標)を拾います。
| 手法 | 平均GEOスコア | カテゴリ基準との差(図中の表示) |
|---|---|---|
| カテゴリ最良(KDD原論文の基準) | 23.0 | 基準 |
| 素朴な指示(改善策を選ばず一様に指示するだけ) | 22.4 | -2.8% |
| エージェント型(Agentic System。本文に定義の説明はなく、名称から推測するとバンディット制御を使わない構成とみられる) | 32.3 | +40.6% |
| Agent2UCB | 35.1 | +52.8% |
図中の百分率は論文の図にそのまま印字されている数字です。どの手法を基準にした割合かは図の説明文に明記されていませんが、数値を計算し直すと、カテゴリ最良(23.0)を基準にした場合に近い値になります。
やり取りの回数は、約15回に収まった
論文は「デュアルUCBの制御は約15回のやり取りで収束し、総当たりに比べて呼び出し回数はおよそ10分の1で済み、同等かそれ以上のスコアに達する」と述べています。総当たりでは9つの改善策すべてを毎回試すのに対し、Agent2UCBは試行の途中で有望な改善策に絞り込むため、この差が生まれます。
もう1つ、図の下部には、どの改善策が実際に選ばれたかの分布を示すグラフがあります。論文は「特定の1つの改善策が全体を支配することはなく、記事ごとに最も効く改善策は違う」と述べています。
これは、カテゴリ単位で1つの直し方を決める従来のやり方に対する、この論文の出発点となった観察です。
SEOの質は、読みやすさが少し下がった
論文の表1から、SEOに関わる指標を拾います。
| 指標 | 原文 | カテゴリ基準 | Agent2UCB |
|---|---|---|---|
| 総合SEOスコア | 65.55 | 70.01 | 70.94 |
| 読みやすさ | 0.810 | 0.762 | 0.718 |
| トピック網羅度 | 0.551 | 0.800 | 0.653 |
| EEATの信頼性 | 0.426 | 0.396 | 0.773 |
| 平均語数 | 762.0 | 192.1 | 813.0 |
| 平均文数 | 42.3 | 11.7 | 57.9 |
読み取れることを整理します。
- 総合SEOスコアは、3つの中でAgent2UCBが最も高い数字でした。65.55から70.94への伸びです
- EEATの信頼性は、原文より約80%、カテゴリ基準より約95%高くなりました。これは論文自身が本文で述べている概算です(0.426→0.773、0.396→0.773の伸び)
- カテゴリ基準は、文章を平均192語まで大きく削っており、Agent2UCBは原文に近い分量(平均813語)を保ったまま信頼性を上げています
- 一方で読みやすさは、原文より下がり、カテゴリ基準よりも下がりました。トピック網羅度も、原文よりは上がったものの、カテゴリ基準の水準は下回ったままです
この読みやすさの下がり方について、論文は「小幅な低下」と表現しています。目立ち方を優先すると、読みやすさが多少犠牲になるという、論文自身が認めているトレードオフです。
論文自身が書いている限界と、原文を読んで気づいた点
この論文は4ページ程度のデモ論文で、限界の指摘を独立した章に立てず、結果を説明する本文の中にまとめています。本文の実験結果を説明する箇所で、著者は読みやすさの低下とトピック網羅度がカテゴリ基準に届かない点を、トレードオフとして書いています。
これが、論文自身が認めている唯一のはっきりした弱点です。
原文を通読して、こちらで気づいた点を挙げます。
- 評価に使われている「GEOスコア」は、AIに質問への回答を作らせ、その回答の中でどのページがどれだけ根拠にされたかを測る、シミュレーションによる自動採点です。評価は、人手を介さずにこの自動採点の仕組みだけで行われています
- 実験は「GEO-bench」という質問集の上で行われています。稼働中のサービスでの検証は、2024年のGEO原論文がPerplexityで行った追試とは異なり、この論文の範囲外です
- 実験に使われた質問集や評価の仕組みが英語圏のものであることから、日本語のページでの検証は行われていないと考えられます
- 著者7人のうち5人が、米国の大手ソフトウェア企業の研究部門に所属しています。この企業は自社でコンテンツ制作や解析のツールを提供しており、この論文は自社の研究チームによる報告という性質を持ちます
- 足された「根拠となる情報」や引用の中身が事実として正しいかどうかは、評価の対象外です。これは2024年のGEO原論文と共通する限界です
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 記事ごとに効く改善策が違うため、9種類から自動で選ぶ仕組みは、カテゴリ単位で1つ選ぶやり方より目立ち方が上がった | 実際のGoogle AI OverviewsやPerplexityで同じ幅の効果が出ること |
| バンディット制御を使うと、総当たりの約10分の1の呼び出し回数で、同等以上のスコアに達した | 日本語のページでも同じ大きさで効くこと |
| 目立ち方を上げつつ、原文に近い分量を保ち、EEATの信頼性を大きく上げられた | 読みやすさを犠牲にせずに、目立ち方だけを上げられること |
| 選ばれる改善策は記事ごとにばらついており、1つの改善策が支配的にならなかった | 足された根拠や引用の内容が事実として正しいこと |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- この論文が示したのは、9通りの直し方を人が手探りで試す作業を、少ない試行回数で絞り込む考え方です。中小企業の実務では、AIに任せる仕組みそのものより、「同じ記事でも、直し方によって結果が変わる」という前提を持つことのほうが役に立ちます
- 読みやすさとのトレードオフが論文自身から報告されている点は、実務でも参考になります。目立ち方を上げる直しを入れたら、読みやすさや文章の分量が変わっていないかを、あわせて確認する習慣が必要です
- Agent2UCBの評価は、実サービスではなくシミュレーションの上で行われています。自社のページに手を加えたら、実際にChatGPTやGoogleのAI機能でどう扱われているかを、別途確かめる必要があります
- 足した根拠や引用が実在するかどうかは、この論文でも評価の対象外です。数字や出典を足す作業自体は、既に取り上げたGEO原論文の記事で触れた確認手順と同じく、元の資料に当たってから行う必要があります
よくある質問
Agent2UCBは、どこかで使えるツールとして公開されていますか
コードやデータの公開先は、本文には見当たらず、未確認のままです。論文が示しているのは、デモとして動く仕組みの説明と、その仕組みを使った実験結果です。
一般に使えるサービスとして公開されているかどうかは、この論文の範囲外です。
バンディットという手法は、GEO以外にも使われていますか
はい。バンディット(多腕バンディット)は、広告の出し分けや商品のおすすめ順の決定など、選択肢を試しながら学ぶ場面全般で使われてきた統計の手法です。
この論文は、その考え方をGEOの改善策選びに当てはめた点が新しさです。
EEAT-Rの点数が低いと、必ず目立ち方も低くなりますか
論文が検証しているのはEEAT-Rを診断として使うところまでで、目立ち方のスコアとの因果関係は検証の範囲外です。低い項目を直すことが目立ち方の向上につながるかどうかも、同じく検証の範囲外です。
まとめ:今日できる1つのこと
自社の記事を1本選び、「この記事に足りないのは、引用なのか、数字なのか、それとも読みやすさなのか」を1つだけ選んで直してみてください。
9つ全部を一度に直すのではなく、1つずつ直して変化を見る進め方は、この論文の考え方と重なります。直したあとは、読みやすさが下がっていないかもあわせて確認してください。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


