MENU
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
AIO・LLMO・GEO対策の記事制作
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  1. ホーム
  2. LLMO
  3. LLMO論文
  4. 【LLMO論文解説】LLMO(AIO・GEO)論文98本を読んで分かったこと|合同会社謙虚の見解(2026年10月時点)

【LLMO論文解説】LLMO(AIO・GEO)論文98本を読んで分かったこと|合同会社謙虚の見解(2026年10月時点)

2026 10/05
2026年9月23日2026年10月5日
中野輝規
LLMO論文を横断して読んで分かったこと

2026年9月、合同会社謙虚は、LLMO(大規模言語モデル最適化。海外の論文ではGEO=Generative Engine Optimization、国内ではAIOとも呼ばれます)に関する海外の学術論文を98本、原文から読んで解説記事にしました。

1本ずつ読んでいるときは気づきにくいのですが、98本を並べて比べると、論文をまたいで繰り返し出てくる論点があります。

個別の記事は、論文1本ごとに「原文で何を測り、何が分かり、何が分かっていないか」を整理したものでした。この記事はその逆に、98本を横断して見えてきたことを、合同会社謙虚の見解としてまとめたものです。

個別の数値の裏取り(原文の表・節番号)は、それぞれの記事に書いてありますので、この記事では結果の要約と、そこからの読み取りに絞ります。

この記事は、合同会社謙虚の意見記事です。98本の論文を分野別に整理した、網羅的な一覧(読む順・地図)は、LLMO論文の一覧という別の記事にあります。

個別の論文を1本ずつ探したい方は、そちらをご覧ください。

98本は、2023年11月に公開された最初のGEO論文から、2026年に入って公開された査読前の論文まで、公開時期も掲載先もそろっていません。

学会での発表・採録が確認できたのは半数程度で、残りは査読前の状態か、査読の有無を確認できませんでした。この記事では、論文ごとの掲載状況の違いを踏まえたうえで、複数の論文にまたがって繰り返し出てくる結果だけを「共通して見えたこと」として扱っています。

1本の論文だけが報告している数値は、個別記事のほうで確認してください。

この記事は、論文を読み進めるたびに更新していく前提で書いています。今回は2026年10月時点で98本を精査した内容です。

読んだ論文が増えるたびに、柱の追加や書き直しがあり得ます。

目次

結論:3行で言うと

  • 検索エンジンの順位と、生成AI検索での見え方は別の指標として動きます。出典の重なりが1〜2割程度しかないという実測が、複数の論文で出ています
  • AIに見られるまでには、検索が起動する・ページが拾われる・引用される・回答に反映されるという複数の関門があり、途中のどこか1つが低いだけで、全体の見え方は下がります
  • ページの書き換え(GEO施策)で伸びるのは、主に「AIに渡された後の目立ち方」です。渡される前の段階(検索・取得)を悪化させる書き換えも実測されています
  • 引用されることと、内容が正しく・忠実に伝わることは別の軸です。引用の半分近くが出典で十分に裏づけられていなかったという実測もあります

ここまでは、98本の論文が実際に測って報告している内容です。ここから先で「合同会社謙虚の意見」を書く場合は、その章の冒頭で明示します。

98本の内訳は、生成AI検索の仕組み自体を扱った基礎研究(最初のGEO論文とそのサーベイ)、実サービスの出典や表示率を追った監査、書き換え(GEO施策)の効果を実験室や実サービスで測った研究、成果測定の枠組みを示した研究に、大きく分かれます。

分野も、旅行・小売・スタートアップ・一般的な質問応答と幅があり、対象言語もほとんどが英語です。次の章からは、この幅のある98本を横断して、繰り返し出てきた結果を柱として並べます。

98本を通して共通して見えたこと

ここは、98本の論文がそれぞれ報告している結果の要約です。合同会社謙虚の意見はまだ入れていません。

柱1:検索順位とAIでの見え方は別物

従来のSEO(検索エンジン最適化)では、目標は検索結果の1ページ目、できれば上位に順位を上げることでした。生成AI検索では、AIが複数のページを読んで1つの回答にまとめるため、「順位」に相当するものが画面上には現れません。

代わりに問題になるのは、そもそも自社のページが引用元として選ばれるか、そして選ばれた場合にどこまで内容が反映されるかです。

複数の論文が、この2つの現象(通常検索の順位と、AI検索での引用)を直接比べています。

通常のGoogle検索・AI Overviews・Geminiが引用する出典を比べた実測では、3つとも出典を返した質問だけで見ても、URLの重なり(ジャッカード係数)は0.11〜0.18にとどまりました(1万1,500問で比べた実測)。

別の実測では、AI Overviewsが引用したドメインの53%は通常検索の上位10件に入っておらず、27%は上位100件にもありませんでした。

2か月後の出典の重なりも、通常検索の45%に対しAI Overviewsは18%でした(4,706問で見た重なりと不安定さ)。

もう1本のサーベイが紹介する別の監査でも、2つのAIサービスの出典ドメインの重なりは26%でした(GEO研究48本の批判的サーベイ)。

引用元の性質そのものも、通常検索とAI検索で違いました。家電・自動車・ソフトウェアの商品カテゴリを調べた実測では、AIの回答は通常検索よりも自社サイト以外の第三者メディア(獲得メディア)を選ぶ比率が高いという結果が出ています(獲得メディアの偏りと限界)。

東京のホテルを対象にした実測でも、質問が取引型か体験型かで非OTA(宿の公式サイトなど)の引用比率が30.8%から55.9%まで変わり、日本語と英語でも差の大きさが違いました(OTAと日本語・英語の比較)。

メンタルヘルスの質問を7言語で調べた監査では、日本語の質問の引用の77.3%が日本の国別ドメインにあり、英語以外の6言語の中で最も国内のページに案内されていました(メンタルヘルスの質問の引用の監査、プレプリント)。

引用がすでに目立つ発信者に寄るかを調べた監査もあります。Web3の44事業について4つのAIの引用を数えたところ、発信者の引用を分析できた2つのAIの画面では、外部の順位表で上位10人に入る発信者ほど引用で有利でした(下位半分との差は事業あたり平均4.32〜7.16ポイント。

目立つ発信者と引用、プレプリント)。

同じ監査では、質問に「出典を挙げて」と付けても、出典の種類の割合は本文の値で最大2.1ポイントしか動きませんでした。GoogleとBaiduのAI要約を12か国・4言語の健康の質問で比べた監査でも、日本から聞いた場合の.jpの出典は、英語の質問で16.6%、日本語の質問で57.5%と約3.5倍になりました(健康の質問でのGoogleとBaiduのAI要約、プレプリント)。

128ブランド・12市場・13言語を対象にした、より大規模な実測でも同じ傾向が確認されています。AIの回答が引用したサイトのうち、ブランドの公式サイトは平均で1〜2割程度にとどまり、8割5分前後は第三者のサイトからの引用でした(128ブランドの多言語分析)。

この論文は日本語・日本市場を対象にしていませんが、規模の大きさから、獲得メディア重視の傾向が一部の業界・地域に限られたものではないことを裏づけています。

通常のGoogle検索とAI回答の出典を大規模に比べた、査読を経た実測でも同じ傾向が確認されています。家電・自動車の2分野で約1,000問を調べたところ、判定できた質問のうちAI回答と通常検索の出典が一致した割合は、分野や生成AIの種類によって大きな差があり、自動車分野では最低で42.6%にとどまりました(Google検索とAI検索の大規模比較)。

同じ実測では、AI回答が挙げるページの更新日の中央値が、通常検索より大幅に新しい(生成AIの種類によって148〜217日、通常検索は493日)という結果も出ており、AIが比較的新しいページを優先する可能性を示しています。

複数の論文の重なりの数字を並べると、次のようになります。測り方(ジャッカード係数か、上位何件との比較か)は論文ごとに違うため、数字はそのまま足し引きできませんが、いずれも「重なりは小さい」という向きは共通しています。

比べた対象 重なりの実測値 出典
通常検索・AI Overviews・Geminiの出典URL(3つとも出典ありの質問) 0.11〜0.18(ジャッカード係数) 1万1,500問で比べた実測
AI Overviewsの出典と、通常検索の上位10件 重なりは50%未満。ドメインの53%が上位10件外 4,706問で見た重なりと不安定さ
2つの生成AI検索サービスの出典ドメイン 26% サーベイが紹介する別監査

柱2:見られるまでに複数の関門がある

柱1で見た「重なりの低さ」は、AIが通常検索と違う基準で出典を選んでいることを示す結果です。複数の論文を合わせて読むと、見え方が決まるまでには、いくつもの段階を順番に通過する必要があることが分かります。

サーベイ論文は、生成AI検索の見え方を「検索が起動する確率×取得される確率×引用される確率」の掛け算として整理しています。どれか1つの確率が低ければ、全体の見え方は低くなるという考え方です(GEO研究48本の批判的サーベイ)。

この構造を裏づける実測が複数あります。新興企業112社を調べた実測では、社名を出して聞いた質問には99.4%が答えに含まれた一方、社名を出さずカテゴリで探す質問では3.32%しか出てきませんでした。

差は約30倍です(Product Hunt 112社の調査)。

5つのAI検索で102ブランドを測った別の集計でも、社名を入れないカテゴリの質問で名前が出た割合は、知名度の高い順に73%・44%・11%と段ごとに約30ポイントずつ下がっていました(知名度の段ごとの言及率、計測企業の自社報告)。

AI Overviewsの出現率を調べた実測でも、疑問文での出現率は64.7%、疑問文でない検索では9.5%と、約6.8倍の差がありました(55,393件を40日間追った実測調査)。

掛け算の最後の関門である「引用された後」も、一様ではありません。「引用された(選択)」ことと「回答の中身に反映された(吸収された)」ことを分けて測る枠組みが示され、その実測では、1質問あたりの出典の数はPerplexityが最多(平均16.35件)、ChatGPTが最少(平均6.88件)でした。

ところが、出典の内容が回答にどれだけ取り込まれたかを示す指標の平均は、逆にChatGPTが最も高く、PerplexityやGoogleのAI Overviewの約4倍でした(選択と吸収を分けて測る枠組み)。

「引用された回数が多いサービス」と「回答への影響が大きいサービス」が一致しない例で、「引用された回数」だけを数えても、この差は見えてきません。

同じ考え方を評価用データとして整えた研究もあります。記事が回答の中で目立った度合いと、その記事を抜いて作り直したときに回答がどれだけ変わるか(回答の中身への影響)を分けて測ったところ、両者の相関はほぼゼロ(0.019)でした。

AIに渡される順番が後ろになるほど点数が大きく下がり、その幅は書き換えの効果より大きかったとも報告されています(「出典に出た」と「答えを変えた」を分けて測る評価用データ)。

「なぜ引用されないのか」を原因ごとに分類した実測もあります。引用されなかった原因の6割超は、質問の意図・文脈・地域・鮮度といった「質問との意味のずれ」で、文章の巧拙が原因だったものは少数でした(引用されない原因を分類する仕組み)。

関門を通過できない理由の多くは、書き方より前の「そもそも何を聞かれているか」の一致度にあるという見方です。飲食店4,776軒を全数調べた別の実測でも、AIが店を薦めない主な理由は情報の少なさで、閉店した店を紹介し続けるという「情報の古さ」も見つかっています(飲食店4,776軒の全数調査)。

柱3:書き換えの効果は「目立ち方」に集中し、検索段階を悪化させることがある

最初のGEO(Generative Engine Optimization)論文は、AIに渡すページがすでに5件に決まっている実験室で、文章に引用を足すと回答の中での目立ち方の指標が19.3から27.2(約41%)に上がり、統計を足す(25.2、約31%)、出典を示す(24.6、約27%)も上位に来たと報告しました。

一方、従来のSEOで使われてきたキーワードの詰め込みは17.7(約-8%)に下がりました。全員が同じ手法で最適化した場合は、検索順位1位のページの取り分が下がり(方法により約-20.6〜-30.3%)、5位のページは約2倍(方法により+97.9〜+115.1%)に増えています(GEO原論文)。

検索から回答までを通して測った実測では、本文だけを書き換えた場合、AIに渡された後の目立ち方は上がっても、検索の取得段階では平均で約9%、再ランク段階では約16%下がり、最終的な引用は約6%下がりました。ある自動化手法(AutoGEO)の本文のみ書き換えでは、検索段階で約36%、再ランク段階で約42%、最終的な引用で約22%下がっています(SAGEO Arena)。

書き換えの種類 検索の取得段階 再ランク段階 最終的な引用
本文のみ書き換え(平均) -9% -16% -6%
構造情報のみ書き換え(平均) +22% -17% +2%
本文+構造の両方(平均) +15% -25% -5%
自動化手法(AutoGEO)の本文のみ -36% -42% -22%

この表からは、「目立ち方の指標が上がる」ことと「最終的な引用率が上がる」ことが、必ずしも一致しない点が読み取れます(SAGEO Arena)。

6分野・4つのAIモデルで10通りの手法を試した実測では、回答役の1つ(gpt-4o-mini)の結果で、統計的に有意にプラスだったのは3か所だけでした。

統計を足す手法は、むしろ24設定中19設定で有意に下がっています(会話型検索向けSEOの検証)。

最初に引用されるページを決める要因を18種類・6モデルで調べた実測では、質問との関連性と、AIに渡されるときの位置が最も安定して効いており、書式だけの変更は6モデルのいずれでも有意な差になりませんでした(関連性・位置・価格・日付)。

生成AIの好みを取り出して自動で書き換える仕組みの実測では、目立ち方の指標が最大50.99%上がった一方、引用の正確さの指標が下がる組み合わせもありました(AutoGEOの実測)。

元の文章の完成度によって、同じ書き換えの効き方が逆転する例も報告されています。AIが生成した宣伝色の強い文章では、キーワード追加や権威的な文体といった書き換えが軒並み逆効果だった一方、人間が書いた既存ページでは同じ書き換えがむしろ目立ち方を上げていました(特徴量を先に決めて最適化する手法)。

実際のEC(通販)サイトで15種類の経験則を試した実測では、11種類が効果なしか逆効果で、広告調・外国語表現・一文への圧縮のような「見せ方だけを変える」書き換えが軒並み沈む一方、見出し・箇条書き・FAQ形式のような「情報を整理する」書き換えは比較的沈みにくいという結果でした(ECサイトでの実測)。

どの生成AIを使うかによって、最も効く固定ルールの順位が入れ替わるという実測もあり、単一の「勝ちパターン」に頼ることのリスクを示しています(生成AIごとに最適な戦略が変わる実測)。

書き換え作業そのものを、大規模言語モデルへのプロンプト指示ではなく、小さなモデルに学習させて自動化する試みも報告されています。

旅行・観光分野に限定したデータで小型モデル(BART)を微調整したところ、生成AIの回答での目立ち方が伸びたという実測です。

ただし、この実測は評価件数がわずか50問で、著者自身が「統計的な有意性を示すには小さすぎる」と明記しています(BART微調整によるGEO自動化の試み)。

書き換え手法の効果を測る実験は、母数が小さいものが少なくないという傾向は、柱5でも改めて触れます。

文章の中身を一切変えず、見出しの深さ・段落の長さ・構造化要素の比率・強調表現の量・内部リンクの密度という「構造」だけを調整した実測もあります。

6つの生成AI検索エンジンで引用率が平均17.3%(相対)改善し、寄与の内訳では見出しやリンク構成など文書全体の骨格(マクロ構造)が最も大きく、強調表現などの細部(ミクロ構造)は相対的に小さいという結果でした(構造だけを変えた実測)。

意味内容を書き換えなくても、見出しの整理や段落の長さの調整だけで一定の効果が期待できることを示す事例です。

複数の役割・観点からコンテンツを読み直して書き換える手法も報告されています。4つの想定読者の視点で内省させてから書き換える実験では、AIが自動採点する「主観的な見え方」の指標は伸びた一方、著者自身が、内省の工程を外した簡易版のほうが客観指標と主観指標を合わせた総合力では上回ると認めています(複数の役割で読み直す書き換え手法)。

広告文を強化学習で書き換える別の実験でも、取得される確率を高める効果は確認された一方、効果を測る指標の定義と報告値が原文内で食い違っている箇所が見つかっており、数値の大きさをそのまま鵜呑みにせず、方法どうしの順位比較にとどめて読む必要があります(広告文の強化学習による書き換え)。

質問の裏にある需要を先に書き出してから文章を書き換える手法は、ACL 2026の本会議で発表されました。研究用の模擬環境で、書き換えなしと比べて客観指標で最大2.44倍、主観指標で平均1.23倍と報告されています。

ただし「潜在的な需要」は実際の利用者のデータではなく、AIが作った言い換えの質問でした(質問の裏の需要に沿って書き換える手法)。

文章ではなくサイトの作りを変えた実験もあります。AIが扱いやすいサイトの条件を「読み取れる」「操作できる」「判断を誤らせない」の3本柱に整理し、同じ品ぞろえの試作の通販サイト2つで比べると、3つのAIが5つの作業を完全にこなせた割合は49.3%から89.3%に上がりました(計300回、採点は人手)。

試作サイトでの概念実証で、どの工夫が効いたのかの切り分けは今後の課題とされています(AIが扱いやすいサイト設計の枠組み、ICEME 2026採択と記載)。

柱4:引用と忠実度は別の軸

生成AI検索が普及し始めた時期の監査では、生成された文のうち出典で完全に裏づけられていたのは51.5%、付いた引用が文を正しく支えていたのは74.5%でした(GEO登場前の初期監査)。

より新しい実測でも、AI Overviewsが挙げた主張のうち、出典で完全に裏づけられていたのは41.9%にとどまり、約11%は根拠が不十分と分類されています。

内訳は、出典に書かれていないもの(約7.0%)が中心で、出典と反対のことを書いていたものは約2.7%、出典どうしが食い違っていたものが約1.4%でした(55,393件を40日間追った実測調査)。

「引用元として選ばれる」条件と「回答の中で正しく使われる」条件は別々に測る必要がある、という考え方は、選択と吸収を分ける枠組みでも示されています(選択と吸収を分けて測る枠組み)。

回答が質問の核心をどこまで押さえているか、という観点の実測もあります。質問を「中核・背景・発展」の下位の問いに分けて数えると、調べた3つのAI検索はいずれも中核の問いを優先して答えていたものの、中核の問いの約半分(46〜58%)を回答から落としていました。

中核の問いに答えるページを引用元に持っていても、その内容が回答に入ったのは51〜71%でした(下位の問いで網羅を測る指標、NAACL 2025)。

引用されることと、引用元の中身が回答に使われることは、ここでも別の段階です。

候補に入った後の選ばれ方を、実験で確かめた研究もあります。架空のホテルで評判の要素を入れ替えて12のAIモデルに選ばせた実験では、属性の重要度の約7割を評価点(35.7%)と価格(33.8%)が占めました。

中身のない並び順も4.1%あり、系列(2.0%)や口コミの新しさ(1.7%)を上回っています(AIのホテル推薦を動かす評判の要素、プレプリント)。

スキンケアの実験では、仕様がまったく同じなら3つのAIは670回すべてで有名ブランドを選びましたが、架空ブランドの評価を星0.075個分上げると半分の確率で逆転しました(有名ブランドの有利さと説得の文言、プレプリント)。

どちらも架空の商品を使った実験室の結果で、実際のAI検索の推薦そのものを測ったものではありません。

引用された出典が、要約の中で均等に使われるわけでもありません。1万1,000問を調べた研究では、AI Overviewsで、SNS・掲示板の出典は引用されても要約への反映が22.1ポイント少なく、否定的な論調の出典も13.8ポイント少なくなっていました(引用された出典の使われ方の偏り、EMNLP 2026と記載のプレプリント)。

出典の一覧に並ぶことと、中身が要約に写されることは、同じ研究の中でも別々に動いていました。中国語のAI検索4サービスを調べた監査でも、本文に番号を付ける2サービスでは並んだ出典の39.3%が本文で一度も使われず、出典のページに出てきたブランドのうち回答にも出たのは8.3%でした(中国語のAI検索4サービスの監査、プレプリント)。

引用された出典そのものの中身を調べた監査もあります。4つのAI検索が引用し、本文を取得できた1万9,154件のページのうち、約16%を検出ツールが「AI生成」と判定しました。

検出ツール1種類による判定で、論文は下限の目安として扱うよう求めています。AI生成のページが引用されやすいかどうかは比べていません(引用された出典のAI生成ページの監査、プレプリント)。

「出典どおり」と「確かな出典どおり」も別の話です。4つのチャット型AIの回答を小さな事実に分けて出典と照合した研究では、74〜86%が出典で裏づけられていましたが、信頼できる出典での裏づけに絞ると72〜81%に下がりました(チャット型AIの出典の信頼性と裏づけ、EACL 2026)。

専門家21人が3つのAI検索とGoogle検索を使い比べた調査でも、全員が「文を支えていない出典に引用が付く」付け違いを指摘し、AI検索では開いて確かめる出典がずっと少なくなりました(クリックは平均1回前後、Googleは3.80回。

出典付き回答の16の問題、FAccT 2025)。

回答に使われる材料の側にも偏りがあります。掲示板の回答機能を約3万回の回答で監査した研究では、回答に使われたコメントはスレッドの中ですでに評価が高く、早く書かれたものに偏り(評価の順位が標準的なばらつき1つ分高いと、選ばれるオッズが2.88倍)、回答文では「私は」にあたる一人称の割合が3.3%から0.06%に下がっていました。

論文は因果として読まないよう求めています(掲示板の回答機能の監査、プレプリント)。

出典になる資料が薄い話題では、答えそのものの正確さも下がります。28の紛争について5つのAIの回答を採点した研究では、-2〜+2の5段階の平均点が、報道や記録が最も厚い3分の1の紛争で+1.02、最も薄い3分の1で+0.71でした。

記録の薄い紛争では、情報が少数のサイトに集中していました(報道の少ない紛争とAIの答え、プレプリント)。

柱5:一度の測定は決め手にならない。競争が起きると効果は薄れる

同じ質問を24時間以内に繰り返し投げても、出典の重なりは3〜4割程度にとどまり、あるサービスでは57.8%の回答で引用が1件も付きませんでした(4サービス45日間の追跡)。

同じ200問を9日間投げ続けた別の実測では、1回の測定で出した引用割合に、SearchGPTでは多くのドメインで3〜6ポイントの幅(95%信頼区間)があり、それより小さい差は揺れと区別しにくいとされています(引用割合の不確かさを測る枠組み)。

同じ著者の続編では、引用元の順位表が信じられる状態になるまでに必要な回答数は、条件によって33件から94件まで開き、125件でも届かない組がありました(何件集めれば順位を信じてよいか)。

この2本と知名度の段ごとの集計は、いずれもAI検索の計測サービスを提供する企業の自社研究です。そもそも「どの質問を測るか」で数字が大きく変わる、という指摘もあります。

同じ公開データでも、質問の種類ごとの重みの付け方を変えるだけで、AI Overviewsの表示率が39.66%にも70.54%にもなりました(質問の集め方が数字を決める)。

実在の買い手が何を聞くかに近づけるため、AIで約100万人の買い手像と質問を作る試みもありますが、実際の買い手の質問との一致はまだ確かめられていません(AIで作った買い手像)。

質問の言い方の向きも、答えを動かします。2023年のBing ChatとPerplexityを調べた監査では、質問と回答の感情の向きに中程度の相関(0.46)があり、回答の約8割が質問の見方に沿っていました(質問の論調に寄るAI検索の監査、ASIS&T 2024)。

前向きな聞き方と後ろ向きな聞き方で、同じ話題でも別の答えが返りうるということです。温度をゼロに固定できるサービスでも、5分後や24時間後の聞き直しで9〜28%の質問の答えの向きが変わったという実測もあります(4,706問で見た重なりと不安定さ)。

競争が起きた場合の実測もあります。ある実験では、AIに競合を出し抜かせる書き換え(選好操作攻撃)によって、架空のカメラの推薦率が34.0%から59.4%に上がりました。

ただし、みんなが同じ手法を使うと個々の利益は薄れ、AIの回答の質そのものが下がっていく構図が、複数の実験で確認されています(全員が攻撃すると損をする囚人のジレンマ)。

スキンケアの推薦実験でも、権威づけの文言を1社だけが足すと推薦が大きく動きましたが、使う架空ブランドが増えるほど1社あたりの得は縮み、全9社がそろうと+0.802から+0.007まで小さくなりました(有名ブランドの有利さと説得の文言)。

順位だけを狙った書き換えが重なったときの影響を模擬実験で追った研究では、上位の型に寄せる書き換えを20回繰り返すと、「上位の型に近いこと」と品質の結びつきが6分野すべてで弱まりました(順位相関の変化は平均-0.068。

順位だけを目標にした書き換えの模擬実験、COLM 2026)。

売上や流入への効果を実サイトで検証した数少ない実測でも、あるサイト全体のChatGPTからの流入は同じ期間に5.7倍になりましたが、その内訳を見ると、書き直しの対象にしたページが6.1倍だったのに対し、手を加えていない対照ページも3.5倍伸びていました。

処置群と対照群の比は、施策の時期に1.82倍の段差を見せています。ただし、保守的な検定ではp=0.16で、論文自身も「示唆的だが決定的ではない」と述べています(対照ページで切り分けた1サイト分析)。

競合が同時に最適化を進めるという前提を組み込んで、書き換え戦略の選び方を定式化した実測もあります。競合がいない状態では既存の自動化手法を上回る程度でしたが、競合が最適化を進めるほど差が広がり、競合ありの状況では既存手法を18%超上回りました(競合を見て戦略を選ぶ手法)。

競合の動きを踏まえずに単一の「勝ちパターン」に頼ると、競合が追随してきたときに優位性を失いやすいことを示す結果です。

柱1から柱5までを、いったん「言えること」と「言えないこと」に分けると、次のようになります。

言えること(複数の論文が実測した範囲) 言えないこと(まだ実測されていない範囲)
通常検索の順位と、生成AI検索での見え方は別の指標として動く 通常検索で上位に出れば、生成AI検索でも同じように引用される
見られるまでに複数の関門があり、途中の1つが低いと全体が下がる 特定の書き換えをすれば、どの関門も一様に通過できる
本文だけの書き換えは、検索・取得段階を悪化させることがある 目立ち方の指標が上がれば、最終的な引用や成果も同じ比率で上がる
引用されることと、内容が正しく裏づけられていることは別の軸 引用された内容は、出典と矛盾なく伝わっている
1回の測定は揺れが大きく、競争が起きると個々の利得は薄れる 売上や問い合わせが、施策によってどれだけ増えるか

合同会社謙虚の意見

ここからは、論文の主張を超えた、私たちの意見です。98本を読んで、合同会社謙虚として考えたことを書きます。

論文が直接検証した内容ではありませんので、その前提でお読みください。

海外・英語での実測結果を、日本語の中小企業向けの効果保証のように語ることには、警戒したほうがよいと考えています。

98本の実験のほとんどは英語圏のサービスと質問を対象にしており、日本語での検証がある論文はごく一部です。「海外の論文が実証した」という説明と、「日本語のページでも同じ大きさで効く」という説明の間には、まだ距離があります。

合同会社謙虚がクライアント様に説明するときも、「海外の実験ではこうだった」と「自社での実測ではこうだった」を、はっきり分けて伝えるようにしています

「AIに出た・出ない」を1つの指標にせず、取得・引用・忠実度・成果を分けて記録する運用を、私たち自身の3ドメインでも続けます。

柱2・4で見たとおり、これらは別々に動く指標です。1つの数字にまとめてしまうと、どこで見え方が落ちているのか(検索に拾われていないのか、拾われても引用されないのか、引用されても正しく伝わっていないのか)が分からなくなります

通常検索での順位づくりを、LLMO対策と並行してやめるべきではないと考えています。

柱1・2のとおり、AIに渡される前の段階(検索・取得)を通過できなければ、どれだけ文章を整えても回答には反映されません。

通常検索の順位は、その手前の関門を通過するための土台であり続けています。「AI検索の時代だから、通常のSEOはもう要らない」という言い方は、98本の実測からは支持できないというのが、私たちの受け取り方です

著者名・資格・監修といった目印を「付ければAIに引用される条件」として語る説明には、慎重であるべきと考えています。

ChatGPTが健康の質問で引用した615件を調べた研究では、上位10組織が引用の52.8%を占める一方、著者の名前と資格の両方が見えるページは7.0%にとどまりました(AIが引用した健康情報源の目印)。

引用されなかったページとの比較ではないので、目印が効かないとも言い切れません。ただ、目印を付ければ引用されるという根拠にもなりません。

合同会社謙虚は、著者情報や出典を、読み手が確かめるための材料として付けることを提案します

悪目立ちする最適化が業界内で広がれば、GEO・LLMOという言葉そのものの信頼が下がっていくと見ています。

柱5で見たとおり、競争が起きると個々の利得は薄れ、AIの回答の質も下がる構図があります。誰かが過激な最適化に踏み込めば、他の事業者もそれに合わせざるを得なくなり、結局は業界全体でAIの回答の質が下がって、そのカテゴリ自体がAIに使われにくくなるおそれがあります(選好操作攻撃の記事で見た囚人のジレンマと同じ構図です)。

この懸念は、もはや理屈の上だけの話ではなくなっています。実際の検索結果を調べた実測では、GEO対策済みと判定されたページが全体の8.90%、2026年に更新されたページに限ると16.36%に上っていました(実サイトでのGEO対策済みページの検出)。

過激な最適化は、もはや見分けがつく段階に入っているというのが私たちの読み取りです。合同会社謙虚は、この構造を踏まえて、やりすぎない情報設計を提案する立場を続けます

企業自身が発表する「本番で◯%増えた」という見出しの数字は、必ず元の表まで遡って確認したほうがよいと考えています。

ある画像サービスの産業界の報告では、要旨と結論で「本番トラフィックが20%増えた」と述べていましたが、根拠として示された表の実測値は最大でも1.83ポイントで、20%を裏づける記載はどこにも見当たりませんでした(画像サービスでの実装報告)。

見出しの数字と、本文の表の数字が食い違うことは実際に起こりえます。AI検索の支援サービスを手がける企業の創業者が書いた別の論文では、利益相反の申告がないまま、引用されたページだけを採点して「品質の点が高いほど引用される」と読める結論を示していました。

比べる相手の群がない設計では、分かるのは相関までです(16の観点で引用ページを採点した研究)。

英国のオンラインギャンブル分野を扱った企業の技術レポートは、独自の測定を1件も持たないまま、効果の表を載せていました。その表は、順位も一部の符号もGEO原論文と食い違い、原論文に無いp値まで付いていました(英国ギャンブル分野の企業レポート)。

自社で販売する採点の仕組みを自社で検証した別の論文でも、点数と引用されやすさの順位の相関は0.11程度にとどまっていました(AIに質問せずページを採点する指標)。

合同会社謙虚が他社の実績数値を紹介するときも、見出しの数字だけで判断せず、元の表・実験条件まで確認する姿勢を続けます

商品説明の書き方ひとつでAIの推薦が動く以上、書き手の側の節度がいっそう問われると考えています。

6つのAIで試した実験では、「多くの人が選んでいる」と示す書き方や値引きの強調は推薦を増やし、「残りわずか」「限られた人だけ」はおおむね推薦を減らしました(認知バイアスとAIの商品推薦、EMNLP 2025)。

売り手のページを1枚書き換えるだけで、条件を満たさない商品がAIの推薦の上位3件に入る割合が、現実的な書き換えの平均で+70.2〜+78.2ポイント増えたという実験もあります(売り手のページによる推薦の歪み、プレプリント)。

検索結果の上位3件に出てくる実在ブランド名を架空の名前に置き換えた汚染ページでは、12のAIすべてが架空ブランドを薦めました(平均42.7%。

汚染ページとAIの推薦、EMNLP 2026 Findings採択と記載)。

商品情報に最適化した文字列を足すと、内部を読める公開AIで架空の商品の推薦1位が入れ替わった実験(商品情報に仕込んだ文字列、プレプリント)や、ページに仕込んだ指示で4つのAIとAPI経由のAI検索の紹介順が上がった実験(ページに仕込んだ指示と紹介順、EMNLP 2024)もあります。

その後も、宣伝語を避けて見つかりにくくした文字列(見つかりにくい文字列、ICML 2026ワークショップ)、短くて自然に見える文字列(自然に見える短い文字列、ACL 2026)、文書に仕込んだ指示で順位づけの判断そのものを乗っ取る方法(順位づけの盲点、EMNLP 2025)と、公開AIを相手にした操作の研究が続いています。

商品画像と説明文を同時に加工すると、画像も読むAIの商品順位が平均2.25位分上がった実験(マルチモーダル順位操作、ACL 2026ワークショップ)、AIの偏りを突いた書き換えで検索結果の説明文が要約に選ばれる割合が0.37から0.83に上がった実験(要約に選ばれる説明文、プレプリント)もあります。

内部を読めない商用のAI4つに候補10件を直接渡した実験では、口コミ風・推論風の文章を足すと、最下位の商品が1位に来た割合が8割前後になりました(口コミ風の文章とおすすめ順、プレプリント)。

この実験では、口コミ風の文章は機械の指標でも人の判定でも元の説明と見分けにくく、試された3つの見張りはどれも不十分でした。

ページ1枚の書き換えで、観光の推薦の1位が124回中62回入れ替わった実験もあります(ページ1枚の書き換えとおすすめ1位、プレプリント)。

1ページではなく、案内ページと連携した複数のページで調べものAIの推薦率が上がったという、管理環境での実験もあります(根拠のつながりと推薦、プレプリント)。

同じ条件で8つの操作手法を比べた研究では、書き換えだけの手法が5つのデータのうち3つで勾配を使う攻撃と同等以上で、押し上げ・宣伝語のなさ・自然な文の3つを同時に満たす攻撃はほぼありませんでした(順位操作の8手法の比較、プレプリント)。

一方で、攻撃した文書を回答AIに直接渡すこれまでの測り方は効果を大きく見積もっていた、という測り直しもあります。検索・並べ替え・回答の3段に通すと、指示で上書きする攻撃が回答のおすすめに入る割合は約15%まで下がりました(仕込んだ指示は回答まで届くか、プレプリント)。

調べものを自動で進めるAI10モデルを閉じた検索環境で試した評価では、汚染ページが裏づけを装うほど、あやしさを見抜く点数が下がりました(調べものAIと汚染された根拠、プレプリント)。

どれも実験環境の結果で、実際のAI検索サービスで同じように効くかは確かめられていません。そのうえで合同会社謙虚は、実数の裏づけがある書き方だけを勧め、根拠のない煽りや注意書きを埋もれさせる書き方は提案しません

悪意ある最適化への対抗策も、研究として動き始めています。

攻撃文書を検知して並べ替えで退け、残った影響を回答生成の側で抑えるという二段構えの防御で、攻撃の成功率を50.32%から6.20%まで下げた実験が報告されています(悪意あるGEOへの防御)。

検索で集めた文書同士の似かたを調べ、周りから浮いた攻撃文書を下に並べ替える防御では、2つのデータで攻撃の成功率が1割未満に下がりました(文書同士の似かたで外す防御、EMNLP 2025)。

商品説明への順位操作を3つの仕組みで見抜く防御は、既知の手口の大半を見抜いた一方、新しい手口6種類のうち5種類は見抜けませんでした(商品説明の順位操作の検出、プレプリント)。

事実確認で根拠を汚染した評価では、どの汚染にも強い集約方式はありませんでした(汚染された根拠と事実確認、プレプリント)。

誤情報を載せたGEOに対しては、既製の安全フィルター3種はほぼ効かず、専用の検出器で攻撃成功率が相対47.6%下がりました(誤情報を載せたGEOへの防御、EMNLP 2026採択と記載)。

まだ研究段階の技術で、守りにも盲点がありますが、悪目立ちする最適化が一方的に広がり続けるだけではなく、それを見分けて防ぐ側の技術も並行して進んでいるという構図は、合同会社謙虚として心強く読みました

操作をどう抑えるかは、罰だけでなく、仕組みの設計と開示の問題としても論じられ始めています。

攻撃するかどうかを繰り返しの囚人のジレンマとして理論化し、防御で成功率を下げても攻撃が減らない条件を示した研究(繰り返す囚人のジレンマ、ICML 2026ワークショップ)、罰だけの防御は行き詰まりうるとし、元の文書で確かめられる事実に加点する仕組みを提案した研究(引用の奪い合いを共存に変える仕組み、プレプリント)があります。

AIの要約が作り手の意欲を下げると検索エンジン自身の長期の利益も減り、引用と支払いの仕組みで改善しうるという理論と試算(AIの要約と作り手の意欲、プレプリント)、AIでの見え方は時間で薄れると数式で主張した理論提案(確信度の減衰と専門AIへの引き継ぎ、実験データなし)もあります。

立場論文は、影響の集中、開示されない商業的な影響、学術と産業の盲点を挙げ、回答単位の開示と外部の監査を求めています(GEOが生む3つのリスク、ICML 2026)。

GEOの支援をしている合同会社謙虚にとっても、つながりを開示し、確かめられる事実で勝負するという線引きは、自分たちの仕事の基準です

論文自身の説明文と、論文自身が示す表の数値が食い違っている例を、これまでに複数見つけています。

ページ数の記載ミス、実験に使ったハードウェアの取り違え、指標の定義の範囲を超えた報告値、多峰設定の効果についての本文の説明と表の実測値の食い違いなど、原因はさまざまですが、いずれも原文を通読して表まで数字を追わなければ気づけないものでした。

この経験から、合同会社謙虚が論文や他社の実績を紹介するときは、要約や見出しの文言だけで判断せず、必ず元の表・数式まで遡って確認する姿勢を続けます

まだ分かっていないこと・今後読みたい論文の方向性

98本を読んでも、まだ埋まっていない範囲があります。ここに書くのは「論文が測っていない」という事実で、合同会社謙虚の推測を交えていません。

逆に言えば、ここに挙げた範囲について「効果がある」「効果がない」と断定している情報を見かけたら、その根拠がどの論文に基づくのか、確かめる価値があります。

  • 日本語・国内サービスでの実証研究が、ほとんどありません。98本のうち、日本語の質問を扱った実測は、東京のホテルを対象にした1本、メンタルヘルスの質問を7言語で調べた1本(日本語は3問)、健康の質問をGoogleとBaiduで比べた1本にとどまり、他の大半は英語圏のサービスと質問を対象にしています
  • 売上や問い合わせといった事業成果への因果効果を検証した研究は、まだ少数です。生成検索が中小サイトの流入を減らす問題は、法学誌の論考でも取り上げられていますが、そこで示される減少率は他の調査から引いた二次的な数字で、論文自身の測定ではありません(生成検索とシャドーバンの法学論考、German Law Journal)。1サイトの流入を対照ページと比べた実測が1本あるほか、AIでの露出を売上効果に結びつける統計の枠組みを示した論文もありますが、この枠組み自体はシミュレーションでの検証にとどまり、実際の売上データには、まだ適用されていません(広告の効果測定手法を生成AI向けに拡張)
  • 忠実度(引用の正しさ)を継続的に測る仕組みが、まだ確立していません。柱4で見た数値は、いずれも研究ごとの1回限りの監査で、同じ物差しで時系列を追った研究は見当たりませんでした
  • 査読を経た研究と、査読前のプレプリントが混在しています。98本のうち、学会発表や査読つき採録が確認できたのは34本で、残り64本はarXivのコメント欄などから査読の有無が確認できないか、査読前・査読中の状態でした
掲載状況 本数 該当する会議・査読状況(例)
学会発表・査読つき採録が確認できた 34本 KDD、SIGIR、NeurIPS、ICLR、ACL(本会議・Findings)、HFE、ASIS&T、EMNLP(本会議・併設ワークショップ)、EACL、FAccT、COLMなど
プレプリントで、査読の有無が確認できない、または査読前・査読中 64本 学術誌への掲載は確認できたが査読の手続きを確認できない法学論考1本を含む。arXivのコメント欄に「Under Review」等の記載、または採択の記載なし。国際会議の会議録に収録と記載があるが、会議の開催前で掲載を確認できていない1本を含む

今後は、地域の中小事業者やBtoBサービスを対象にした実測、悪目立ちする最適化への対策を検証した研究(準備中とされる論文が既に予告されています)を優先して読んでいく予定です。

更新履歴

日付 内容
2026年9月23日 初版公開。18本を精査した内容で作成
2026年9月23日(同日追記) 27本に増補。柱2(引用されない原因の分類、飲食店全数調査)・柱3(元の文章の完成度による逆転、EC実測、生成AIごとの順位変動)に実測を追加。意見章に、GEO対策済みページの実サイト検出率(8.90%〜16.36%)を追加。学会採択・査読の内訳を14本/13本に更新
2026年9月23日(3回目の同日追記) 30本に増補。柱1に128ブランドの多言語分析を追加。意見章に、自社報告の見出し数字は元の表まで確認すべきという論点(大手画像共有サービスの運営企業による実装報告)と、悪意あるGEOへの防御研究(GEO Defender)を追加。学会採択・査読の内訳を14本/16本に更新
2026年9月23日(4回目の同日追記) 33本に増補。柱1に通常検索とAI検索の大規模比較(出典の一致率・鮮度差)を追加。柱3にBART微調整による自動化の試みを追加。学会採択・査読の内訳を15本/18本に更新
2026年9月23日(5回目の同日追記) 36本に増補。柱3に広告文の強化学習書き換え・複数役割での読み直し手法を追加。意見章に、論文自身の説明文と表の数値が食い違う例を複数見つけたという気づきを追加。学会採択・査読の内訳を17本/19本に更新
2026年9月23日(6回目の同日追記) 39本に増補。柱3に構造だけを変えた実測(GEO-SFE)を追加。柱5に競合を見て戦略を選ぶ手法(Competitor-Aware GEO)を追加。学会採択・査読の内訳を17本/22本に更新
2026年9月24日 42本に増補。柱2に「出典に出た」と「答えを変えた」の相関がほぼゼロという評価用データを追加。柱4に、AI検索が中核の問いの約半分を回答から落としていたという実測を追加。意見章に、利益相反の申告がない相関研究の例を追加。学会採択・査読の内訳を18本/24本に更新
2026年9月24日(2回目) 45本に増補。柱2に知名度の段ごとの言及率(73%・44%・11%)を追加。柱5に、1回の測定の引用割合の幅と、順位表を信じられるまでに必要な回答数(33〜94件)を追加。学会採択・査読の内訳を18本/27本に更新
2026年9月25日 48本に増補。柱5に、質問の集め方で数字が変わるという指摘と、AIで作った買い手像のデータを追加。意見章に、自社の採点ツールを自社で検証した論文の例を追加。論文著者の所属企業名を伏せる表記に統一。学会採択・査読の内訳を18本/30本に更新
2026年9月25日(2回目) 51本に増補。柱4に、引用された出典が要約で均等に使われないという実測を追加。柱5に、質問の論調に回答が寄るという監査を追加。意見章に、著者名・資格などの目印を引用の条件として語ることへの注意を追加。学会採択・査読の内訳を19本/32本に更新
2026年9月25日(3回目) 54本に増補。柱2に、候補に入った後の選ばれ方の実験(ホテルの評判の要素、有名ブランドの有利さ)を追加。柱5に、説得の文言を全社が使うと1社あたりの得が縮むという実験を追加。意見章に、独自の測定がないまま効果の表を載せた企業レポートの例を追加。学会採択・査読の内訳を19本/35本に更新
2026年9月25日(4回目) 57本に増補。柱1に、日本語を含む7言語のメンタルヘルスの質問の監査を追加。柱4に、中国語のAI検索で並んだ出典の約4割が本文で使われなかった監査と、記録の薄い紛争ほどAIの答えの正確さが下がった研究を追加。日本語の質問を扱った実測を2本に更新。学会採択・査読の内訳を19本/38本に更新
2026年9月25日(5回目) 60本に増補。柱3に、質問の裏の需要に沿って書き換える手法(ACL 2026)と、AIが扱いやすいサイト設計の実験を追加。柱4に、引用された出典の約16%をAI生成と判定した監査を追加。学会採択・査読の内訳を20本/40本に更新
2026年9月28日 66本に増補。柱4に、信頼できる出典での裏づけ率の低下(EACL 2026)、専門家21人が挙げた出典付き回答の16の問題(FAccT 2025)、掲示板の回答機能の監査を追加。柱5に、順位だけを狙った書き換えの模擬実験(COLM 2026)を追加。意見章に、商品説明の書き方で推薦が動く2つの実験(EMNLP 2025ほか)を踏まえた書き手の節度を追加。学会採択・査読の内訳を24本/42本に更新
2026年9月28日(2回目) 69本に増補。柱1に、引用がすでに目立つ発信者に寄るかを調べた監査を追加。意見章に、汚染ページで12のAIが架空ブランドを薦めた実験を追加。まだ分かっていないことに、流入の減少を論じた法学論考(数字は二次的)を追加。学会採択・査読の内訳を24本/45本に更新
2026年9月28日(3回目) 72本に増補。柱1に、健康の質問でGoogleとBaiduのAI要約を比べた監査(日本語を含む)を追加。意見章に、仕込んだ文字列・指示で推薦順位が動いた2つの実験を追加。日本語の質問を扱った実測を3本に更新。学会採択・査読の内訳を25本/47本に更新
2026年9月29日 75本に増補。意見章に、公開AIを相手にした順位操作の研究3本(ICML 2026ワークショップ、ACL 2026、EMNLP 2025)を追加。学会採択・査読の内訳を28本/47本に更新
2026年9月29日(2回目) 78本に増補。意見章に、画像と説明文の同時加工で順位が動いた実験(ACL 2026ワークショップ)、要約に選ばれる説明文の操作、口コミ風の文章で商用AIのおすすめ順が動いた実験を追加し、重複していた一文を整理。学会採択・査読の内訳を29本/49本に更新
2026年9月30日 81本に増補。意見章に、順位操作の8手法を同条件で比べた研究、仕込んだ指示が検索・並べ替えを通って回答まで届くかを測り直した研究、調べものAIが汚染された根拠を見抜けるかの評価を追加。学会採択・査読の内訳を29本/52本に更新
2026年9月30日(2回目) 84本に増補。意見章の防御の項に、文書同士の似かたで攻撃文書を外す防御(EMNLP 2025)、商品説明の順位操作の検出、汚染された根拠と事実確認の評価を追加。学会採択・査読の内訳を30本/54本に更新
2026年9月30日(3回目) 92本に増補し、一覧の論文をすべて解説済みに。意見章に、ページ1枚の書き換えでおすすめ1位が入れ替わった実験、根拠のつながりと推薦、誤情報を載せたGEOへの防御、操作を仕組みの設計と開示で抑える理論・立場論文5本を追加。学会採択・査読の内訳を33本/59本に更新
2026年10月3日 95本に増補。材料の一覧に、AIが取得して読めるサイトと推薦の関係を調べた研究、会話全体でGEOを評価する理論の枠組み、4つのAI検索で引用URLの重なりを測った監査の3本を追加。柱と意見の章は変えていません。学会採択・査読の内訳を33本/62本に更新
2026年10月5日 98本に増補。材料の一覧に、BaiduとGoogleのAI要約の出典の監査、新聞社サイト内のAI検索の無作為化実験、会話の文脈が回答に与える影響の実験の3本を追加。柱と意見の章は変えていません。学会採択・査読の内訳を34本/64本に更新

個別に読みたい方へ

この記事は、98本の論文を横断した要約です。1本ずつ、原文の表や節番号まで含めて読みたい方は、LLMO論文の一覧から読む順番を選べます。

一覧のページには、今後読んだ論文も順に増えていきます。「この記事の柱に入っていないから重要でない」という意味ではなく、単にこの記事の更新が追いついていないだけの場合もありますので、その点はご了承ください。

今回この記事の材料にした98本は、次のとおりです。

論文 分かったこと(1行)
GEO原論文(KDD 2024) 引用・統計・出典を足すと目立ち方の指標が上がる。キーワード詰め込みは下がる
GEO研究48本の批判的サーベイ 見え方は7段階の掛け算。長期の因果効果を示した研究はまだない
生成AI向け因果推論の枠組み AI露出と売上を結ぶ統計の枠組み。実データへの適用はまだ
東京のホテルの実測 質問の言い方・言語で、引用元がOTAか公式サイトかが変わる
獲得メディアの偏り AIは通常検索より第三者メディアを選びやすい
SAGEO Arena 本文だけの書き換えは、検索・再ランク段階を悪化させることがある
会話型検索向けSEOの検証 10手法のうち有意にプラスは3か所のみ
対照ページで切り分けた1サイト分析 流入増の大半はサービス全体の伸び。施策の追加効果は約1.8倍
新興112社の調査 社名を出せば99.4%認知。カテゴリ質問では3.32%
4サービス45日間の追跡 同じ質問の再実行でも出典の重なりは3〜4割止まり
選択と吸収を分けて測る枠組み 「引用された」と「回答に使われた」は別の指標
関連性・位置・価格・日付の実験 質問との関連と位置が最も安定して効く。書式は効かない
1万1,500問で比べた実測 通常検索・AI Overviews・Geminiの出典はほとんど重ならない
55,393件を40日間追った実測 疑問文で出現率が上がる。主張の約11%は根拠が不十分
4,706問で見た重なりと不安定さ AI Overviewsの出典は通常検索と別物で、2か月で入れ替わる
GEO登場前の初期監査 引用の半分近くが出典で完全には裏づけられていなかった
選好操作攻撃の実測 攻撃は効くが、全員が使うと業界全体が損をする
AutoGEOの実測 好みのルール化と自動書き換え。目立ち方は上がるが質の低下もある
AIが説得力を判断する根拠 質問との関連性が最も重視される
引用されない原因の診断 原因の6割超は質問との意味のずれ
複数エージェントによるスキル蓄積 うまくいった編集を再利用。生成AIごとに好みが異なる
複数の質問の書き換え要求を調停 優先順位を決めないと一方だけ伸びて他方が落ちる
ECサイトでの全数実測 15の経験則中11が効果なしか逆効果
自己進化型の書き換えエージェント 固定ルールの効き方は生成AIごとに順位が変わる
特徴量を先に決めて最適化 元の文章の完成度で書き換えの効き方が逆転する
飲食店4,776軒の全数調査 閉店した店を紹介し続ける「情報の古さ」が実務上の課題
GEO対策済みページの検出 実サイトの8.90%(更新済みは16.36%)が対策済みと判定
悪意あるGEOへの二段防御 攻撃成功率を50.32%から6.20%に低減
画像サービスでの実装報告 見出しの「20%増」と本文の表(最大1.83pt)が食い違う
128ブランドの多言語分析 引用の8割5分前後が第三者サイト。日本語は対象外
中国系AIと欧米系AIのブランド言及率の差 学習データの違いで0%対65.6%の差。著者と事例企業が同一所属
通常検索とAI検索の大規模比較 出典の一致率は最低42.6%。AI回答の出典はより新しい
BART微調整によるGEO自動化 旅行分野限定・評価はわずか50問
広告文の強化学習による書き換え 取得確率は向上。指標の定義と報告値に食い違いあり
複数の役割で読み直す書き換え手法 主観指標は伸びるが客観指標は簡易版に劣る
画像キャプションの差し込み 多峰設定限定で効果あり。本文の説明と表の数値に食い違い
構造だけを変えた実測(GEO-SFE) 意味内容を変えず引用率が平均17.3%改善
競合を見て戦略を選ぶ手法 競合の最適化が進むほど、優位性の差が広がる
バンディット制御による自動選択(Agent2UCB) 総当たりの10分の1の呼び出し回数で同等以上の効果
下位の問いで網羅を測る指標 AI検索は中核の問いの約半分を回答から落としていた
「出典に出た」と「答えを変えた」を分けて測る評価用データ 目立ち方と回答への影響の相関はほぼゼロ(0.019)
16の観点で引用ページを採点した研究(GEO-16) 比較群がなく相関まで。著者は支援企業の創業者で利益相反の申告なし
引用割合の不確かさを測る枠組み 1回の測定の引用割合には数ポイントの幅がある
知名度の段ごとの言及率 社名なしの質問で73%・44%・11%。計測企業の自社報告
何件集めれば順位を信じてよいか 必要な回答数は33〜94件と条件で大きく変わる
AIで作った買い手像 約100万人の合成データ。実在の質問との一致は未検証
質問の集め方が数字を決める 重みの付け方だけで表示率が39.66%にも70.54%にも
AIに質問せずページを採点する指標 水増しには強いが、引用されやすさとの相関は0.11程度
質問の論調に寄るAI検索の監査(ASIS&T 2024) 回答の約8割が質問の見方に沿い、出典は報道と企業が多い
AIが引用した健康情報源の目印 上位10組織で引用の52.8%。名前と資格が見えるページは7.0%
引用された出典の使われ方の偏り SNS・掲示板や否定的な出典は、引用されても要約で薄く扱われる
英国ギャンブル分野の企業レポート 独自の測定なし。効果の表はGEO原論文と食い違う
AIのホテル推薦を動かす評判の要素 評価点と価格で重要度の約7割。並び順だけでも4.1%
有名ブランドの有利さと説得の文言 仕様が同じなら有名ブランド。星0.075個の差で逆転
中国語のAI検索4サービスの監査 出典のブランドが回答に出たのは8.3%。アプリ版とウェブ版でも引用元が違う
報道の少ない紛争とAIの答え 記録の薄い紛争ほど正確さが下がり、情報が少数のサイトに集中
メンタルヘルスの質問の引用の監査 約4分の3が4種類の組織。日本語は最も国内のページへ
質問の裏の需要に沿って書き換える手法(ACL 2026) 模擬環境で客観指標が最大2.44倍。需要はAIが作った言い換えの質問
引用された出典のAI生成ページの監査 引用ページの約16%をAI生成と判定。下限の目安
AIが扱いやすいサイト設計の枠組み 試作サイトで完全成功率49.3%→89.3%
順位だけを目標にした書き換えの模擬実験(COLM 2026) 型に近いことと品質の結びつきが6分野すべてで弱まった
認知バイアスとAIの商品推薦(EMNLP 2025) 社会的証明・値引きは推薦を増やし、希少性・限定性はおおむね減らした
チャット型AIの出典の信頼性と裏づけ(EACL 2026) 裏づけ74〜86%、信頼できる出典に絞ると72〜81%
掲示板の回答機能の監査 評価の高いコメントに偏り、一人称は3.3%→0.06%
出典付き回答の16の問題(FAccT 2025) 専門家21人が付け違いなどを指摘。確かめる出典は少なかった
売り手のページによる推薦の歪み 条件外の商品の上位入りが平均+70.2〜+78.2ポイント
汚染ページとAIの推薦 12のAIすべてが架空ブランドを薦めた(平均42.7%)
生成検索とシャドーバンの法学論考 流入の減少を米国法の論点から論じる。実測なし
目立つ発信者と引用 順位表の上位10人ほど引用で有利(2つのAIの画面)
健康の質問でのGoogleとBaiduのAI要約 日本から日本語で聞くと.jpの出典が約3.5倍
商品情報に仕込んだ文字列 公開AIで架空の商品の推薦1位が入れ替わった
ページに仕込んだ指示と紹介順(EMNLP 2024) 4つのAIとAPIモデルで紹介順が上がった
見つかりにくい文字列(ICML 2026ワークショップ) 宣伝語を避けつつ4つの公開AIで順位が上がった
順位づけの盲点(EMNLP 2025) 文書に仕込んだ指示で順位づけの判断が乗っ取られた
自然に見える短い文字列(ACL 2026) 4つの公開AIで平均順位が想定値より上位に
要約に選ばれる説明文 AIの偏りを突く書き換えで選ばれる割合0.37→0.83(条件つき)
マルチモーダル順位操作(ACL 2026ワークショップ) 画像と説明文の同時加工で商品順位が平均2.25位分上昇
口コミ風の文章とおすすめ順 商用AI4つで最下位の商品が1位に来た割合が8割前後
順位操作の8手法の比較 書き換えだけの手法が5データ中3つで勾配攻撃と同等以上
仕込んだ指示は回答まで届くか 3段に通すと指示型の攻撃は回答到達約15%に低下
調べものAIと汚染された根拠 裏づけを装う汚染ほど見抜きの点数が低下(10モデル)
文書同士の似かたで外す防御(EMNLP 2025) 2つのデータで攻撃の成功率を1割未満に
商品説明の順位操作の検出 既知の手口は大半を検出、新しい手口5種類は見抜けず
汚染された根拠と事実確認 どの汚染にも強い集約方式はなかった(638件)
誤情報を載せたGEOへの防御(EMNLP 2026採択と記載) 既製フィルターはほぼ効かず、専用検出器で相対47.6%減
根拠のつながりと推薦 連携した複数ページで推薦率が最大31.3ポイント高い(管理環境)
ページ1枚の書き換えとおすすめ1位 124回中62回で1位が入れ替わった(実サービスでは未検証)
繰り返す囚人のジレンマ(ICML 2026ワークショップ) 防御を強めても攻撃が減らない条件を理論で示した
引用の奪い合いを共存に変える仕組み 確かめられる事実に加点する仕組みを提案(模擬実験)
AIの要約と作り手の意欲 引用と支払いの設計で長期の利益が改善しうる(理論と試算)
確信度の減衰と専門AIへの引き継ぎ 見え方は時間で薄れると主張(実験データなし)
GEOが生む3つのリスク(ICML 2026 立場論文) 回答単位の開示と外部監査を提案
AIが読めるサイトと推薦 読める群は明確な推薦が20.4%対10.6%(著者の所属企業の物差し、英語中心)
会話全体でGEOを評価する枠組み(HAI 2026採択と記載) 早く引用された出典が引用され続ける現象を理論で定式化(実測なし)
4つのAI検索の引用URLの重なり URL528件のうち509件は1つのAI検索にしか出なかった(15問・1日)
BaiduとGoogleのAI要約の出典(EMNLP 2026ワークショップ採択と記載) 回答の意味は近くても、表示される出典の重なりは小さい(英語と中国語訳の500問)
新聞社サイト内のAI検索の実験 AIの回答で読者の共通の話題が増え、関心は人気の低い話題へも広がった(37,561人の無作為化実験、サイト内検索)
会話の文脈で回答はどれだけ変わるか 最後の質問だけで答えさせると44.7%が実質的に変わる(英語の会話180件、重みづけ後)

この記事に書いたことを、そのまま御社のページに

生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。

OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。

これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。

まず1ページ、無料で作らせてください

ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。

自社のマーケティング課題を根本から解決しませんか?

ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。

まず動画で詳しく見る(約30分)
無料診断を受ける

初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

LLMO論文
よかったらシェアしてね!
  • URLをコピーしました!
  • 【LLMO論文解説】生成AIの好みをAIに説明させてルール化する仕組み|AutoGEOは書き換えで目立ち方を最大50.99%上げた(ICLR 2026)
  • 【LLMO論文解説】AIが「説得力がある」と判断する証拠とは|関連性重視・文体はほぼ無視(ACL 2024)

この記事を書いた人

中野輝規のアバター 中野輝規

合同会社謙虚 代表社員。20代から、売る言葉だけを仕事にしてきました。電話営業で受話器を握っていた時代から、数千社のWEB集客に関わったいままで。詳しいプロフィールはこちら

この著者の記事一覧へ

関連記事

  • 調べものAIは汚染された根拠を見抜けるか「HAE-GEO」
    【LLMO論文解説】調べものAIは汚染された根拠を見抜けるか「HAE-GEO」|裏づけを装うほど見抜きにくい・10モデル(プレプリント)
  • AIに質問せずページを採点する指標は、引用されやすさを予測できるか
    【LLMO論文解説】AIに質問せずページを採点する指標は、引用されやすさを予測できるか|水増しへの強さと相関0.11の意味(プレプリント)
  • 「一番人気」は効き「残りわずか」は逆効果
    【LLMO論文解説】「一番人気」は効き「残りわずか」は逆効果|認知バイアス10種でAIの商品推薦はどう動くか(EMNLP 2025)
  • 生成検索は中小サイトの流入を奪うのか、法学の論考を原文で読む
    【LLMO論文解説】生成検索は中小サイトの流入を奪うのか、法学の論考を原文で読む|シャドーバンの意味も確認(法学誌・2025年)
  • 通販専用のGEO試験環境
    【LLMO論文解説】通販専用のGEO試験環境|15の経験則のうち効果があったのは4つだけ(プレプリント、2025年11月)
  • 戦略と評価役を、AIが自分で育て続ける仕組み
    【LLMO論文解説】戦略と評価役を、AIが自分で育て続ける仕組み|AgenticGEOは14手法に勝ち、少ないフィードバックで学習(プレプリント、2026年3月)
  • AI検索で「出典に出た」と「答えを変えた」を分けて測る
    【LLMO論文解説】AI検索で「出典に出た」と「答えを変えた」を分けて測る|CC-GSEO-Bench(プレプリント)
  • GEO対策済みページを見分ける検出器の精度と弱点
    【LLMO論文解説】GEO対策済みページを見分ける検出器の精度と弱点|実サイトの8.90%で検出(プレプリント)
最近の投稿
  • 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方
  • デザイナーの集客は作品集だけでは届かない 発注担当が社内で通せるサイトの作り方
  • 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方
  • 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方
  • 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方
最近のコメント
  • ホテルの集客は公式サイトで迷わせないことから 予約サイト頼みを抜ける直し方 に 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方 - 合同会社謙虚 より
  • 不用品回収の集客は料金の見せ方で決まる 当日の追加請求を疑われない業者のサイトの作り方 に 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方 - 合同会社謙虚 より
  • 【LLMO論文解説】回答が似ていても出典は重ならない|BaiduとGoogleのAI要約を英語と中国語の500問で監査(EMNLP 2026ワークショップ) に 【LLMO論文解説】海外のGEO・LLMO・AIO論文101本の一覧|原論文から最新研究まで、テーマ別に整理(随時更新) - 合同会社謙虚 より
  • 記事制作(KCW)
  • 売れるサイトはみな謙虚
  • サービス一覧
  • サイトの無料診断
  • 合同会社謙虚とは
  • 代表プロフィール
  • ブログ
  • お問い合わせ
  • プライバシーポリシー
  • 特定商取引法に基づく表記

© 合同会社謙虚

目次