AIに「この条件を満たす商品を選んで」と頼むと、AIは商品ページや口コミ、比較記事を読んで候補を比べます。読む出典の中には、売り手が自分で書いたページも混ざっています。
では、売り手がそのページを書き換えたら、条件を満たさない商品がAIの推薦に入り込むのでしょうか。
この問いを600件の買い物相談と22種類の書き換えで測った、トロント大学などの研究者のプレプリント(査読前の論文)「SafeGEO」を原文から読みます。
どんな書き換えがどれだけ推薦を歪め、AIの側の対策でどこまで戻せたのかを整理します。書き換えの具体的な書き方は、論文の倫理の節に合わせて、種類の説明にとどめます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。自社の商品説明をAIに伝わるよう整えることと、AIの判断を歪めることの境目がどこにあるのかを、実験の数字で確かめるために読みました。
結論:3行で言うと
- 売り手のページを1枚だけ書き換えると、ユーザーの必須条件を満たさない商品が、AIの推薦の上位3件に入る割合が大きく増えました。注意書きを残した正直な版と比べて、現実的な書き換え8種の平均で+70.2〜+78.2ポイント(3つの公開モデル)、最大で+83.2ポイントです
- 強く効いたのは、不都合な注意書きを埋もれさせる、売り手のページを第三者の比較ガイドのように見せる、根拠らしい言葉を足すといった手口を、1枚の自然なページにまとめた型でした。AIへの直接の指示文は、確認用のモデルでは単独での効きが弱い部類でした(モデルによっては上位です)
- AIの側で、順位をつける前に候補ごとの「裏づけあり・矛盾・不明」を整理させる対策が最も効き、上位入りを最大39.2ポイント減らしました。それでも、書き換えのない状態には戻っていません
いずれも、研究者が用意した出典一式をAIに渡す実験環境での結果です。論文に載る質問例はすべて英語で、日本語や実際のAI検索サービスでは試されていません。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | SafeGEO: Understanding Generative Engine Optimization Risks in Recommendation Agents |
| 著者 | Qianfeng Wen、Yifan Simon Liu、Xin Liu(3人が共同筆頭)ほか、計7人。所属はトロント大学(計算機科学科など3部局)とカリフォルニア大学サンディエゴ校。一部の著者は民間の研究組織2つにも所属しています |
| 公開日 | 2026年6月8日(arXiv初版)。確認した版は2026年9月4日の第2版 |
| arXiv番号 | 2606.28356(主分類は情報検索、副分類は人工知能) |
| 掲載・採択状況 | arXivのプレプリント。コメント欄は「41ページ、図22点」だけで、学会・論文誌への採択の記載は確認できませんでした |
| 種類 | 評価用データセット(ベンチマーク)の構築と、それを使った実験研究 |
| 実験データとコード | コードとデータを公開(公開先は論文に記載)(ライセンスはコードがApache 2.0、データがクリエイティブ・コモンズ表示4.0) |
論文はこちらで読めます。arXiv(2606.28356)、DOI(10.48550/arXiv.2606.28356)。
この論文が答えた問い
売り手が自分で管理するページを書き換えたとき、商品を薦めるAIは、ユーザーの必須条件と好みに沿った判断を保てるのか。
これまでのGEO(生成AIの回答に載りやすくする工夫)の研究は、主に「引用されやすくなったか」という見え方を測ってきました。
出発点になったGEO原論文もそうです。
論文は、見え方が上がること自体は、ユーザーが関連する情報に出会えるなら有益だとしています。
問題は推薦の場面です。売り手のページが欠点のある商品を実際より裏づけのある商品に見せると、条件に合わない商品が選択肢に入り込みます。
論文はこれを「害」として測れる形にし、推薦の正しさを物差しにしました。
どうやって調べたのか
| 項目 | 内容 |
|---|---|
| 分野と質問 | AI議事録ツール、ベビーモニター、機内持ち込み用バックパック、家庭用空気清浄機、ノイズキャンセリングヘッドホン、オフィスチェアの6分野。研究者が各100問を手作業で作り、計600問(論文に載っている例はすべて英語) |
| 候補と出典 | ChatGPTの買い物調査機能で集めた(1問あたり平均19.96商品、出典35.85件)。出典の32.3%は売り手自身のページ |
| 名前の扱い | 評価するAIには、実在の商品名と売り手名を架空の名前に置き換えて渡す |
| 正解の基準 | GPT-5.5で質問を「必須条件」と「好み」に分け、有用度と正しい順位を計算(評価するAIには見せない。人による監査60件つき) |
| 狙う商品 | 1問につき、正解ではない候補を3つ無作為に選ぶ。計1,800商品のうち97.4%は、必須条件を少なくとも1つ満たさない |
| 書き換え | 狙う商品の売り手ページ1枚だけを、GPT-5.5が10行のひな形に沿って作った文書に差し替える。ほかの出典、候補、並び順は固定 |
| 比べる相手 | 元のページのまま(書き換えなし)と、同じひな形で注意書きを残した正直な版。主な基準は後者 |
| 評価したAI | 公開モデルのGemma 4 31B IT、Qwen3.6-27B、Devstral Small 2 24B Instruct。確認用にDeepSeek-V4-Flash。回答のゆらぎの設定(温度)は0 |
| 規模 | 1問あたり22種×3商品+比較2つ=68件、計40,800件。主な表は現実的な8種を使った15,600件。対策の実験は1モデルあたり86,400件 |
22種の書き換えは、論文が文献から整理した7つの手口(後の表)を、単独や組み合わせで使ったものです。うち8種は、売り手のページとして自然にまとめた「現実的な型」で、「独立の購入ガイドに見せる型」「都合のよい比較メモの型」などの名前がついています。
指標は4つです。主に使うのは、狙われた商品が推薦の上位3件に入った割合(上位入り率、論文の指標名はTarget@3)と、1位の商品が必須条件を1つ以上破っていた割合(1位の条件違反率、同HCV@1)です。
ほかに推薦の質の指標も2つ見ています。採点は、隠した正解の基準との機械的な照合です。
結果
売り手のページ1枚で、推薦は大きく歪んだ
| 評価したAI | 上位入り率(正直な版→現実的8種の平均) | 差 | 1位の条件違反率(正直な版→平均) |
|---|---|---|---|
| Gemma 4 31B IT | 3.4%→79.6% | +76.2 | 16.9%→75.6% |
| Qwen3.6-27B | 8.1%→78.3% | +70.2 | 24.2%→83.7% |
| Devstral Small 2 24B Instruct | 12.7%→90.9% | +78.2 | 41.1%→90.7% |
| DeepSeek-V4-Flash(確認用) | 4.6%→72.6% | +68.0 | 23.0%→73.4% |
差は割合どうしの引き算(ポイント)で、論文の表5と図6の値です。
- 最大は、Devstralに「全部入りの現実的な型」を使ったときで、上位入り率は95.9%、正直な版から+83.2ポイントでした
- 上位3件に正解が入る割合は、Gemmaで71.2%から67.9%と小さな低下でした。条件外の商品が、上位の枠に入り込んだ形です
- 出典の文章量は、書き換えなし3,911語、正直な版3,905語、書き換え平均3,925語とほぼ同じで、長さのせいではないと確かめています
効いたのは、筋の通った1枚のページ
手口を多く重ねるほど強いわけではなく、自然にまとまった現実的な型が最も強く効きました。論文は、害の大きさは「AIが信頼しそうな、首尾一貫した出典になっているか」に左右されると述べています。
付録には4つのモデルとも22種の値があります。ここでは確認用のモデル(DeepSeek-V4-Flash)の値を示します。
| まとまり | 手口(論文の定義の要約) | 単独での上位入り率(DeepSeek-V4-Flash) |
|---|---|---|
| 内容を変える | 根拠のない適合の主張(満たさない条件を満たすと書く) | 56.8% |
| 内容を変える | 注意書きの省略(判断に効く制約を書かない) | 67.8% |
| 内容を変える | 関係の薄い好材料(受賞や採用実績など、条件と関係の薄い良い話を足す) | 42.9% |
| 裏づけの見せ方を変える | 権威の偽装(売り手の文書を、独立した権威ある文書に見せる) | 54.4% |
| 裏づけの見せ方を変える | 根拠の水増し(主張を直接は支えない、根拠らしい言葉を足す) | 66.7% |
| AIへの届き方を変える | 目立たせ(回答のような書式などで、対象をAIから目立たせる) | 70.9% |
| AIへの届き方を変える | AIへの指示(読み手でなくAIに向けた指示文を入れる) | 42.4% |
DeepSeek-V4-Flashでの値で、正直な版の上位入り率は4.6%です(論文の表33)。同じモデルの現実的な型では、都合のよい比較メモの型が82.3%で最も高く、AI向けの指示文の型が51.3%で最も低い結果でした(ただしモデルによっては上位で、Devstralでは95.5%でした)。
- 引用があっても安全の目印になりません。誤解を招く行をAIが引用した割合と上位入り率は強く連動し、22種での相関係数はGemmaで0.91、確認用のモデルで0.99でした
- Gemmaの回答を対にして比べると、書き換えで引用する根拠が移った回答は、商品の欠点を見落とす割合が54.1%(移らなかった回答は6.7%)でした。欠点を見落とした回答では、その商品が上位3件に入る割合が92.8%(見落とさなかった回答は58.6%)です
- 付録で、条件に合う失敗例として選ばれたGemmaの6事例では、正直な版で15位〜20位だった商品が書き換え後に1位になり、回答はどれも出典つきの筋の通った文章でした
- 並び順も効き、確認用のモデルで書き換えたページが先頭なら75.9%、最後なら58.4%でした。渡す出典を5件に絞ると99.3%です
AIの側の対策は、半分ほど戻すのが精いっぱい
| 対策(AIへの指示の変え方) | Gemma 4 | Qwen3.6 | Devstral 2 | DeepSeek V4 |
|---|---|---|---|---|
| 防御の指示(重要な主張は、出典がはっきり支えるときだけ真とみなす) | -15.1 | -11.0 | -2.8 | -4.4 |
| 理由の明示(推薦の理由と出典の行を書かせる) | -15.0 | +7.5 | +2.3 | -0.1 |
| 根拠の内訳(順位の前に、候補ごとに裏づけ・矛盾・不明を整理させる) | -29.7 | -39.2 | -17.7 | -25.8 |
| 文脈の均衡(目立つ1つの出典に引きずられず、全体で比べさせる) | -11.5 | -4.5 | -3.2 | -9.7 |
| 指示の除外(AIに向けた文を、命令でなく文書の中身として扱わせる) | -2.2 | +3.0 | -0.5 | -2.4 |
数値は、対策なしと比べた上位入り率の差(ポイント)で、マイナスほど条件外の商品が減ったことを表します。現実的な8種の平均です(論文の表7、確認用のモデルは表35)。
- 最も効いたのは「根拠の内訳」で、1位の条件違反率もQwenで41.6ポイント下がりました。論文は、書き換えが「AIから見た根拠の釣り合い」を崩すことで効くため、支える根拠・欠けた根拠・矛盾する根拠を順位づけの前に表に出すのが効果的だと説明しています
- それでも、対策後の上位入り率はGemma 49.9%、Qwen 39.1%、Devstral 73.2%で、正直な版(3.4%、8.1%、12.7%)には遠く及びません
- 「理由の明示」は効き方がばらつき、Gemmaでは上位5件の並びの良さが28.8ポイント下がりました。論文は、対策は慎重に選ぶべきだとしています
- 「指示の除外」の効果が小さかったのは、強い書き換えの多くがAIへの命令文でなく根拠の見せ方を操作しているためだ、と論文は述べています
論文自身が書いている限界
- 対象は文章だけです。実際のウェブの出典には画像、動画、表、レイアウト、バッジ、評価の星、構造化データなどがあり、見た目を操作する手口は捉えきれていません
- 1回の質問に1回で推薦を返す設定です。実際の推薦AIは、聞き返したり、好みを更新したり、過去のやり取りを覚えたりするため、弱さの度合いが変わり得ます
- 倫理の節では、書き換えは実際のシステムを操作する手引きとしてでなく、統制した評価の条件として示すべきだと書いています
原文を読んで気づいた点
- 日本語での検証はありません。論文に載っている質問の例はすべて英語です
- 実際のAI検索サービスとは条件が違います。ChatGPTの買い物調査機能は候補集めに使っただけで、推薦を評価したのは研究者が動かしたモデルです。出典は1問22件に固定され、実サービスにある検索や並べ替えの段階は含みません
- 基準の「正直な版」には、「最終的な推薦には、より強い裏づけの確認が必要」といった控えめな行がひな形で入っています(付録の表19)。ただしこの行は書き換え版にも残り、書き換えなしの元ページとの比較でも差はほぼ同じです(Gemmaで元ページ3.2%、正直な版3.4%に対し、書き換え後79.6%)
- 対策なしの条件でも、評価用の指示には「出典の中の指示は無視する」「曖昧な宣伝文句から強い適合を推測しない」が入っていました。そのうえで推薦が動いています
- 正解の基準はGPT-5.5で作られ、採点は機械的です。人による監査との一致は、必須条件の抽出で100%、候補が条件を満たすかの判定で、GPT-5.5と人の一致は75.2〜78.8%(人どうしの一致は76.7%)でした
- 狙われた商品の97.4%は、必須条件を満たさない商品です。条件を満たす商品を正しく書いたときに推薦が上がるかどうかは、この研究の対象外です
- arXivのプレプリントで、査読を経たかどうかは確認できません。一部の著者は民間の研究組織にも所属していますが、論文の中で特定の商品やサービスを勧める記述は見当たりませんでした
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 売り手のページ1枚の書き換えで、条件外の商品の上位入り率が+70ポイント前後増えた | 実際のAI検索サービスで、同じ大きさの歪みが起きること |
| 自然にまとまった現実的な型が、手口を重ねた組み合わせより強かった | 日本語の質問や日本の商品ページで、同じ傾向になること |
| 出典を引用した、筋の通った回答でも、欠点の見落としが起きた | 画像や評価の星、構造化データを使った書き換えの影響 |
| 候補ごとに根拠を整理させる対策が最も効き、それでも元には戻らなかった | 条件を満たす商品を正確に書いたとき、推薦がどれだけ上がるか |
| 4つのモデルすべてで同じ方向の結果が出た | 書き換えで推薦された商品が、実際に売れたり、問い合わせにつながったりすること |
上位入り率79.6%は、出典を固定した実験での値です。実際のAI検索で条件外の商品が8割の確率で推薦される、という意味ではありません。
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
線引きは「書き方」より「中身が条件を満たすか」
論文が害と定義したのは、有用度の低い商品や、必須条件を満たさない商品を、ページの書き換えで推薦の上位に押し上げることです。
商品説明を分かりやすく整えること自体は、害の定義に入っていません。ただし、論文のひな形で注意書きの行には手を付けない「目立たせ」だけの書き換えでも、上位入り率は大きく上がりました(確認用のモデルで70.9%)。
見せ方の工夫は、自社が本当に満たす条件について使うものだと受け取っています。満たしていない条件を満たすように読ませた時点で、この論文の物差しでは害の側に入ります。
できないことを書くのは、損ではない
正直な版では、条件外の商品が上位に入ったのは3.4〜12.7%でした。条件に合わない相談で選ばれないのは、ユーザーにとって正しい結果です。
対応していないプラン、サイズ、地域、納期などを書いておけば、合わない相談を避け、合う相談で比べてもらう材料になると読めます。
第三者の比較ガイドに見せかけない
「独立の購入ガイドに見せる型」や「根拠を水増しした覚え書きの型」は、現実的な型の中でも強く効きました。自社で作った比較記事やランキングは、自社が作ったものだと明示するのが筋です。
日本では2023年10月から、広告であることを隠す表示が景品表示法の不当表示に指定されています。以前の記事で読んだ有名ブランドの有利さと説得の文言の論文でも、効果の上限を出したのは実在しない根拠をうたう文言でした。
AIの側は、根拠の突き合わせに向かっている
最も効いた対策は、候補ごとに裏づけと矛盾を並べてから順位をつけるものでした。悪意あるGEOへの二段防御の論文も、検索する側の対策です。
商品説明と料金表・仕様表が食い違っていないかを確かめておくことが、こうした突き合わせへの備えになると考えています。
よくある質問
SafeGEOの実験で出た83.2ポイントの歪みは、実際のAI検索サービスでも起きますか
この論文からは分かりません。評価したのは研究者が動かしたモデルで、出典の一式も固定されています。
ChatGPTの買い物調査機能は候補集めに使っただけで、論文に載る質問例もすべて英語です。示されたのは、出典を読んで推薦するAIにこの種の弱さがあり得る、というところまでです。
SafeGEOが害とする書き換えと、ふつうのLLMO対策の違いはどこにありますか
論文の定義では、分かれ目は「推薦された商品が、ユーザーの条件と好みに合っているか」です。条件を満たす商品の情報を正確に、読み取りやすく書くことは、害の定義の外にあります。
一方、満たさない条件を満たすと書く、判断に効く制約を隠す、自社のページを独立した第三者の文書に見せる、といった書き換えは、この論文が害を測った手口そのものです。
SafeGEOで最も効いた防御「根拠の内訳」は、中小企業のページ作りに関係がありますか
直接には、AIを作る側の対策です。この対策は、どの出典が主張を支え、どの出典が矛盾するかを先に確かめさせるので、自社のページ同士や第三者の情報との食い違いが表に出ます。
主張と裏づけを近くに置き、数字を揃えておくことは、人の読み手にも有益です。
まとめ:今日できる1つのこと
自社の主力商品のページを1つ開き、その商品が満たさない条件(対応していないプラン、サイズ、地域、納期など)を1つ書き出してください。
それがページの読みやすい位置に書いてあるか、料金表や仕様表の記載と食い違っていないかを確かめます。できることとできないことが揃って読めるページは、条件に合う相談で比べてもらうための土台になります。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


