Amazonは2024年にAI搭載の買い物アシスタントを打ち出し、ほかの通販サイトも会話型の商品案内を追いかけています。
検索窓にキーワードを打ち込むのではなく、AIに条件を伝えて商品を選んでもらう場面が増えているということです。この「AIによる商品案内」で目立つには、どんな書き方が効くのでしょうか。
2025年11月に公開された論文「E-GEO: A Testbed for Generative Engine Optimization in E-Commerce」は、通販(EC)専用の実験環境を作って、この問いに答えようとした研究です。
この記事は、その論文を原文(PDF)から通読し、要点を整理します。論文は、よく言われる15の経験則(ヒューリスティック)を実際に試し、そのうち4つしか基準を上回らなかったと報告しています。
数値はすべて論文の表と本文から拾い、私が計算し直した値には「概算」と付けています。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文は、記事や情報ページとは別の「商品説明」という文章で、同じ問いをどう検証したかを示しており、業種によって効く書き方が変わるかどうかを考えるうえで参考になります。
結論:3行で言うと
- 通販の商品説明を対象に、よく言われる15の書き換え方(経験則)を試したところ、基準(何も工夫しない一文の指示)を上回ったのは4つだけで、残り11は基準を下回りました。なかには大きく順位を下げたものもあります
- 経験則を1つずつ手作業で選ぶより、AIに書き換えのやり方そのものを最適化させたほうが、一貫して順位が上がりました。しかも出発点が違っても、最適化後の書き方は同じような型に収束しました
- 「誤解を招く記述を後回しにする」という簡単な防御を1行加えるだけで、露骨な操作は割に合わなくなりました。この設定では、順位を上げる近道は事実に基づいた内容の改善だったと論文は述べています
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | E-GEO: A Testbed for Generative Engine Optimization in E-Commerce |
| 著者 | Puneet S. Bagga、Vivek F. Farias、Tamar Korkotashvili(マサチューセッツ工科大学)、Tianyi Peng、Yuhang Wu(コロンビア大学ビジネススクール)。5人 |
| 公開日 | 2025年11月25日(初版v1)。確認した版は2026年7月14日改訂のv2 |
| arXiv番号 | 2511.20867(分野はcs.IR、情報検索) |
| 掲載・採択状況 | arXivのプレプリント。要旨ページに学会や査読誌への採択を示す記載はなく、確認した範囲では査読を経ていません |
| 種類 | 通販(EC)向けGEOの実験用データセットと、それを使った実証研究 |
| 実験データ/コードの公開先 | プロジェクトサイト(e-geo.netlify.app)、GitHub(psbagga17/E-GEO)、Hugging Face(psbagga17/E-GEO) |
論文はこちらで読めます。arXiv(2511.20867)、DOI。
この論文が答えた問い
通販の商品説明を、AIに好まれるように書き換える経験則は、本当に効くのか。それとも、経験則に頼らずに書き換え方そのものを最適化するほうが優れているのか。
ウェブページ向けのGEO(生成エンジン最適化)を初めて調べた原論文は、「回答の中でそのページの文がどれだけの割合を占めたか」という指標を使いました。
目立ち方は示せても、売上や成約に直結する数字ではありません。一方、通販の商品案内では、ものさしがはっきりしています。
AIが示す候補一覧の中で、その商品が何番目に置かれるかです。順位が1つ上がれば、クリックや購入につながりやすくなります。
論文はこの点を捉え、通販という具体的な業種に絞ってGEOを検証しました。
どうやって調べたのか
論文はまず、通販向けのAI商品案内を、「検索で候補を絞り込む段階」と「AIが候補を並べ替えて答える段階」に分けます。今回の実験が対象にしているのは後者だけで、前者(そもそも候補に入るかどうか)は固定されています。
E-GEOデータセット
論文は、通販向けの評価用データがなかったことから、E-GEOという新しいデータセットを作りました。r/BuyItForLifeという「長く使える良い商品」を語り合うRedditのコミュニティから、購入の意図がはっきりした投稿を選び、買い物アシスタントへの相談文の形に書き直しています。
1つの質問には、Amazonの商品データ(Amazon Reviews 2023、約17,046,457点)から検索で絞り込んだ10件の商品を組み合わせました。
合計13,747件の質問(うち2,000件をテスト用に固定)を収録しています。
データの質は、100件を人手で確認しています。質問として成立しているか、10件のうち少なくとも1件は本当に合っているか、という2項目はいずれも100%が「はい」でした。
10件中いくつが本当に関連しているかは平均8.81件、書き換えた質問の自然さ(5段階)は平均4.30でした。
| データセット | 質問数 | 質問の平均語数 |
|---|---|---|
| WANDS | 480 | 3.30語(単語での指定) |
| ESCI-US | 97,345 | 3.45語(単語での指定) |
| Papenmeier他(2021) | 3,481 | 33.19語 |
| E-GEO(この論文) | 13,747 | 58.83語 |
既存の通販向けデータは「白い革の椅子」のような単語の指定が中心でした。E-GEOは「予算はこのくらいで、過去に買ったものはすぐ壊れた」といった、会話形式の長い相談文を集めている点が特徴です。
実験の仕組み
AIによる商品案内を、5つの実在モデル(GPT-5、Claude Sonnet 4.5、Gemini 3 Flash Preview、DeepSeek V3.2、Llama 4 Maverick)で再現しました。
実際のチャットボットに近いシステムプロンプトを与え、10件の候補を並べ替えさせます。効果は「順位改善」(書き換え前の順位から書き換え後の順位を引いた値、範囲-9〜+9)で測ります。
書き換え役のAIは、まず7種類を一文の指示(「AIがより上位に置きたくなるよう、商品説明を最適化してください」)だけで比べました。次に、書き換え役をGPT-4.1に固定して、15種類の経験則的な指示文と、AIに指示文そのものを改善させる最適化の手法を試しています。
結果
一文の指示だけでも、書き換え役次第で差が出た
同じ一文の指示でも、どのAIに書き換えさせるかで結果は割れました。5つの判定役全体の平均は、GPT-5とClaude Sonnet 4.5が+0.56・+0.57と大きく伸びた一方、GPT-4o-miniは-0.36、GPT-4.1も-0.03とわずかに沈みました。
長い説明文にしただけでは伸びず、書き換え前後の語数の変化と順位改善の相関はほぼゼロだったと論文は報告しています。
15の経験則のうち、基準を上回ったのは4つだけ
書き換え役をGPT-4.1に固定し、15種類の経験則を比べた結果です。基準は、工夫なしの一文の指示(-0.03)です。
| 経験則 | 指示の内容 | 平均順位改善 |
|---|---|---|
| AIの出力に似た書式にする(trick) | AIが書いたような書式に整える | +0.14 |
| よくある質問を足す(FAQ) | FAQ形式を追加する | +0.05 |
| 独自の強みを示す(competitive) | 他より優れている点を強調する | +0.03 |
| 見出しと箇条書きにする(format) | 見出しと箇条書きを使う | +0.02 |
| 品質を強調する(quality) | 製品の品質を強調する | -0.13 |
| 専門用語を使う(technical) | 専門的な用語を使う | -0.16 |
| 多様性を反映する(diverse) | 多様な視点を反映する | -0.19 |
| 流れを良くする(fluent) | 文章の言語的な流れを改善する | -0.19 |
| 珍しい語を使う(unique) | 珍しい語彙を使う | -0.27 |
| 説得力を強める(clickable) | 説得力があり魅力的な文章にする | -0.62 |
| 自信満々な文体(authoritative) | 自信に満ちた断定的な文体にする | -0.64 |
| 一文に凝縮する(minimalist) | 説明を一文に縮める | -1.49 |
| 外国語表現を使う(language) | 外国語の表現を交ぜる | -1.66 |
| 広告調にする(advertisement) | 広告のような文体にする | -1.82 |
| 物語調で書く(storytelling、あえての悪条件) | 創作の短い物語として書く | -4.36 |
- 基準を上回るか同程度だったのは、15件中4件(AIの出力に似た書式にする・よくある質問を足す・独自の強みを示す・見出しと箇条書きにする)でした
- 残り11件は基準を下回り、なかでも広告調・外国語表現・一文への圧縮は、-1.5前後まで大きく沈みました
- 物語調は、あえて悪い結果を想定して入れた比較用の指示で、-4.36と最も低くなりました
- 論文は、経験則に頼った手作業の書き換えは裏目に出ることがあり、体系立てた最適化のほうが要ると結論づけています
最適化させると、経験則を上回った
次に論文は、15の経験則を出発点として、AI自身に指示文を書き直させる仕組みを試しました。現在の指示文の成績を別のAIに見せ、弱い判定役を底上げする方向で指示文を改善させ、これを繰り返す方法です。
| 経験則(出発点) | 最適化前(平均) | 最適化後(平均、概算) |
|---|---|---|
| 独自の強みを示す(competitive) | +0.03 | 約+0.26 |
| 珍しい語を使う(unique) | -0.27 | 約+0.29 |
| 一文に凝縮する(minimalist) | -1.49 | 約-0.42(それでも改善) |
| 物語調で書く(storytelling) | -4.36 | 約-0.25 |
15の経験則×5つの判定役で作った75通りのうち、63通りで最適化後の値が改善し、55通りは+0.10以上の伸びでした。
悪化したのは7通りだけです。最も苦戦していた物語調でさえ、絶対値ではまだマイナスながら、判定役によっては+3.85〜+4.59改善しました。
最適化後に最も高かった「珍しい語を使う」(平均+0.29)は、書き換え役のGPT-4.1を、判定役のGeminiと肩を並べる水準まで引き上げています。
最適化には使っていないClaudeでも、15件中13件が経験則の初期値より改善しました。
出発点が違っても、同じ型に収束した
興味深いのは、広告調から物語調まで、まったく違う15の出発点から最適化を始めても、行き着く先が似た型になったことです。論文は、最適化後の指示文を10個の特徴(検索・推薦での目標の明示、ユーザーの意図への一致、キーワードと類語、見出しと箇条書き、よくある質問への回答、事実の保持、など)で採点し、ほとんど何も共有していなかった最初の15個に対し、最適化後は共通の型を備えるようになったと報告しています。
文章を埋め込みベクトルに変換して距離を測る分析でも、最適化が進むほど15個の指示文が互いに近づき、数バッチで頭打ちになりました。
論文はこれを「万能に効く戦略」の存在を示す証拠として扱っています。
操作ではなく、内容の改善で伸びていた
最後に論文は、この仕組みが単なる操作で伸びていないかを確かめています。判定役への指示に「誤解を招く記述は後ろに回してください」という1行を足したうえで、隠し命令・偽のレビュー・誇大な保証などを含む14種類の悪質な書き換えを試しました。
結果は、順位が大きく上がるほど「疑わしい」と判定される率も上がる、はっきりした相関でした。GPT-5とClaude Sonnet 4.5は、疑わしいと判定されない範囲では順位もほとんど動かず、防御が強く働いていました。
さらに、「疑わしいと判定されずに順位を上げる」ことを狙った最適化(レッドチーム)も試しています。誇大な文体や感情に訴える文体を出発点にしたところ、20通りの平均で疑わしいと判定される率が60ポイント下がり、順位改善は平均+2.2上がりました(誇大な文体はGPT-5で-4.14から+0.52まで回復)。
ただし、最適化後の指示文の中身は、いずれも「誇張を避ける」「中立で信頼できる文体にする」という、通常の最適化と同じ非操作的な書き方に行き着いていました。
論文は、この単純な防御のもとでは、順位を上げる近道は事実に基づいた内容の改善であり、派手な操作ではないと結論づけています。
論文自身が書いている限界
- データの範囲: 質問はすべて英語で、r/BuyItForLifeという特定コミュニティに由来するため、北米中心・耐久性の高い商品カテゴリに偏っています。商品もAmazon Reviews 2023の商品だけで、Amazonの商品説明の書き方が前提になっています
- 検索段階は固定: 候補の10件を絞り込む検索の仕組み(埋め込みモデルと関連度判定用のAI)は固定されています。この2つの癖が、そのまま結果に乗っている可能性があり、論文自身も数値をこの検索の仕組みを前提にした条件つきの値として扱うべきだと述べています
ここからは、原文を読んで気づいた点です。
- 査読の有無: arXivのプレプリントで、要旨ページに学会や査読誌への掲載を示す記載は見当たりませんでした。2025年11月の初版から2026年7月のv2まで、査読を経たという情報は確認できていません
- 評価はすべて自動: 書き換えるAI、順位をつけるAI、疑わしさを判定するAIは、いずれも別のAIです。人が実際の商品説明として自然かどうかを確かめる評価は、データセットの品質確認(100件)以外には見当たりませんでした
- 検索で拾われるかどうかは対象外: この論文が測っているのは、すでに候補10件に入っている商品の並び替えだけです。そもそも検索の土俵に乗るかどうかは実験の外にあり、この限界はGEO原論文と共通しています
- 根拠が薄い数値が1つ: 「順位が1つ上がると、1商品あたり年間数万ドルの売上増につながる」という記述の出典は、査読を経た研究ではなく、マーケティング会社のブログ記事でした。この記事では、この数字は使いません
- 「業種に依存しない」という表現の範囲: 論文がいう「業種に依存しない(domain-agnostic)」戦略は、通販という同じ領域の中で、質問・商品・判定役のAIが変わっても同じ型に収束した、という意味です。通販以外の分野との比較ではありません。以前解説したAutoGEOの記事では、通販向けの経験則と調べもの向けの経験則の重なりが3〜4割程度にとどまったと報告されていました。この論文が通販に絞って実験を組んだこと自体、業種で効く書き方が変わるという見立てに沿っていると私は読みました
この論文から、言えること・言えないこと
| 言えること(この実験の設定で確認された) | 言えないこと(この実験では確認されていない) |
|---|---|
| 通販の商品説明では、経験則的な書き換えの多くが基準を下回った | 通販以外の分野(調べもの目的の質問など)でも同じ経験則が同じように効くこと |
| 体系立てた最適化は、経験則より一貫して順位を上げた | 実際のAmazonやChatGPTの商品案内で、同じ結果になること |
| 出発点が違っても、最適化後は似た型に収束した | 日本語の商品説明でも、同じ傾向になること |
| 簡単な防御のもとでは、露骨な操作は順位につながりにくかった | 最適化された書き方を採用すれば、実際の売上やクリックが増えること |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 「これをやれば良い」という経験則は、そのまま信じないほうがよさそうです。15件中11件が基準を下回ったので、思いつきで商品説明を書き換える前に、変更前と変更後を記録して比べる価値があります
- 効いた4つの経験則に共通していたのは、情報を整理して見せる工夫でした。逆に、広告調・外国語表現・一文への圧縮のような、内容を薄めて見せ方だけを変える工夫は、軒並み沈んでいます
- 最適化後に共通して現れた要素(利用者の意図に合わせる、キーワードと類語、見出しと箇条書き、よくある質問への回答、事実の保持)は、費用をかけた自動最適化なしでも、書き手が手作業で真似できる型です
- この論文の設定では、操作で伸ばそうとするより、事実に基づいて分かりやすく書いたほうが伸びていました。捏造や誇張に頼る発想は、少なくともこの実験の範囲では割に合っていません
よくある質問
E-GEOのデータセットは、どのように作られていますか
Reddit の r/BuyItForLife という、長く使える商品を語り合うコミュニティの投稿から、購入の意図がはっきりしたものを選び、買い物アシスタントへの相談文の形に書き直しています。
1つの質問に、Amazon Reviews 2023の商品データから絞り込んだ10件の商品を組み合わせ、合計13,747件を収録しています。
既存の通販向けデータが単語の指定(平均3〜33語)だったのに対し、E-GEOの質問は平均58.83語と長く、会話に近い形をしています。
E-GEOが調べた15の経験則のうち、効果があったものはどれですか
工夫なしの一文の指示(基準)を上回るか同程度だったのは、AIの出力に似た書式にする・よくある質問を足す・独自の強みを示す・見出しと箇条書きにする、の4つだけでした(前掲の表)。残り11は基準を下回り、あえて悪い結果を狙って入れた「物語調で書く」が想定どおり最も低い結果でした。
E-GEOのメタ最適化は、これまでのSEOと同じ話ですか
いいえ、キーワードを詰め込む従来のSEOとは別物です。メタ最適化は、AIに書き換えの指示文そのものを何度も書き直させ、判定役のAIの反応を見ながら改善する仕組みで、行き着いた先は、利用者の意図への言及・見出しと箇条書きによる構造化・よくある質問への回答・事実の保持を組み合わせた書き方でした。
まとめ:今日できる1つのこと
自社の商品説明を1つ選び、この論文で基準を上回った4つの型のうち1つ(見出しと箇条書きで整理する、または、よくある質問を1つ足す)を試してください。
変更前の文章を残しておき、AIの回答やクリックの変化を、後で見比べられるようにしておきます。この論文が示したのは、経験則を信じ込むより、変更を記録して比べることの大切さでした。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


