「画像しか持たないサービスは、生成AIが答えを作る時代にどう対応すればよいのか」。この問いに、大手の画像共有サービスの運営企業(以下、運営企業)が、自社の実装例で答えた論文があります。
2026年2月に公開された「Generative Engine Optimization: A VLM and Agent Framework for 〈運営企業名〉 Acquisition Growth」です。
原題の〈 〉の部分には運営企業の名前が入ります。
この記事は、その論文を原文から読み、何を作り、何を測り、どこまでが確かめられているのかを整理します。数値はすべて論文の本文・表から拾いました。
自分で計算した値には「概算」と書き添えています。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、大企業の「20%増」という数字が、実際にはどの実験の、どの比較を指しているのかを、自分たちの手で確かめておくためです。
結論:3行で言うと
- 運営企業は、画像に「写っているもの」ではなく「これを探す人は何と検索するか」を予測する言葉をAIで生成し、テーマ別ページとリンク構造にまとめる仕組みを、数億〜数十億枚規模の画像に本番投入しました
- 論文が掲げる看板の数字は「組織的トラフィックが20%増えた」ですが、この数字がどの実験・どの比較条件から来ているのか、原文を読んでも一本にたどれません
- これは運営企業自身による自社報告であり、外部の第三者による検証とは別のものです。査読を受けた学会・論文誌への掲載情報も、確認できた範囲では書かれていません
この記事の狙いは、効果を否定することではなく、数字の出どころを一緒に確認することです。「20%増えた」を自社の目標のように扱う前に、比較対象を押さえておく必要があります。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Generative Engine Optimization: A VLM and Agent Framework for 〈運営企業名〉 Acquisition Growth |
| 著者 | Zhang、Cheng、Wan、Singh、Rao、Boakye(6人。全員が運営企業の所属。筆頭著者はスタンフォード大学も併記) |
| 公開日 | 2026年2月3日(v1、初版のみ) |
| arXiv番号 | 2602.02961(分野はcs.AI、人工知能) |
| 掲載・採択状況 | 学会や査読誌への掲載を示す記載なし。arXiv発行のDOIのみで、査読済み媒体のDOIではありません |
| 種類 | 産業界による実装報告(運営企業自身の自社事例) |
| 実験データ・コードの公開先 | 記載なし。公開されているという文言は、確認できた範囲では書かれていません |
論文はこちらで読めます。arXiv(2602.02961)。
GEOという語の由来は、前に解説したGEO原論文にあります。
この論文が答えた問い
画像を大量に抱えるサービスは、AIが検索結果をまとめて答える時代に、どうすれば自社のコンテンツを見つけてもらえるのか。
論文が指摘する背景はこうです。文章のページなら、書かれた言葉がそのまま検索の手がかりになります。
ところが画像は、言葉を持たない情報です。従来のAIは画像に「ピンクのドレスを着た女性」のようなキャプションを付けてきましたが、これは見た目の説明であって、検索する人が実際に打ち込む言葉(例えば「ガーデンパーティーの服装アイデア」)とは一致しにくいものです。
論文はこの食い違いを「視覚コンテンツのGEO問題」と呼び、3つの技術的な壁を挙げています。画像から意味の合った検索語を作れるか、ばらばらの画像を1つのテーマにまとめられるか、まだ検索されていない話題を先回りできるか、の3つです。
どうやって作ったのか
論文が組んだ仕組みは、3段階に分かれています。
| 段階 | やること |
|---|---|
| 1. コンテンツの意味づけ | VLM(画像を読んで文章を生成するAIモデル)が、画像ごとに「探されそうな検索語」を作る。あわせてAIエージェント(自律的に情報を集めて判断するプログラム)が外部のトレンド情報を取り込み、まだ検索データのない新しい話題を先回りする |
| 2. テーマ別ページの生成 | 埋め込み表現(文章や画像を数値の列に変換したもの)と近似最近傍探索(似た特徴を持つデータを高速に探す技術)で、意味の近い画像を集めてテーマ別ページを作る |
| 3. 配信とリンク構造 | 生成した検索語を画像に注釈として付け、ふたつの塔(画像側と検索語側を別々に処理するモデル)でテーマ別ページへのリンクを組み、まとまりと権威性をAIに伝わりやすくする |
1段階目の中心が、VLMのファインチューニング(既存のAIモデルを、特定の目的に合わせて追加学習すること)です。ベースにしたのはQwen2-VL-7B-Instructというモデルで、LoRA(モデルの一部だけを効率よく再学習する手法)を使い、パラメータの99%以上を凍結したまま学習しています。
| 設定項目 | 値 |
|---|---|
| 学習方法 | LoRA |
| バッチサイズ | 2(1台あたり) |
| 勾配の蓄積 | 8ステップ |
| 学習率 | 2e-5(コサイン減衰) |
| 学習エポック数 | 1〜3 |
| 学習データ数 | 約10万件(評価用に5000〜1万件を分離) |
学習データの作り方も2段階です。まず、外部の検索コンソール(検索エンジンが提供する実績データ)から、実際に表示回数やクリック率の実績がある「検索語と画像の組」を抽出しました。
ただ、この方法だと元から成績の良い説明的な検索語ばかりに偏り、「使い道」を示す検索語は少数にとどまります。そこで2段階目として、GPT-4Vという別のAIを審判役にして、20万件の疑似データを作り、この偏りを補っています。
生成する検索語は、「対象の説明」3割、「見た目や特徴」3割、「使い道」4割という配分をねらっています。
評価は3つの方法を組み合わせています。1つ目は、生成した検索語と正解の単語の重なりを機械的に数えるROUGE-1という指標。
2つ目は、GPT-4oというAIに審判させる方法。3つ目は、人手による評価で、140枚の画像について3人の評価者が採点しました。
結果
生成した検索語の質
学習には使っていない1800件のデータで測った結果です。
| 検索語の種類 | ROUGE-1 F1 |
|---|---|
| 対象の説明 | 0.63 |
| 見た目や特徴 | 0.40 |
| 使い道 | 0.34 |
| 全体 | 0.46 |
説明的な検索語ほど数字が高く、使い道を示す検索語ほど低くなっています。論文はこれを、使い道の表現は言い回しの幅が広く、単語の一致では測りにくいためと説明しています。
GPT-4oによる採点と、人手による採点
GPT-4oに5つの観点(関連性・具体性・カテゴリ適合・多様性・網羅性)で採点させたところ、モデルの出力は正解データに対して約1〜2ポイント(最大で2.3ポイント程度)低い値でした。
論文自身は、この差の原因を、正解データにGPT-4oが作った疑似データが含まれていることによるGPT-4o自身の偏りだと説明しています。
これは私たちの読み取りですが、採点者と正解データの作り手が同じAIという、循環した構造になっているとも言えます。
より重みを置くべきは、140枚の画像を使った人手評価(3人の評価者)です。
| 指標(5段階) | VLM | 従来の本番システム |
|---|---|---|
| 関連性 | 4.47 | 3.28 |
| 多様性 | 3.43 | 3.54 |
| 使い道の的確さ | 4.15 | 2.21 |
| 生成した検索語の数 | 5 | 9 |
ここで、数字の食い違いに触れておきます。論文本文は「関連性が19%高い(4.47 対 3.28、p<0.01の対応ありt検定)」と書いています。
しかし4.47と3.28の差を単純に相対で計算すると、(4.47-3.28)÷3.28で約36%(概算)になり、本文の「19%」とは食い違います。
この19%という数字は、論文の冒頭でも「本番のシステムより19%、話題と検索語の一致度が改善した」という貢献の1つとして掲げられていますが、根拠になっている数字と計算結果が合わない状態です。
一方で、統計的な検定(p<0.01)が示されているのは、この論文の中でこの箇所だけです。多様性は従来システムがわずかに上回り、これは検索語の生成数が少ない分、幅広さで劣るためと論文は説明しています。
テーマ別ページの作り方(PinCLIP対SearchSAGE)
テーマ別ページに集める画像を選ぶ方法として、見た目の近さを重視するPinCLIPと、クリックや保存などの行動データを重視するSearchSAGEを比較しています。
| 指標 | PinCLIP | SearchSAGE |
|---|---|---|
| 意図との一致率(オフライン、AI判定) | 0.881 | 0.848 |
| 会員登録率(1か月のA/Bテスト) | 0.121% | 0.127% |
| ログイン率 | 0.365% | 0.361% |
| クリック率 | 1.61% | 1.66% |
意味の一致度ではPinCLIPが上回り、実際の登録・クリックという行動ではSearchSAGEが上回るという、ねじれた結果になりました。論文は、行動データを学習に使うSearchSAGEのほうが、実際の利用者の反応を捉えやすいためと読んでいます。
本番投入の効果(トラフィックへの影響)
4週間のA/Bテストで、注釈もリンクも無い状態(除外群)、従来のANN検索による注釈とリンク(対照群)、VLM生成の注釈と意図に沿ったリンク(有効群)の3条件を比較しています。
| 指標 | 除外群 | 対照群 | 有効群 |
|---|---|---|---|
| 利用者セッション数(倍率) | 0.82倍 | 1.0倍 | 1.18倍 |
| 生成AI経由トラフィックの倍率 | 0.04倍 | 1.0倍 | 9.2倍 |
この表にも、本文との食い違いがあります。論文本文は「注釈を付けるだけで、除外群に対して18%のトラフィック増」と書いていますが、表の0.82倍から1.0倍への変化を計算すると(1.0-0.82)÷0.82で約22%(概算)になり、本文の18%とは異なります。
対照群から有効群への変化(1.18-1.0)÷1.0=18%は、本文の記述と一致します。また「生成AI経由で9.2倍」という数字は、全体のセッション数が1.18倍にとどまることと比べると、桁が大きく違います。
これは、生成AIからの流入という一部のトラフィックだけを取り出した数字だからだと考えられますが、原文はその関係を明記していない状態です。
さらに、埋め込みとふたつの塔モデルを組み合わせた仕組みについて、本文は「対照群に対して20%の本番トラフィック増、商用VLM APIの94分の1のコスト」と述べ、表8を根拠として挙げています。
ところが表8に並ぶ数字は、近接表示+1.24%、クリック率+1.20%、検索+0.94%、リピン+1.10%、総セッション+1.20%、登録成功+0.83%、ログイン成功+1.83%と、いずれも1〜2%台にとどまります。
表8に並ぶ数字は、20%とは別の水準です。論文の看板である「20%増」は、要旨と結論の両方に書かれている中心的な数字ですが、それを直接裏づける表が見当たらない、というのがこの論文を読んで気づいた最も重要な点です。
論文自身が書いている限界
- 教師あり学習は、過去の検索実績データと人手の注釈に頼っており、新しく生まれる検索の傾向や、検索エンジン側のアルゴリズム変更には遅れて追いつく構造だと、論文自身が述べています
- 検索エンジンでの表示順位や引用のされ方は「ブラックボックス」であり、どの要素が実際に効果の原因なのかを切り分ける因果推論は、今後の課題として残されています
- GPT-4oによる自動評価では、正解データの一部がGPT-4o自身の生成物であるため、評価にAIが自分自身を有利に採点する偏りが生まれると、論文自身が認めています
原文を読んで気づいた点
- この論文の全著者が運営企業の社員であり、独立した第三者による検証とは異なります。査読を受けた学会・論文誌への掲載を示す記載も見当たらず、確認できた範囲ではarXivのプレプリントにとどまります
- 先述の通り、「19%」「18%」「20%」という3つの看板数字が、いずれも本文の言葉と根拠となる数字・表との間に食い違いを抱えています。読者側で検算しないと、正確な比較対象が分からない状態です
- 要旨は「数十億枚の画像に展開」、結論は「数億枚の画像に展開」と述べており、規模の表現に一桁分の開きがあります
- トラフィックに関する表6〜表8には、GEO原論文の人手評価(表4)のような対応ありt検定やp値、サンプル数の記載は省かれています。A/Bテストの開始・終了時期や、各群への振り分け方法も同様です
- 「商用VLM APIの94分の1のコスト」という数字も、比較対象のAPI名や価格の算出方法は、確認できた範囲では書かれていません
- 日本語での検証や、日本市場での結果への言及は見当たらない状態です。ベースにしたモデルが多言語対応であるという記述はありますが、それは検証結果とは別の話です
この論文から、言えること・言えないこと
| 言えること(論文が示した範囲) | 言えないこと |
|---|---|
| 画像に「使い道」を予測する言葉を付ける仕組みを、運営企業が自社サービスに本番投入した | その仕組みが、業種や国を問わず同じように効くこと |
| 人手評価では、従来の本番システムより関連性の評価が高かった | その差が、論文の言う「19%」という大きさで正確に測れていること |
| 4週間のA/Bテストで、トラフィックの倍率に差が見られた | その差の統計的な確からしさ(有意かどうか) |
| 運営企業が「20%の組織的トラフィック増」を報告している | その20%が、記事中のどの実験・どの比較を指すのか、原文だけから一意に特定できること |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 「20%増えた」という数字だけを見て、自社の目標にしないでください。この論文を読んでも、20%がどの実験のどの比較条件を指すのか、一本にたどれませんでした。他社事例の数字は、まず出どころを確認する対象です
- 「何が写っているか」ではなく「何と検索されるか」を考える発想は、業種を問わず参考になります。商品写真の説明文を「商品名」だけで終えず、「これを探す人は何と入力するか」まで考える発想は、確度は中程度ながら、自社の商品ページ作りにそのまま応用できそうです
- 複数の評価方法を重ねる姿勢は見習う価値があります。運営企業は機械的な指標・AIによる採点・人手評価の3つを併用しました。1つの指標だけで「効果があった」と判断しない姿勢は、確度が高い教訓です
- 1社の内部実験である以上、そのまま自社に当てはまるとは限らない点に注意が必要です。実験の対象は英語圏を中心としたこの画像共有サービスの画像であり、日本語や日本の中小企業のページで検証されたものではありません
よくある質問
運営企業が報告した「20%の組織的トラフィック増加」は、どの実験を指しているのですか
原文を通読しても、一本の実験に特定できませんでした。要旨と結論では「GEOで20%増えた」と全体の成果のように書かれていますが、本文で「20%」と明記されているのは、埋め込みとふたつの塔モデルを組み合わせた仕組みについての一文だけです。
しかもその根拠として挙げられている表8には、1〜2%台の数字しか並んでおらず、20%という数字を直接裏づける表は無い状態です。
VLM(画像を読むAIモデル)による検索語生成は、これまでの画像キャプションと何が違うのですか
従来の画像キャプションは「ピンクのドレスを着た女性」のように、写っているものを説明します。この論文のVLMは、そうした説明ではなく「これを探す人は何と検索するか」を予測した言葉を作ります。
論文はこれを「対象の説明」「見た目や特徴」「使い道」の3種類に分け、とくに使い道を示す検索語の生成を、従来のキャプション技術との違いとして強調しています。
この論文は査読を受けているのですか。独立した第三者による検証はありますか
確認した範囲では、査読を受けた学会や論文誌への掲載を示す記載はなく、arXivのプレプリントにとどまります。著者は全員が運営企業の社員で、報告されている効果はすべて自社サービス内での自社評価です。
外部の第三者が独立に検証した結果ではないという点は、数字を読むときの前提として押さえておく必要があります。
まとめ:今日できる1つのこと
自社サイトの商品やサービスの写真を1枚選び、「これは何を写した画像か」ではなく「これを探している人は、検索窓に何と打ち込むか」を3つ書き出してみてください。この論文が本番投入した仕組みの発想を、道具を使わずに体感できる、いちばん手軽な確認方法です。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


