論文は、ネット通販の検索などで、候補の商品を画像と説明文ごとAIに読ませ、どれを上に出すかを決めさせる仕組みが広がっていると説明しています。
画像と文章をいっしょに読むAIは、視覚言語モデル(以下、画像も読むAI)と呼ばれます。では、出品者が自社の商品画像と説明文にこっそり手を加えたら、このAIがつける順位は動くのでしょうか。
この問いを実験で確かめたのが、ジョージタウン大学、南カリフォルニア大学、メリーランド大学カレッジパーク校、アリゾナ州立大学の研究者6人による「Multimodal Generative Engine Optimization: Rank Manipulation for Vision-Language Model Rankers」です。
2026年1月にarXivで公開され、計算言語学の国際会議ACL 2026に併設されたワークショップの論文集に収められました。
この記事では、論文を原文から読み、何を試し、順位がどれだけ動き、どんな条件で効いたか・効かなかったか、そして加工が人の目で分かったのかを整理します。
攻撃の研究なので、加工した画像や文字列、作り方の手順や設定値は載せず、結果だけを書きます。弊社はこうした操作を勧めない立場で、守る側として読んでいます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。商品画像や説明文がAIに読まれる時代に、他社の加工で自社が不利になる余地がどれくらいあるのかを、守る側の前提として確かめるために、この論文を読みました。
結論:3行で言うと
- 公開AI1つ(Qwen2.5-VL-7B)に10件の商品一覧を渡す実験で、対象の商品の画像と説明文の両方に最適化した加工をすると、順位は平均2.25位分上がりました。説明文だけの加工は0.73位分、画像だけは1.30位分で、両方を組み合わせた効果が最も大きくなりました
- 市販の生成AIで説明文を書き足し、画像を編集し直す「ふつうの出品者がやりそうな磨き込み」は、平均0.30位分しか動かず、2分野ではかえって下がりました。論文は、見た目や文章の質を上げるだけでは順位はほとんど動かず、AIの内部の判断に合わせた加工が必要だったと述べています
- 加工を作るには、順位をつけるAIの中身をすべて見られる前提があります。実際のAI検索サービス、別のAIへの転用、日本語、人の目で気づけるかは、どれも未検証です。目立たなくする条件を外すと、目に見える乱れが出た例も論文自身が載せています
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Multimodal Generative Engine Optimization: Rank Manipulation for Vision-Language Model Rankers |
| 著者 | Yixuan Du、Chenxiao Yu、Haoyan Xu、Ziyi Wang、Yue Zhao、Xiyang Hu(6人。ジョージタウン大学、南カリフォルニア大学、メリーランド大学カレッジパーク校、アリゾナ州立大学) |
| 公開日 | 2026年1月18日(arXiv初版)。確認した版は2026年6月7日の第2版 |
| arXiv番号 | 2601.12263(主分類は計算言語学) |
| 掲載・採択状況 | arXivのコメント欄に、ACL 2026に併設された第4回ワークショップ「KnowFM」(知識を備えた基盤モデルがテーマ)の論文集と記載。ACL Anthology(計算言語学の論文を収める公式の保管庫)で、同ワークショップ論文集の115〜128ページ(2026年7月)に収録されていることを確認しました(2026年9月29日確認)。OpenReviewでの登録は、私の検索では見つかりませんでした。ワークショップは本会議より小規模な発表の場です |
| 種類 | 大学の研究。商品一覧をAIに直接渡して順位をつけさせる、実験室の実験 |
| 実験データとコード | コードとデータを公開していると論文に書かれています。この記事ではリンクを張りません |
論文はこちらで読めます。arXiv(2601.12263)、ACL Anthologyの掲載ページ、論文集のDOI。
この論文が答えた問い
画像も読むAIが商品に順位をつける仕組みで、1つの商品の画像と説明文だけを、人に気づかれない範囲で加工したら、その商品を1位へ押し上げられるのか。
論文が想定するのは、自分の出品ページしか触れない悪意ある出品者です。検索でしぼられた10件前後の候補を、画像も読むAIが並べ替える段階(再順位づけ)を狙います。
論文は、この段階で扱う候補はふつう10〜50件で、10件の設定はその状況を再現したものだと説明しています。
これまでの順位操作の研究は、文章だけを対象にしてきました。当シリーズで解説した見つかりにくい文字列で順位を動かした論文(StealthRank)もその1本で、同じ研究者が一部重なっています。
この論文は、文章の側にStealthRankのやり方を借り、そこへ画像の加工を足しました。画像の説明文を本文に足す論文が、生成検索の回答での目立ち方をまっとうな書き足しで上げようとしたのに対し、こちらは順位を不正に動かす攻撃の側を調べた研究です。
どうやって調べたのか
| 項目 | 設定 |
|---|---|
| データ | 大手通販サイトの商品ページから集めた商品名・説明文・画像。10分野(ベビーカー、バスケットボール、スナック菓子、デスクライト、ジュース、キーボード、口紅、モップ、焦げつきにくいフライパン、ヨガマット)で、各分野10〜15商品。商品名は外部の生成AIで短く整えています。すべて英語です |
| 順位をつけるAI | 1つだけ。中身を読める公開モデルのQwen2.5-VL-7B |
| 1回の課題 | 10件の商品の画像と説明文、利用者の依頼文をAIに渡し、おすすめ順に並べさせる |
| 対象の選び方 | 一覧の商品を1件ずつ順番に対象にし、ほかの9件はそのままにする |
| 攻撃の前提 | 攻撃する側は、順位をつけるAIの構造と内部の数値をすべて見られる。そのうえで、画像のごく小さな変化と、説明文の末尾に足す短い文章を、画像と文章で交互に自動調整する。手順と設定値は、この記事では省きます |
| 比べた4つの条件 | 説明文だけ加工、画像だけ加工、両方を加工(この論文の手法、以下MGEO)、市販の生成AIによる磨き込み(以下、磨き込み) |
| 磨き込みの中身 | GPT-4o-miniで説明文に書き足す文を作り、GPT-Image-1-miniで商品画像を編集する。順位を狙った調整はしない。論文は、専門知識のない出品者ができる現実的な上限と位置づけています |
| 指標 | 加工後の順位から加工前の順位を引いた値の平均。マイナスが大きいほど上がった |
試行の回数とばらつき、「気づかれない」ことの確かめ方は、後の「原文を読んで気づいた点」で触れます。
結果
両方を加工すると、平均2.25位分上がった
論文の表1です。マイナスが大きいほど上位へ動いたことを表します。
| 条件(Qwen2.5-VL-7B、10件の一覧) | 平均の順位変化 |
|---|---|
| 説明文だけ加工 | -0.73 |
| 画像だけ加工 | -1.30 |
| 両方を加工(MGEO) | -2.25 |
| 市販の生成AIによる磨き込み | -0.30 |
- 両方を加工した効果は、説明文だけと画像だけの単純な合計(-2.03、概算)を上回りました。論文は、画像と文章の加工が互いを強め合ったと解釈しています。ただし差は0.22位分(概算)で、ばらつきの情報はありません
- 画像だけの加工が、説明文だけの加工より大きく動きました。論文は、このAIの判断で画像の特徴が大きな役割を占めているためだと述べています
- 磨き込みは、説明文だけの加工より小さい動きでした。論文は、磨き込みの文章のほうが滑らかで、画像も背景の差し替えなどで見栄えが良かったと認めています
- 10件の一覧では、全商品を順に対象にすると加工前の平均は5.5位です。全員が1位になったときの平均変化は-4.5(私の計算)で、MGEOの-2.25はその半分にあたります(私の計算)
分野によって効き方は大きく違った
付録の表4から、分野別の平均の順位変化を抜き出しました。プラスは順位が下がったことを表します。
| 分野 | 説明文だけ | 画像だけ | 両方(MGEO) | 磨き込み |
|---|---|---|---|---|
| ベビーカー | -0.4 | -1.3 | -3.9 | -0.5 |
| バスケットボール | -1.7 | -0.4 | -2.1 | -0.7 |
| スナック菓子 | -0.9 | -1.4 | -1.9 | -0.7 |
| デスクライト | -2.2 | -1.3 | -1.4 | -0.5 |
| ジュース | -0.4 | -2.1 | -3.4 | -0.3 |
| キーボード | +0.4 | -0.6 | -1.7 | +0.2 |
| 口紅 | -0.4 | -2.1 | -2.2 | -0.4 |
| モップ | -0.7 | -1.2 | -1.5 | 0 |
| フライパン | -0.6 | -1.2 | -2.6 | +0.5 |
| ヨガマット | -0.4 | -1.4 | -1.8 | -0.6 |
- MGEOが最も大きく動いたのは10分野中9分野です。デスクライトだけは、説明文だけの加工(-2.2)がMGEO(-1.4)を上回りました
- MGEOの幅は、-1.4(デスクライト)から-3.9(ベビーカー)まででした
- 磨き込みは、キーボードとフライパンで順位を下げ、モップでは動きませんでした。説明文だけの加工も、キーボードでは下がっています
目立たなくする条件を外すと、効きは強まり、乱れが見えた
論文は、画像の加工を目立たなくする2つの条件(隣り合う点の変化をなめらかにする条件と、変化の総量を抑える条件)の強さを変えて比べています。設定値は省き、結果だけを示します(表2)。
| 画像の加工の条件(Qwen2.5-VL-7B) | 平均の順位変化 |
|---|---|
| 2つの条件とも強い | -1.53 |
| 2つの条件とも中程度(本実験で採用) | -2.25 |
| なめらかさの条件だけ外す | -2.31 |
| 変化の総量の条件だけ外す | -2.72 |
| 2つの条件とも外す | -2.29 |
- 変化の総量を抑える条件を外すと最も大きく動きましたが、論文は「目で見て分かるゆがみが出た」と書いています。目立たなさを保っていたのは主にこの条件だった、という整理です
- 2つとも外すと、片方だけ外した場合より効きが弱く、最も大きな変化にはなりませんでした。論文は、AIが順位の一覧を出す前に別の前置きを書き始め、狙いが外れたためだろうと推測しています
- 図4の1つの例では、条件ありの4パターンがどれも8位から6位、条件なしだけが8位から1位でした。表の平均とは傾向が違う例です
効かなかった場面:大きく上がっても、人の目に分かる
論文は失敗例にも1節を割いています。商品によって、わずかな加工で大きく上がるものと、目立つ乱れを入れないと上がらないものがあり、差が大きかったそうです。
図5では、10位の商品が1位になったものの、画像にはっきり分かる乱れが出ていました。論文はこれを、簡単に見つかるため現実には効きにくい「失敗例」として扱っています。
全体として、攻撃の成否は商品の見た目や意味の融通の利き方に左右される、と論文はまとめています。
ニュース記事の並べ替えでも試されています(付録D、ニュースのデータセットOpenEvents V1)。説明文だけの加工は-1.84、MGEOは-2.71でした。
論文自身が書いている限界
- 順位をつけるAIは、Qwen2.5-VLだけです。ほかのAIでは、モデルごとの癖や別の課題が出るかもしれないと述べています
- 画像と説明文が加工以外は固定された、静的な商品ページを前提にしています。実際の通販サイトには、情報の更新、追加のデータ、サイト側の前処理があり、手順の見直しが要るかもしれないとしています
- 防御策は体系的に調べていないと明記し、悪用を防ぐ研究が重要だと書いています。結論では、加工の検出、順位の一貫性の点検、順位づけAIを攻撃に強く鍛える学習を、今後の課題に挙げています
- 倫理の節では、公開モデルと公開データを使った管理された実験で、実際の商用サービスでは評価していないこと、攻撃にそのまま使えるコードは公開しないことを述べています
原文を読んで気づいた点
- 「人の目で気づけないか」は、測られていません。根拠は、加工にかけた制約と図の例だけで、人による判定実験や、画像の変化量・文章の自然さの数値は載っていない状態です。私が読んだ範囲では、図3に載ったMGEOの説明文の例は、文法が崩れた箇所があり、論文自身も磨き込みの文章のほうが滑らかだったと書いています
- 別のAIへの転用は試されていません。論文は、実際には攻撃する側が似た公開モデルを代わりに使うと書いていますが、結果はすべて、順位をつけるAIそのものの中身を使って作った加工によるものです
- 表1の説明文の「-4.5」の意味が分かりにくい書き方です。説明文は「ランダムな昇格なら期待値は-4.5」としていますが、加工前の平均5.5位から全員が1位になった場合の値にあたり、上限の目安として読むほうが自然だと私は考えます
- 試行の回数、ばらつき、統計的な検定は示されていません。両方の加工が単純な合計を上回ったという主張も、0.22位分(概算)の差にもとづいています
- 各分野は10〜15商品ありますが、10件の一覧をどう選んだかは書かれていません。ニュースの実験は、件数とAIの種類が付録に書かれていません
- 日本語は対象外です。商品情報も依頼文も英語です
- コードとデータを公開したとする記載と、攻撃にそのまま使えるコードは公開しないとする倫理の節の記載が、並んでいます。どこまで公開されているかは、この記事の目的から確認していません
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 1つの公開AIで、画像と説明文を両方加工すると、10件の一覧で平均2.25位分上がった | 実際のAI検索サービスや通販サイトの順位でも同じように動くこと |
| 両方の加工は、説明文だけ・画像だけの加工より大きく動いた(10分野中9分野) | 中身の見えないAIに、別のAIで作った加工が効くこと |
| 市販の生成AIでの磨き込みは平均0.30位分しか動かず、2分野では下がった | 加工が人の目に気づかれないこと |
| 目立たなくする条件を外すと効きは強まり、目に見える乱れが出た | 日本語の商品情報で効くこと |
| ニュース記事の並べ替えでも、両方の加工が説明文だけより大きく動いた | 有効な防御策や、見分ける方法 |
「平均2.25位分」は、特定の公開AI、英語の商品情報、10件の一覧、中身をすべて見られる攻撃者という条件での数字です。AI検索全般の話に広げて読むのは誤りです。
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
商品画像も、AIの判断材料として読まれている
この実験では、画像だけの加工が説明文だけの加工より順位を大きく動かしました。1つのAIでの結果ですが、画像も読むAIが順位を決める場面では、画像が文章に劣らない重みを持ちうることがうかがえます。
自社の商品画像が、商品そのものを正確に写しているかは、見た目の印象とは別に点検する価値があります。
他社の加工で不利になる余地は、実験室では確認された
この実験の設定では、1件が上がればほかの商品が押し下げられます。論文の一覧はゼロサムで、1件が上がれば、どこかが下がる構図です。
ただ、この攻撃は順位をつけるAIの中身を使える前提で作られ、実際のサービスで効くかは未確認です。過度に怖がるより、「起こりうる」と知っておく段階だと受け取るのが妥当です。
見張るのは「文言」より「結果」
加工は画像のわずかな変化と、説明文の末尾の短い文で、露骨な宣伝の言葉を避けるよう作られています。論文では確かめられていませんが、念のため、出品ページを目で眺めるだけで見つけるのは難しいと考えておきます。
自社の主力商品について、モールの検索やAIの答えで順位や紹介のされ方が急に変わっていないかを、ときどき記録しておくほうが役に立ちます。
不自然な動きがあれば、日付と画面を残してサイト側に相談できます。
操作する側には回らない
市販の生成AIで説明文や画像を「魅力的に」作り直すだけでは、この実験の順位はほとんど動きませんでした。動いたのは、AIの内部を使った加工で、それも商品によっては目立つ乱れが出ています。
見つかったときに失う信用も大きい手法です。弊社は、順位を狙った加工や隠し文を勧めていません。
価格、仕様、向いている人を正確な文章と画像で公開しておくことが正攻法です。
よくある質問
マルチモーダルな順位操作(MGEO)は、実際の通販サイトやAI検索サービスでも効きますか
この論文で確かめられたのは、中身を読める公開AI1つに、10件の商品一覧を直接渡した実験までです。実際の通販サイト、実際のAI検索サービス、日本語、別のAIで作った加工の転用は、どれも対象外でした。
論文自身も、実際の商用サービスでは評価していないと書いています。2026年時点の実験室の結果として受け取るのが妥当です。
画像も読むAIの順位操作と、StealthRankのような文章だけの順位操作は何が違いますか
StealthRankは、商品説明に足す文字列だけで、文章を読むAIの順位を動かしました。この論文は、その文章の加工に、商品画像のごく小さな加工を組み合わせ、画像も読むAIの順位を動かした点が違います。
同じ公開AIでの比較では、文章だけの加工より、画像と文章を組み合わせた加工のほうが大きく順位を動かしました。
商品画像を市販の生成AIで編集すると、画像も読むAIの順位は上がりますか
この論文の磨き込みの条件(市販の生成AIで説明文に書き足し、画像を編集)では、平均0.30位分の上昇にとどまり、キーボードとフライパンの2分野では下がりました。
論文は、人にとっての見栄えの良さと、AIの判断の基準は別物だと述べています。1つのAIでの結果ですが、「AIで磨けば上位」と期待する根拠は、この論文からは得られないと私は読んでいます。
まとめ:今日できる1つのこと
自社の主力商品を1つ選び、商品ページの画像と説明文を並べて見比べてください。画像に写っているものと、説明文に書いてある価格・仕様・付属品が食い違っていないかを確かめ、ずれがあれば事実どおりに1か所直します。
この論文では、画像も読むAIが順位を決めるときに、画像が大きな判断材料になっていました。他社の加工には手が出せなくても、自社の情報を正確にそろえておくことは今日からできます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


