AIが検索結果をまとめて答える画面では、並んだ検索結果のうち数件だけが出典として選ばれます。選ばれる側と選ばれない側を分けているのは、内容の良し悪しだけなのでしょうか。
AIにも、特定の書き方を好む癖がある可能性があります。癖があるなら、それを突いて選ばれる側に回ることもできてしまいます。
この問いを実験で調べた論文を、原文から読みます。2026年3月にarXivで公開された「Exploring LLM biases to manipulate AI search overview(AIの偏りを使って、AI検索の要約を操作する)」です。
検索結果に表示される短い説明文(スニペット)を小さなAIに書き換えさせ、要約を作るAIに選ばれやすくなるかを測っています。
攻撃の研究なので、この記事では書き換えの文例や手順には触れず、どんな偏りが見つかり、選ばれ方がどれだけ動き、どんな条件で効いたか・効かなかったかだけを整理します。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AIが出典を選ぶ癖がどこまで実験で確かめられていて、どこから先が確かめられていないのかを、数字で把握しておくために読みました。
結論:3行で言うと
- 簡易のAI要約で、候補の並び順や指示文を変えても同じ検索結果が選ばれ続ける偏りが見られました。手作業で選んだ90件の検索語のうち48件で、同じ結果が7回の試行すべてで選ばれています
- 小さなAIに説明文だけを書き換えさせると、対象の結果が選ばれた割合は基本の条件で0.37から0.83に上がりました。ただし指示文を大きく変えると0.33から0.43、要約役のAIを替えると0.38から0.56と、効き目は大きく縮みました
- 効いたのは、他の候補と比べて勝つ方向の書き換えでした。説明文を単独で良くしようとする書き換えは失敗しています。有害な文を紛れ込ませる攻撃は、試した3種類のうち1種類が1件の例で成功しました
ただし、実験に使われたのは研究者が自分で組んだ簡易の「AI要約」です。検索エンジンが実際に出しているAIの要約や、対話型の検索サービスそのものでは試されていません。
この点は後の章で詳しく扱います。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | Exploring LLM biases to manipulate AI search overview |
| 著者 | Roman Smirnov(1人。所属は民間企業) |
| 公開日 | 2026年3月30日(arXivへの提出日、第1版) |
| arXiv番号 | 2605.00012(分野は情報検索) |
| 掲載・採択 | arXivのプレプリント(査読前)。コメント欄はページ数と図の数だけで、学会の採択の記載は見当たりません |
| 種類 | 実験研究。AI要約を操作する方法と、その悪用のされ方を調べた攻撃の研究 |
| 実験データとコード | 公開先の記載は論文中に見当たりません |
論文はこちらで読めます。arXiv(2605.00012)。
この論文が答えた問い
AI検索の要約が検索結果から出典を選ぶとき、そこに偏りはあるのか。あるなら、検索結果の短い説明文だけを書き換えて、その偏りを突き、選ばれる側に回れるのか。
論文は、検索結果をAIが要約する仕組みを、次のように単純化して扱っています。
- 利用者の検索語を受け取る
- 検索エンジンで結果を取る。1件ごとに、URL・タイトル・説明文(スニペット)がある
- AIがその中から関連の高い結果を選び、出典として引用しながら答えを書く
偏りが入り込む場所は「選ぶ」段階と「書く」段階の両方にありますが、この論文が主に調べたのは「選ぶ」段階です。検索語を増やして何度も調べ直す、多段型の仕組みは対象外です。
背景として論文は、AI要約が出るようになってクリックが58%減ったと報告した出版社がある、という業界の分析を引いています。論文自身が測った数字とは別物です。
どうやって調べたのか
| 項目 | 設定 |
|---|---|
| 検索語 | 大手の通販サイトが研究用に公開している、商品検索の検索語データセットから約3,000件(使った言語の記載はなし。例に出る検索語はいずれも英語で、元のデータセットには日本語も含まれる) |
| 検索結果 | 実在の検索エンジンで各10件を取得。説明文が途中で切れているものを除き、7件以上残った検索語を使用。検索エンジンの名前は未記載 |
| 要約役のAI | 研究者が作った簡易版。検索語と候補(URL・タイトル・説明文)を受け取り、関連の高い3件の番号を返す。主にgpt-4.1-nano。ほかにgpt-4.1-mini、gpt-5-nano、gpt-5-miniも使用 |
| 偏りの確認 | 手作業で選んだ90件の検索語(各7〜10件の候補)で、条件を変えながら7回ずつ選ばせる |
| 書き換え役のAI | 小さな公開モデルを、強化学習(試行錯誤の中で、要約に選ばれたら点数が入る方向に学ばせる方法)で訓練。変えてよいのは説明文だけで、URLとタイトルはそのまま。説明文を大きく伸ばすことは制約で抑えた |
| 効果の測り方 | 学習に使っていない90件の検索語で、各1件の対象の説明文を書き換え、書き換え前と後で「要約に選ばれた割合」を比べる |
| 評価の方法 | すべて自動。要約役のAIが選んだかどうかだけを数え、人による評価や、書き換え後の文の正しさの確認はなし |
「条件を変える」は、次の7通りです。基本の条件のほか、AIの出力のばらつきを大きくする、候補の並び順を入れ替える、URLだけを別の候補と入れ替える、指示文を少し変える、指示文を大きく変える、要約役のAIを別のモデルに替える、の6通りで揺さぶっています。
偏りがなければ、どの候補も同じくらいの頻度で選ばれるはず、という考え方です。
結果
偏りはあったか
論文の第5節によると、90件のうち48件で、同じ結果が7回の試行すべてで選ばれました。
また30件では、2件以上の結果が7回とも一度も選ばれませんでした。論文は、偏りがなければ「一度も選ばれない」確率は約2%だと計算し、これを偏りの証拠としています。
具体例として、あるコーヒーチェーンのギフトカードを探す検索語の結果が表で示されています。家電量販店と大手通販サイトの結果は7回中7回選ばれ、ブランドの公式サイトは2回、別の大手小売の結果は0回でした。
論文はこれを、第三者の媒体をブランド自身のページより好むという先行研究の指摘と重なる例として挙げています。
書き換えで、選ばれる割合はどれだけ動いたか
論文の図4から拾った値です。数字は、対象の結果が要約に選ばれた割合(0〜1)です。
差は割合そのものの差で、図に書かれた値をそのまま載せています。要約役は主にgpt-4.1-nanoで、「要約役のAIを替える」だけgpt-5-nanoです。
| 条件 | 書き換え前 | 書き換え後 | 差 |
|---|---|---|---|
| URLだけを入れ替える | 0.41 | 0.90 | +0.49 |
| 基本の条件 | 0.37 | 0.83 | +0.47 |
| 出力のばらつきを大きくする | 0.39 | 0.81 | +0.42 |
| 指示文を少し変える | 0.36 | 0.76 | +0.40 |
| 並び順を入れ替える | 0.33 | 0.76 | +0.42 |
| 要約役のAIを替える(gpt-5-nano) | 0.38 | 0.56 | +0.18 |
| 指示文を大きく変える | 0.33 | 0.43 | +0.10 |
- 基本の条件では、選ばれた割合が約2.2倍になりました(概算。0.83÷0.37)
- 学習のときと近い条件ほど効き目が大きく、指示文を大きく変えたり要約役を替えたりすると、差は+0.10〜+0.18まで縮みました。書き換えは、学習に使った要約役に合わせ込まれたものだと読めます
- 「並び順を入れ替える」の差は、図では+0.42です。前後の値の引き算では0.43になり、図の表示と0.01ずれています。丸めの違いと思われます
- 論文は、7回とも選ばれなかった大手小売の説明文を書き換えた2つの例を挙げ、どちらも選ばれたと報告しています。書き換え後の文には、他の候補の説明文にあった表現や情報が入っていました
どんな条件で効き、どんな条件で効かなかったか
| 試したこと | 結果 |
|---|---|
| 書き換え役に、対象の説明文だけを見せて書き換えさせる | 学習が伸びず失敗。説明文が短いことと、長さの制約があったことが原因だと論文は見ています |
| 書き換え役に、他の候補の説明文もすべて見せる | 成功。ここから論文は「AIの好みは絶対的な良さより、候補どうしの比較で決まる」と結論しています |
| 長さの制約を外す | 書き換え役は説明文を他の候補より長くする方向へ進みました。論文は長さへの偏りの表れとしつつ、実際の説明文は検索エンジンが短く切るため、抜け道として制約で抑えています。長さの効果の数値は未掲載です |
| 元の説明文との近さを保つ条件を加える | 点数の伸びが遅くなり、実験を速く回すために外しました |
| 要約役がgpt-4.1-nano、gpt-4.1-mini、gpt-5-nano | 学習で点数が大きく伸びました(伸び幅の数値は未掲載) |
| 要約役がgpt-5-mini | 点数が伸びず、同じ水準のままでした |
AIの種類によって、見ている所が違った
第8節では、候補の要素を入れ替えたとき、選ばれる3件がどれだけ元のままかを比べています。3件すべて同じなら3、すべて入れ替われば0です。
図5〜7は数字の書き込みがない棒グラフです。下の値は、私が図から目で読んだ概算です。
| 要約役のAI | 選び方が最も変わった入れ替え | 最も変わらなかった入れ替え |
|---|---|---|
| gpt-4.1-mini | 説明文の入れ替え(約2.0) | タイトルの入れ替え(約2.3) |
| gpt-4.1-nano | 説明文の入れ替え(約1.8) | URLの入れ替え(約2.1) |
| gpt-5-mini | ページのURLの入れ替え(約1.9) | 並び順の入れ替え(約2.3) |
図にはばらつきの幅(標準偏差)も描かれており、入れ替え方どうしの差より大きく出ています。論文も値の大きさより順番を重視しています。
論文は、gpt-5-miniはURLに強く引っ張られていて、説明文の書き換えが効かなかったのはそのためかもしれない、と述べています。
ほかの2つは、説明文の中身を入れ替えたときにいちばん選び方が変わりました。論文は、値の大きさより、どの要素が効くかの順番に意味があるとしています。
有害な内容を紛れ込ませられたか
論文は3種類の攻撃を試しています。
- 対象の説明文に、無関係・有害な文を混ぜてから書き換える:失敗。書き換え役は、他の候補を手本に書き換えるため、混ぜた文を捨てました
- タイトルに有害な文を混ぜ、説明文を書き換える:失敗。要約役はタイトルも見ており、その結果を選びませんでした
- 書き換え役が手本にする、別の候補の説明文に有害な文を混ぜる:成功。書き換え後の説明文にその内容が入り込み、その結果が要約に引用されました
3つ目の成功例は、腕時計の交換用バンドを探す検索語の1件です。論文自身も、実験の広さは足りず、危険の可能性を示しただけだと書いています。
論文自身が書いている限界
- 要約役は、関連の高い3件の番号を返すだけの簡易版です。論文はこの簡易版で妥当だとし、根拠に予備実験での強い相関を挙げていますが、その数値は示されていません(限界として挙げるのは私の側の判断です)
- 攻撃の実験は、ごく限られたデータで試しただけです。論文は「どの攻撃もある程度は効くと予想している」としつつ、さらなる研究が必要だとしています
- gpt-5-miniで効かなかった理由は、偏りの違いという仮説にとどまります。学習方法の限界、小さなモデルから始めたことによる探索不足なども、理由の候補として挙げています
- 調べたのは主に「選ぶ」段階で、検索を何度も繰り返す多段型の仕組みは対象外です
原文を読んで気づいた点
- 実在のAI検索サービスでは試されていません。題名は「AI検索の要約」ですが、実験の要約役は研究者が作った簡易版です。検索エンジンのAI要約や対話型の検索サービスは、例として名前が出るだけです。実験は2026年3月までに行われたもので、各モデルの挙動も当時のものです
- 日本語は未検証です。日本語で試したという記載はありません。検索語は商品検索で、業種も商品探しに限られます
- 評価はすべて自動です。「要約役が選んだか」だけを数えていて、書き換え後の説明文が正しいかは評価の外です。ギフトカードの例でも、他の候補にあった情報が書き換え後の文に入っていました
- 「偏り」と「質の差」の切り分けが弱いと感じました。同じ結果が7回とも選ばれるのは、AIがその結果を単に良いと判断し続けている場合にも起きます。論文は反論として1例だけを示していますが、その例で選ばれにくかった公式サイトの説明文は、画面の部品の説明が繰り返し並んだ崩れた文でした
- 確率の計算が本文の記述と合いません。論文は、偏りがなければ「7回すべて選ばれる」確率も約2%としています。候補7件から3件を選ぶ前提で私が計算すると、7回すべては約0.3%、6回以上で約2.7%です(概算)。実際の候補は7〜10件で、7回の試行も同じモデルと似た指示文なので、互いに独立とは言いにくい設計です
- ばらつきの情報が少ない実験です。強化学習を何回繰り返したか、評価の90件でどの1件を書き換え対象にしたかの記載が見当たりません。図5〜7については、本文の説明の順番と図の見出しで、gpt-4.1-miniとgpt-4.1-nanoの順番が食い違っています
- 査読前のプレプリントで、著者は1人、所属は民間企業です。arXiv番号は2605ですが、提出日は2026年3月30日です
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 簡易のAI要約では、条件を揺さぶっても同じ結果が選ばれ続ける傾向があった | それが内容の質ではなく、AIの癖によるものだと切り分けられたこと |
| 説明文の書き換えだけで、選ばれる割合が0.37から0.83に上がる条件があった | 実在のAI検索サービスで同じだけ動くこと |
| 効き目は、要約役のAIや指示文が変わると大きく縮んだ | どのAIにも通じる、決まった「好まれる書き方」があること |
| 他の候補と比べる形の書き換えは効き、単独での書き換えは効かなかった | 書き換え後の文が正確で、読み手に役立つこと |
| 手本にされる別の候補に混ぜた有害な内容が、要約まで運ばれた例が1件あった | 日本語の検索や、商品探し以外の業種で同じになること |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
AIの選び方は「比べて決まる」ものとして扱う
論文が強調する発見の1つは、AIの好みは候補どうしの比較で決まる、という点でした。自社の説明文だけを眺めて磨くより、同じ検索語で並ぶ他社の説明文と並べて読むほうが、判断の材料になります。
そのとき見るのは、検索した人の問いに何を提供するかが1文目で伝わるか、という読み手の側の基準です。検索語に対して結論を先に書くことは、AIの癖と重なるかもしれませんが、読み手のための書き方として元から正しいものです。
特定のAIに合わせ込む書き換えは、相手が変わると崩れる
学習に使ったのと同じ条件では+0.47だった差が、指示文を大きく変えると+0.10まで縮みました。gpt-5-miniでは、学習の段階から点数が横ばいでした。
AIの癖を狙った水増し(説明文を長くする、他社の言い回しを取り込む、など)は、相手のAIが替わるたびに効き目が揺れ、読み手には読みにくい文が残ります。
こうした操作はおすすめしません。
検索結果に出る自社の説明文が崩れていないかを確かめる
論文の例では、公式サイトの説明文が画面の部品の説明を並べただけの文になっていて、量販店や通販サイトに負けていました。偏りのせいか質のせいかは切り分けられていませんが、どちらの場合も、崩れた説明文は不利に働きます。
ページ冒頭の文と、検索結果に出る説明文の元になる設定は、見直す価値があります。
他社のページを材料にAIで書き直すと、他社の情報が混ざる
成功した攻撃は、書き換え役が手本にした別の候補から、有害な内容が運ばれたものでした。自社の文章をAIに書き直させるとき、競合のページを材料として渡すと、他社の誤りや他社固有の事実が紛れ込む経路になります。
1枚の汚染されたページがAIの推薦を動かす研究は汚染ページの論文の解説で、商品説明の心理的な言い回しがAIの推薦を動かす研究は認知バイアスとAIの商品推薦の論文の解説でまとめています。
よくある質問
AI要約のスニペット操作の研究は、実際のAI検索サービスでも同じ結果になりますか
この論文の範囲の外です。実験の要約役は、研究者が作った「関連の高い3件の番号を返す」だけの簡易版です。
実在のAI検索サービスは多段の処理や別の情報も使っている可能性があり、同じ数字が出るとは限りません。論文のモデル別の実験でも、要約役を替えると効き目が大きく変わっています。
AI要約が出典を選ぶときの長さの偏りは、説明文を長くすれば有利になるという意味ですか
論文は、制約を外すと書き換え役が説明文を長くする方向へ進んだ、と書いているだけで、長さの効果の大きさは示していません。実際の検索結果の説明文は検索エンジンが短く切るため、論文自身も抜け道として制約で抑えています。
長さを水増しする書き方は、読み手にとっても負担になるだけです。
強化学習によるスニペットの書き換えは、GEO原論文の書き換えと何が違いますか
GEO原論文は、「統計を足す」「出典を示す」など、人が決めた9つの方針でページ本文を書き換え、回答の中での目立ち方を測りました。
この論文は方針を決めず、試行錯誤でAIに書き換え方を学ばせ、短い説明文だけを対象に、選ばれたかどうかを測っています。書き換え役が他の候補の説明文を見ながら書く点も違います。
まとめ:今日できる1つのこと
自社でいちばん大事なページを1つ選び、狙っている検索語で検索してください。検索結果に出る自社の説明文を、上下に並ぶ他社の説明文と並べて読み、検索した人の問いに何を提供するかが1文目で分かるかを確かめます。
崩れた文や、何のページか分からない文になっていたら、ページ冒頭の文から直します。長さの水増しや、他社の言い回しの流用は避けます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


