AIが人の代わりに商品を探し、見比べ、カートに入れる。そうしたAI(ウェブエージェント)に操作されるサイトは、何を備えておけばよいのでしょうか。
2026年7月にarXivで公開された論文「Designing Agent-Ready Websites for AI Web Agents」は、この問いに設計の枠組みで答え、著者が作った通販サイトで小さな比較実験まで行っています。
この記事では、論文を原文から読み、枠組みの3本柱、実験の規模と結果、その数字が意味しないことを整理します。先に位置づけをはっきりさせておきます。
この論文は、設計の提案と、試作サイトでの比較実験(著者自身は「概念実証」と呼んでいます)の組み合わせです。
効果を測った場所は、著者の試作サイトの中だけです。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読むのは、「AI対策」として勧められる作業のうち、どれが検索で引用される話で、どれがAIに操作される話なのかを、根拠と一緒に分けておきたいからです。
結論:3行で言うと
- 論文は、AIが扱いやすいサイトの条件を「読み取れる」「操作できる」「判断を誤らせない」の3本柱に整理した設計の提案です
- 著者が作った同じ品ぞろえの通販サイト2つで比べると、作業を完全にこなせた割合は49.3%から89.3%に上がりました(3つのAI、5つの作業、計300回。採点は人手)
- ただし試作サイトでの概念実証で、実在のサイト、日本語、AI検索での引用のされ方は測っていません。どの工夫が効いたのかの切り分けも、今後の課題とされています
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | Designing Agent-Ready Websites for AI Web Agents: A Framework for Machine Readability, Actionability, and Decision Reliability |
| 著者 | Said Elnaffar(独立研究者、カナダ)、Farzad Rashidi(パリ・シテ大学)の2人 |
| 公開日 | 2026年7月13日(arXiv第1版) |
| arXiv | 2607.12056(分野はcs.AI、人工知能) |
| 掲載・採択 | 論文の各ページの余白に「ICEME 2026で採択・発表済み」と記載。arXivのコメント欄は空欄で、会議録の書誌情報は私が確認した範囲では見つかりませんでした |
| 種類 | 設計の枠組みの提案と、試作サイトでの小規模な比較実験 |
| 実験データとコード | 2つの試作サイトと、300回分の実験記録を著者がコード共有サイトで公開(論文の脚注にリンクあり) |
論文はこちらで読めます。arXiv(2607.12056)、arXivが発行したDOI、実験データの公開先。
この論文が答えた問い
AIが人の代わりにサイトを操作するようになったとき、サイトの側は何を備えればよいのか。備えると、AIの作業の成功率は実際に変わるのか。
論文は、ウェブエージェントのつまずきを4種類に整理しています。ページの中身を受け取り損ねる「観察」、押す部品を取り違える「対応付け」、クリックや移動でしくじる「実行」、情報はあるのに選び方を誤る「判断」の失敗です。
そのうえで、これまでの物差し(検索向けの最適化、構造化データ、アクセシビリティ、外部連携の窓口)は人間向けの別々の目的で作られ、AIに作業を最後までこなさせる土台としてはばらばらだ、と論文は述べています。
ここで言うAIは、検索で答えるAIとは別物です
この論文の「AI」は、ブラウザを開いてクリックや入力をするAIです。検索結果を読んで回答文をまとめるAI(GEO原論文が扱った仕組み)とは場面が違います。
測ったのは「AIが作業をやり遂げたか」で、「回答で引用されたか」は対象外です。
どうやって調べたのか
提案された枠組みの3本柱
論文の図1をもとに、3本柱と、それぞれに挙げられた要素を並べます。
| 柱 | 意味 | 論文が挙げる要素 |
|---|---|---|
| 読み取れること | 文字だけでなく、ページの構造や部品の役割まで、AIが正しく理解できるか | 機械が読める形式(構造化データ、サイトマップ、意味の通るHTMLなど)、意味の明確さ(ページの目的、見出し、説明の充実) |
| 操作できること | 理解したあと、商品の選択、カートへの追加、フォームの入力、次の手順への移動を確実にこなせるか | 見分けのつくボタン・リンク・フォーム、分かりやすい手順の道筋、最新情報を渡す窓口(APIやMCPなど) |
| 判断を誤らせないこと | 古い情報や不完全な情報のまま、推薦・比較・実行をさせないか | 根拠と検証の手がかり(参考文献、口コミ、事例、第三者の認証、運営者の情報)、情報の時点、分類と用途の手がかり |
論文は、3本柱はつながっていて、どれか1つが欠けても全体の性能が落ちると述べています(先行研究を引いた主張で、この実験では確かめていません)。
実験の設計
- 比べたもの:著者が作った通販の試作サイト2つ(基準版と対応版)。商品、ページ、価格、在庫、評価、購入手順は共通です
- AI:GPT-4.1、Gemini 2.5 Flash、Grok 4 Fastの3つ。オープンソースのブラウザ操作用の道具で動かし、答えの揺らぎを抑える設定にしています
- 回数:5つの作業を、AIごと・サイトごとに10回ずつ、計300回。1回あたり30手、エラー3回までが上限です
- 採点:2人の採点者が、記録とAIの出力を見て「合格・部分合格・不合格」に分類しました。手数(操作の回数)と、AIに入力された量(トークン数)も記録しています
「厳密な成功率」は合格だけを、「実用上の成功率」は合格と部分合格を合わせて数えます。部分合格は、主な目的は果たしたものの、重大ではない不備が残った回です。
対応版で変えたのは、論文の表1によると次の4点です。
- 商品データを、ページを動かすプログラムの中だけでなく、機械が読む専用のデータファイルと、ページ内の構造化データでも公開した
- より多くの部品に、読み上げ用の名前と識別用の印を付けた
- 購入などの操作ごとに、識別用の印、商品番号、商品名、在庫、購入可否の欄を付けた
- 根拠をまとめたファイルとページ、情報の時点を示す欄、商品と用途の説明を足した(基準版は、口コミ、在庫の文言、基本的な店の規約をページに表示)
結果
全体では、合格が150回中74回から134回に
論文の表2です。
| AI | サイト | 合格 | 部分合格 | 不合格 | 厳密な成功率 | 実用上の成功率 |
|---|---|---|---|---|---|---|
| GPT-4.1 | 対応版 | 43 | 0 | 7 | 86% | 86% |
| GPT-4.1 | 基準版 | 16 | 18 | 16 | 32% | 68% |
| Gemini 2.5 Flash | 対応版 | 44 | 2 | 4 | 88% | 92% |
| Gemini 2.5 Flash | 基準版 | 26 | 11 | 13 | 52% | 74% |
| Grok 4 Fast | 対応版 | 47 | 1 | 2 | 94% | 96% |
| Grok 4 Fast | 基準版 | 32 | 14 | 4 | 64% | 92% |
| 合計 | 対応版 | 134 | 3 | 13 | 89.3% | 91.3% |
| 合計 | 基準版 | 74 | 43 | 33 | 49.3% | 78% |
- 厳密な成功率は、3つのAIすべてで対応版が上でした。合計の差は40ポイント(絶対値の差)です。論文はカイ二乗検定で、サイトの種類と結果の関係は有意(p<0.001)、効果の大きさは中程度(0.45)と報告しています
- 大きく減ったのは部分合格で、43回から3回になりました。基準版では、正しいページや商品にはたどり着いても、情報を全部拾えない、根拠が足りない、条件を守り切れない、という回が多かったと論文は書いています
- 実用上の成功率で見ると、差は78%から91.3%で、約13ポイント(私の概算)です。特にGrok 4 Fastは92%から96%でした。対応版の効果は、「できない」を「できる」に変えるより、「惜しい答え」を「完全な答え」に変える方向で大きく出ています
- 対応版でも不合格は13回ありました。主に複雑な作業での商品の選び間違い、条件の見落とし、結論の誤りで、論文はこれをAIの推論の限界によるものと見ています
作業ごとの差:抜き出しと比較で大きく伸びた
論文の表3です。回数は作業ごとに30回(3つのAIの合計)です。
本文は作業の中身を大まかにしか書いていないため、「中身」の列は公開された実験記録の指示文から私が要約しました。
| 作業 | 中身(指示文の要約) | 基準版の合格率 | 対応版の合格率 | 差 | 検定のp値 |
|---|---|---|---|---|---|
| 作業1 | 在庫のある商品から、最安のヘッドホン、最高値のモニター、最高評価のキーボードを1つずつカートに入れ、合計を報告 | 73.3% | 96.7% | +23.4ポイント | 0.026 |
| 作業2 | 最も高いヘッドホンの詳細から、価格、在庫、評価、電池の持ち、雑音対策の種類、向いている用途を抜き出す | 23.3% | 100% | +76.7ポイント | <0.001 |
| 作業3 | 2つのヘッドホンを比べ、高いほうに払う価値があるかを、根拠や限界も踏まえて判断 | 16.7% | 93.3% | +76.6ポイント | <0.001 |
| 作業4 | 電池30時間以上などの条件と500ユーロの予算を満たす、最も安い3製品の組み合わせを選ぶ | 60.0% | 76.7% | +16.7ポイント | 0.267 |
| 作業5 | 月曜の注文が金曜に届くか、2か月後に返品できるかを店の規約から判断(論文は複雑さの低い作業と位置づけ) | 73.3% | 80.0% | +6.7ポイント | 0.761 |
- 統計的に有意な差(フィッシャーの正確検定、p<0.05)が出たのは作業1〜3で、作業4と5は有意差なしでした
- 作業4は、条件を同時に満たす必要があり、どちらのサイトでも難しかったと論文は書いています
- 作業5は、基準版でも比較的よくできていました。論文は、対応版の工夫が簡単な作業を難しくすることはなかった、とも述べています
手数とAIが読む量も減った
論文の表4と本文によると、平均手数は9.31から6.49に下がりました。論文はこれを30.4%の減少としています。
AIごとには、GPT-4.1が5.96から3.70、Gemini 2.5 Flashが15.02から11.56、Grok 4 Fastが6.96から4.20です。
AIが読み込んだ文字量も3つとも減り、減少率はGPT-4.1が37.43%、Gemini 2.5 Flashが18.72%、Grok 4 Fastが40.47%でした。
手数の減りが大きかったのは作業3と4で、作業5はほぼ同じだったと本文にあります。作業ごとの手数は表になく、本文の記述だけが根拠です。
論文自身が書いている限界
- この研究は管理された概念実証で、枠組みを完全に検証したものとは位置づけられていません。結果をすべての分野、サイト、AIに一般化しないよう、論文自身が求めています
- 実在のサイト、より広い分野、より多くの種類のAIでの評価と、個々の工夫の効き目を1つずつ外して確かめる実験は、今後の課題とされています
- 対応版でも誤りは残り、枠組みはAIの正しい振る舞いを保証するものではない、と結論に書かれています
- 3本柱は、エージェント対応のすべてを覆うものではないと、考察の節で断っています
原文を読んで気づいた点
- 日本語での検証はありません。公開された試作サイトを見ると、商品12点、英語表記、ユーロ建てのパソコン周辺機器の店です
- 対応版は、名札や構造化データのような「書き方」だけでなく、根拠のページや用途の説明という「中身」も増えています。作業3の指示には、根拠や限界が(あれば)それも踏まえるよう書かれており、根拠のページは対応版にだけあります。成功率の差のうち、書き方の工夫による分がどれだけかは、この実験からは切り分けられません
- AIが構造化データや専用のデータファイルを実際に読んだかは、報告がありません
- 採点は2人による人手です。採点者どうしの一致の度合いは書かれていません。作業の指示文と合格の基準も本文にはなく、公開された実験記録で確かめる形になっています
- 要旨は、伸びが大きかった作業に「複数条件での選択」を挙げています。本文は作業1〜3をまとめてこう説明しており、どの作業が「複数条件での選択」にあたるかは明記していません。一方で7.3節は「複数の条件を同時に満たす作業で一貫して完全な結果が出た」としていますが、複数の条件を満たす作業4の差は+16.7ポイントで有意差なしでした。条件つきの選択全般で伸びた、とまでは読めず、伸びが特に大きかったのは作業2と3です
- 私が表2と表3の回数から計算し直したところ、カイ二乗値(60.79)、効果の大きさ(0.45)、作業ごとのp値は、論文の値と一致しました。文字量の呼び方は、本文と表4で揃っていません
- 査読の根拠は「ICEME 2026で採択・発表済み」という記載だけで、会議に出した版との異同は確認できませんでした
- 検索順位や、AI検索での引用のされ方は、測定の対象外です
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 著者の試作サイトでは、対応版のほうが3つのAIすべてで合格が多かった | 実在の中小企業のサイトでも、同じ幅で成功率が上がること |
| 詳細の抜き出しと2製品の比較で、差が特に大きかった | 日本語のサイトでも同じ結果になること |
| 部分合格(惜しい答え)が43回から3回に減った | 構造化データ、名札、根拠のページのうち、どれが効いたのか |
| 手数とAIが読み込む量が減った | AI検索で引用されやすくなることや、検索順位が上がること |
| 対応版でも、AIの推論による誤りは残った | AI向けの案内ファイル(llms.txtなど)の効果。論文はこのファイルに触れていない |
「49.3%から89.3%」は、著者が用意した5つの作業で、完全な答えを出せた回の割合です。AI経由の売上や問い合わせが増える、という意味の数字とは別物です。
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
1.「AIに引用される」と「AIに操作される」を分けて考える
AI検索の回答に載るための話と、AIが自社サイトで手続きを進めるための話は、別の場面です。前者については、検索エンジンの提供元の公式文書に「生成AIの検索機能のために特別な構造化データは要らない」と書かれています(LLMO対策に新しい道具は要りませんで紹介)。
この論文の構造化データの話は、後者のブラウザを操作するAI向けの話です。両者を混ぜると、「構造化データを入れればAI検索に出る」という、どちらの根拠にもない期待が生まれます。
2. 制作担当への頼み方に言い換える
論文の要素を、中小企業のサイトで頼める形に置き換えました。どの項目が効いたかは切り分けられておらず、確度は「試作サイトでまとめて試したら差が出た」の水準です。
| 論文の要素 | 制作担当への頼み方(例) |
|---|---|
| 機械が読める形式 | 「サービス名、料金、対応地域、営業時間を、検索エンジン向けの決まった書式でもページに書き込んでおいてください」 |
| 部品の名札 | 「ボタンとリンクには、読み上げソフトで聞いても何をするボタンか分かる名前を付けてください。『こちら』ではなく『見積もりを依頼する』のように」 |
| 操作の見分けやすさ | 「同じ形のボタンが並ぶ所は、どの商品やプランのボタンかが、名前だけで分かるようにしてください」 |
| 在庫と受付の状況 | 「在庫、予約の空き、受付終了は、画像ではなく文字で、商品やプランごとに書いてください」 |
| 根拠と検証の手がかり | 「実績、資格、口コミ、第三者の認証の根拠を1ページにまとめて、各サービスのページからつないでください」 |
| 情報の時点 | 「料金表や営業日のように変わる情報には、いつ時点の情報かを書き添えてください」 |
| 規約の確認(作業5。この論文では差が小さく有意差なし) | 「納期、キャンセル、返品の条件を1ページにまとめて、日数や期限を数字で書いてください」 |
論文はAIとの連携窓口(APIやMCP)にも触れていますが、実験には含まれていません(試したのは、商品データを専用のデータファイルで置くところまでです)。中小企業が先に手をつけるのは、上の表のように、今あるページの書き方を整える作業だと考えます。
3. llms.txtの根拠には使わない
論文はllms.txtに一言も触れていません。対応版の「専用のデータファイル」は、試作サイトの商品情報を機械向けに置いたもので、llms.txtとは別物です。
llms.txtについては、有効なファイルを置いていたドメインの97%で、対象の1か月にアクセスが1件も記録されていなかったという大規模な集計があります(llms.txtの解説記事で紹介)。
この論文の結果は、AI向け案内ファイルを置く理由にはならない、というのが私の読み方です。
4. 人にとっての使いやすさと重なる部分から始める
ボタンの名前、在庫の文字表示、規約の一覧、情報の時点は、人間の閲覧者や読み上げソフトの利用者にも役立つ工夫です。AIの普及の速さにかかわらず無駄になりにくく、最初の一歩に向いています。
記事づくりでも、比べる材料(価格、条件、向いている人、限界)を表で揃えておくと、作業3のような「比べる作業」をAIがこなしやすくなる可能性があります。
ただし記事単位での効果は、この論文では確かめられていない仮説です。
よくある質問
エージェント対応サイト(エージェントレディ)の設計は、AI検索で引用されるためのLLMO対策と同じですか
別の場面を扱っています。この論文が測ったのは、ブラウザを操作するAIが通販サイトで作業をやり遂げられたかどうかです。
AI検索の回答で引用されるかどうかは測っていません。ページの意味を分かりやすくするなど、重なる工夫はあります。
エージェント対応サイトの論文にある「成功率49.3%から89.3%」は、実在のサイトでの数字ですか
著者が作った試作の通販サイト2つで、3つのAIに5つの作業を10回ずつさせた結果です。論文自身が概念実証と位置づけ、実在のサイトでの評価を今後の課題に挙げています。
エージェント対応サイトの論文は、llms.txtを置くよう勧めていますか
勧めていません。論文にllms.txtの記述はありません。
挙げられているのは、構造化データ、サイトマップ、意味の通るHTML、分かりやすい部品の名前、根拠と情報の時点などです。
まとめ:今日できる1つのこと
自社サイトで、お客様がいちばん確かめたい条件を1つ選んでください。料金、納期、予約の空き、キャンセルの条件のどれかです。
その条件が、画像ではなく文字で、いつ時点の情報かと一緒に、1つのページで読めるかを確かめます。読めなければ、制作担当に上の表の頼み方で伝えてください。
人にもAIにも、同じページが読みやすくなります。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


