「アスパルテームは発がん性があるか」。この質問には、賛成派と反対派の両方の記事がインターネット上に存在します。
検索で見つけた文章をAIに読ませて回答を作る仕組み(RAG、検索拡張生成)にこの質問を投げると、AIは矛盾した文章を読んだうえで、どちらか一方の答えを選ぶことになります。
では、AIはどちらの文章を「説得力がある」と判断しているのでしょうか。この問いに正面から取り組んだのが、2024年2月に公開され、同年のACL(自然言語処理分野の主要な国際会議)に採択された論文「What Evidence Do Language Models Find Convincing?(言語モデルはどんな証拠を説得力があると判断するのか)」です。
この記事は、その論文を原文から読み、何を測って、何が分かったのかを整理します。この論文はGEO(Generative Engine Optimization、生成エンジン最適化)という言葉が広まる前の基礎研究で、AIの「引用のされやすさ」ではなく、AIが出す結論そのもの(賛成か反対か)をどんな証拠が動かすのかを調べたものです。
数値はすべて論文の本文・表から拾いました。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読むのは、「文章に権威性や科学的根拠を足せばAIに評価される」という説明が、どこまで実験で確かめられたものかを、自分たちで確かめておくためです。
結論:3行で言うと
- 賛否が分かれる質問について、対立する証拠の文章をAIに読ませたとき、AIは質問との関連性が高い文章を強く重視し、それ以外の要因にはあまり影響されませんでした
- 人間が信頼性の手がかりにする読みやすさや語彙の多様さは、AIの判断とほとんど相関しませんでした。科学的な出典や自信のある文体を足す書き換えも、効果は中立か、むしろ下がる方向でした
- 文章の内容をほとんど変えずに関連性だけを高める、ごく小さな書き換えでも、AIの回答を動かせることが分かりました
ただし、この結果は2023年時点のモデルと、実験用に作ったデータセットで得られたものです。日本語での検証や、いまのAIサービスへの当てはめは、論文自身が確認していません。
この点は後の章で整理します。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | What Evidence Do Language Models Find Convincing? |
| 著者 | Wan、Wallace、Klein(3人。所属はアメリカのカリフォルニア大学バークレー校) |
| 公開日 | 2024年2月19日(初版)。確認した版は2024年8月9日のv2 |
| arXiv番号 | 2402.11782(分野は自然言語処理と機械学習) |
| 掲載・採択状況 | ACL 2024の本会議に採択(査読あり)。arXivのコメント欄に採択の記載があります |
| 種類 | 実証研究。新しいデータセットを作り、複数のAIモデルで実験しています |
| 実験データ・コードの公開先 | 論文にGitHubのリポジトリが記載されています |
論文はこちらで読めます。arXiv(2402.11782)。
この論文が答えた問い
検索で見つかった、賛否が対立する証拠の文章をAIに読ませたとき、AIはどの文章を説得力があると判断して自分の回答に取り込むのか。それは、人間が説得力を感じる理由と同じなのか。
人間は、文章の説得力を判断するとき、出典の信頼性を確かめたり、これまでの知識と照らし合わせたり、論理の運び方を検討したりします。
これらは過去の心理学・情報行動の研究で確かめられてきた手がかりです。AIが検索結果を読んで答えを作る場面が増えるいま、AIも同じ手がかりを使っているのか、それとも別の基準で判断しているのかは、まだよく分かっていませんでした。
この論文は、そこを実験で確かめています。
どうやって調べたのか
ConflictingQAというデータセットを作った
論文は、この研究のためにConflictingQAというデータセットを新しく作りました。手順は次のとおりです。
| 手順 | 内容 |
|---|---|
| 質問を作る | GPT-4を使い、分野ごとに賛否の分かれる質問を生成。191の分野(薬理学、オンライン教育、生物多様性など)にわたる |
| 関連する文章を集める | 質問を肯定文・否定文の両方に言い換え、それぞれでGoogle検索を行い、上位20件のページを取得 |
| 本文だけを抜き出す | ページから本文だけを取り出す専用のツールを使う。出典のURLや公開日、見出しといった付随情報は、AIに渡す文章にあえて含めない |
| 立場を判定する | 2つの異なるAI(claudeとGPT-4の系列)が一致して同じ立場だと判定した文章だけを残す。判定が割れた文章や、質問と無関係と判定された文章は除く |
| 関連箇所を切り出す | 質問との近さを測る専用の検索モデルを使い、文章の中で最も質問に近い512トークン分の範囲を1つ取り出す。近さの基準に届かない文章は除く |
あるモデル(LLaMA-2 Chat)を評価する時点でのデータセットの規模は、次のとおりです。
| 項目 | 数値 |
|---|---|
| 質問数 | 238問 |
| 質問の分野数 | 144分野(全191分野のうち、この評価に使われた数) |
| 取得した文章数 | 2,208件 |
| 文章1件あたりの平均語数 | 約365語 |
| 5件以上の比較に使われた文章 | 912件 |
| 文章1件あたりの平均比較回数 | 6.54回 |
集めた文章の出どころ(トップレベルドメイン)は、企業や個人のサイトを表す「.com」が527件と最も多く、次いで団体を表す「.org」が175件、政府機関の「.gov」が59件、教育機関の「.edu」が57件、ネットワーク関連の「.net」が12件でした。データセット全体では、39種類のトップレベルドメインが含まれています。
「説得力」をどう数値にしたか
論文は、AIに賛成側の文章1つと反対側の文章1つを同時に見せ、「この文章だけを根拠に、質問にYesかNoで答えてください」と指示します。
ある文章について、これを異なる反対側の文章と何度も組み合わせ、AIの答えがその文章の立場と一致した割合を「勝率」と呼びます。
文章を提示する順番による偏りを避けるため、順番を入れ替えた両方で測定し、比較相手が5件に満たない文章は集計から外しています。
論文はもう1つ、別の測り方も試しています。文章を1つだけAIに見せて「この文章は5段階でどれくらい説得力がありますか」と直接尋ねる方法です。
しかし、この直接尋ねた評価と、先ほどの勝率とのあいだにはほとんど相関が見られませんでした。論文は、AIは1つの文章だけを見て、その説得力を言葉で言い当てるのが苦手だと述べ、以降の分析では実際の質問応答に近い、勝率による測り方を主に使っています。
対象にしたAI
| 区分 | モデル |
|---|---|
| 公開されているモデル | LLaMA-2 Chat、Vicuna v1.5、WizardLM v1.2 |
| 非公開のモデル | GPT-4、Claude v1 Instant |
すべてのモデルに「上の文章の情報だけを使って答えてください」と指示しています。これは、モデルが元々持っている知識や考えではなく、渡された文章の性質そのものを見るための工夫です。
結果
何がAIの判断と相関するか
論文は、文章のさまざまな特徴を自動で数値化し、勝率との相関を調べました。
| 特徴 | 何を測るか | 結果 |
|---|---|---|
| 読みやすさ(Flesch-Kincaid法) | 1文の平均長と、単語の音節数から算出 | すべてのモデルで、勝率との相関はほぼありません |
| 語彙の多様さ | 文章内の異なり語(ユニークな単語)の数 | すべてのモデルで、勝率との相関はほぼありません |
| 文の調子(感情) | FLANというモデルによる、肯定的な調子である確率 | 弱い影響。強さはモデルによって違います |
| 文章の複雑さ(困惑度) | 別のAIモデルによる、文章の予測しにくさ | 弱い影響。あるモデルは複雑でない文章をやや好む傾向でした |
| 質問との語の重なり | 質問と文章に共通する、最長の連続した語句 | 弱いながら、正の相関があります |
| 質問との意味的な近さ | 質問と文章を、意味の近さとして数値化した指標 | GPT-4を除くすべてのモデルで、強い正の相関があります |
読み取れることを整理します。
- 人間が重視しがちな「読みやすさ」は、AIの判断とほぼ無関係でした。文章の分かりやすさそのものは、説得力の判断材料になっていません
- 最も強く効いたのは、質問との意味的な近さでした。質問の意図に正面から答えている文章ほど、勝率が高くなる傾向です
- GPT-4だけ、この相関が弱いという結果でした。ただしGPT-4の分析に使われた文章数は38件と少なく、他のモデル(242件〜334件)より母数がかなり小さい点には注意が必要です
実際に書き換えると、判断は動くのか
相関を調べるだけでは、原因と結果の関係までは分かりません。そこで論文は、AIを使って文章を実際に書き換え、勝率がどう変わるかを確かめる実験も行いました。
書き換え方は10種類あり、大きく2つに分かれます。
| 種類 | 書き換え方 | やること |
|---|---|---|
| 関連性を上げる | 文章の書き換え | 質問に関する語句を増やし、質問に答える文を強調する、大きめの書き換え |
| 関連性を上げる | 一文の追加 | 立場をはっきりさせる一文だけを追加する、最小限の変更 |
| 関連性を上げる | 質問文の前置き | 「この文章は次の質問についてです」という一文を先頭に置く |
| 関連性を上げる | キーワードの詰め込み | 質問に関連する語句を使った文を追加する |
| 見た目・文体を変える | 科学的な出典を足す | 内容は変えず、科学文献への言及を追加する |
| 見た目・文体を変える | 情報を足す | 質問と直接関係のない、話題に関する文を6つ追加する |
| 見た目・文体を変える | 連絡先を足す | 架空の著者名と電話番号を文末に加える |
| 見た目・文体を変える | 自信のある書き方にする | 断定的で、曖昧さのない文体に書き換える |
| 見た目・文体を変える | 専門的な言葉にする | 専門用語を使った文体に書き換える |
| 見た目・文体を変える | 客観的な書き方にする | 客観的な調子の文体に書き換える |
比較の基準として、文末に「読んでくれてありがとう」という一文を足しただけの、内容にほとんど影響しない書き換えも用意しています。
結果は、はっきり分かれました。関連性を上げる4つの書き換えは、いずれも基準より勝率が上がりました。
「一文の追加」や「質問文の前置き」のように、変える語数がごくわずかな書き換えでも、勝率は大きく上がっています。
一方、見た目や文体を変える6つの書き換えは、基準と変わらないか、むしろ下がる方向でした。科学的な出典を足す書き換えや、自信のある文体・専門的な言葉にする書き換えも、この中に含まれます。
論文は、書き換えが狙いどおりに関連性を上げていたかどうかも、別の指標(質問と文章に共通する、最長の語句の長さ)で確かめています。
| 書き換え方 | 種類 | 質問との語の重なり |
|---|---|---|
| 質問文の前置き | 関連性 | 6.89 |
| 文章の書き換え | 関連性 | 5.08 |
| 一文の追加 | 関連性 | 3.64 |
| キーワードの詰め込み | 関連性 | 2.47 |
| 情報を足す | 見た目・文体 | 2.46 |
| 連絡先を足す | 見た目・文体 | 2.41 |
| 科学的な出典を足す | 見た目・文体 | 2.38 |
| 客観的な書き方にする | 見た目・文体 | 2.15 |
| 自信のある書き方にする | 見た目・文体 | 2.17 |
| 専門的な言葉にする | 見た目・文体 | 1.97 |
関連性を狙った4つの書き換えのほうが、見た目・文体を変える6つの書き換えより、この数字が高くなっています。狙いどおりに関連性を強められていたことが確かめられたうえで、その関連性の高さがそのまま勝率の上昇につながった、という組み立てです。
この論文は、キーワードの詰め込みも「関連性を上げる書き換え」の1つとして扱っており、勝率を上げる方向の結果でした。一方、この論文と同時期に発表され、当サイトで別に解説したGEO原論文(2311.09735)では、語数・位置などの客観指標では効果が出ず、主観的な目立ち方の指標ではわずかに上がる、という結果でした。
2つの論文は、測っている指標(この論文はAIが出す結論そのもの、GEO原論文は回答の中での取り分)も、実験の作り方も異なるため、単純に優劣は比較できません。
ただし、同じ「キーワードの詰め込み」という手法でも、研究によって結果が違うことがある、という例として押さえておく価値はあります。
論文自身が書いている限界
論文は最後に、限界を自分で挙げています。
- ConflictingQAは多様な質問を集めていますが、実際にAIが使われる場面の複雑さを、すべて捉えられているわけではありません
- 実験は、対立する文章2つを同時に見せる設定に絞っています。実際のAIサービスでは、もっと多くの文章が一度に渡されることもあります
- 回答はYesかNoの二択に絞っています。実際のAIの答えは、もっと含みのある言い方になることもあります
- 文章そのものに焦点を当てており、出典のURLや公開日、見た目といった要素は扱っていません
- AIがウェブの大部分を読み、かつ生成してもいるという、より広い倫理的な論点までは扱っていません
加えて、この記事を書くために原文を読んで気づいた点があります。
- 実験に使われた質問と文章はすべて英語です。日本語での検証は報告されていません
- 対象になったのは2023年当時のモデル(LLaMA-2、Vicuna、WizardLM、GPT-4、Claude v1 Instant)です。現在使われているAIサービスと同じ挙動とは限りません
- 「勝率」の評価はすべて自動計算で、人手による採点は行われていません。AIの答えがそのまま集計されています
- 書き換えに使われた文章もAIが作ったものです。追加された情報や出典が事実かどうかは、評価の対象に入っていません
- GPT-4だけ相関が弱いという結果でしたが、GPT-4の分析対象は38件と、他のモデルより少なくなっています
- AIに渡す文章から、出典のURLや公開日をあえて除いているのは、一般的なRAG(検索で集めた情報をAIに読ませる仕組み)の設計に合わせ、かつAIモデルが視覚情報を扱わないためと論文は説明しています。この情報を含めた場合に結果が変わるかどうかは、この論文では確かめられていません
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 質問との関連性が高い文章ほど、AIの判断に強く影響した | 日本語の文章でも、同じ強さで同じ結果になること |
| 読みやすさや語彙の多様さは、判断とほぼ無関係だった | いま使われているAIサービスで、同じ結果になること |
| 科学的な出典や自信のある文体を足しても、効果は中立か下がる方向だった | 人間の読者にとっても、これらの要素が説得力を持たないこと |
| ごくわずかな書き換えでも、関連性を上げればAIの答えを動かせた | 検索での見つかりやすさや、実際のアクセス・成約への影響 |
| AIは、単独の文章の説得力をうまく言葉で言い当てられなかった | 足した数字や出典が、事実として正しいかどうか |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- まず、質問に正面から答えているかを確認する。この論文で最も強く効いたのは関連性でした。専門用語や自信のある言い回しを足す前に、読者が実際に知りたいことに答えているかを見直す方が、優先順位が高いといえます
- 権威性を演出する書き換えだけでは、この論文の設定では効果が薄いようです。ただし、これはAIの回答への影響を測った結果であり、人間の読者が出典をどう受け取るかは、この論文の対象外です。両者を混同しない方がよいでしょう
- AIに書き換えさせた数字や出典は、そのままでは使えません。この論文でも、追加した情報が事実かどうかは評価されていません。自社のページに数字や出典を足す場合は、元の資料で必ず裏を取ってください
- キーワードの詰め込みの効き方は、研究によって割れています。1つの論文の結果だけで、特定の手法の是非を決めつけない方が安全です
よくある質問
この論文は、LLMOやGEOの論文ですか
いいえ。この論文は「RAG(検索拡張生成)」や「説得力」という言葉を使っており、LLMOやGEOという言葉は使っていません。
ただし発表時期は近く、論文自身も、AIの回答での取り分を最適化しようとする同時期の研究(GEO原論文)に触れています。違いは、GEO原論文がAIの回答の中での取り分(引用のされやすさ)を測ったのに対し、この論文はAIが出す結論そのもの(YesかNoか)がどれだけ動くかを測っている点です。
結局、何が一番効くのですか
論文の結果でもっとも効いたのは、質問との関連性でした。文章の見た目や文体を変える書き換えより、質問の意図に正面から答える文章にすることのほうが、AIの判断に強く影響しています。
科学的な出典を足すのは、無意味ということですか
この論文の実験では、効果は中立か、下がる方向でした。ただし、これはAIに読ませたときの結果です。
人間の読者にとって出典が信頼の手がかりになるかどうかは、別の話として扱う必要があります。
まとめ:今日できる1つのこと
自社のいちばん読まれているページを1つ開き、想定する読者の質問に、最初の数行で正面から答えているかを確かめてください。専門用語や自信のある言い回しを足す前に、まず関連性を見直すことが、この論文からの一番シンプルな教訓です。
この論文は、LLMOという言葉が広まる前に書かれた基礎研究です。次に読む論文では、この結果が生成エンジンの実際の回答や、日本語の環境でどこまで当てはまるのかを追います。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


