AI検索に質問すると、回答の下にいくつかの出典が並びます。どんな種類のサイトが出典に選ばれているのか。
回答は、質問の言い方にどれくらい引きずられるのか。この2つを、実際のサービスに同じ質問を毎日投げて確かめた研究があります。
カナダのブリティッシュコロンビア大学の2人が2024年5月にarXivで公開し、同じ年の情報科学の学会(ASIS&T)の年次大会に採択された論文です。
調べた対象は、2023年6月時点のChatGPT(GPT-3.5)、Bing Chat(現在のCopilot)、Perplexityの3つです。
出典と語り口の分析は、出典を示すBing ChatとPerplexityの2つに絞っています。この記事では、原文の表から数値を拾い、何が分かって、何がまだ分かっていないのかを整理します。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AIに引用される側を目指す前に、AIがどんな出典を選び、どんな口調で答えているのかを、実測のデータで知っておくためにこの論文を読みました。
結論:3行で言うと
- 質問の感情の向き(前向きか後ろ向きか)と回答の感情の向きには中程度の相関(0.46)がありました。Bing ChatとPerplexityでは、回答の約8割が質問の見方に沿う内容でした
- 出典はニュース・報道(21.8%)と企業サイト(17.9%)が多く、学術出版社や教育機関はそれぞれ3%前後でした。代替エネルギーの話題では、企業サイトが約4割を占めています
- 引用の65%は米国のサイトでした。質問はカナダから出しています。データは2023年6月の英語の質問だけで、今のサービスや日本語の質問に当てはまるかは確かめられていません
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Generative AI Search Engines as Arbiters of Public Knowledge: An Audit of Bias and Authority |
| 著者 | アリス・リー、ルアン・シナモンの2人。所属はどちらもカナダのブリティッシュコロンビア大学 |
| 公開日 | 2024年5月22日(arXiv初版。確認した時点で版はv1のみ) |
| arXiv番号 | 2405.14034(分類は情報検索、人とコンピューターの相互作用) |
| 掲載・採択状況 | 論文の1ページ目に「第87回ASIS&T年次大会(2024年10月25〜29日、カナダ・カルガリー)に採択された、査読前の版」と記載。arXivのコメント欄は空欄。正式版は情報科学技術協会(ASIS&T)の会議録、第61巻1号に掲載(文献データベースの登録情報で確認) |
| 種類 | 大学の研究者が、公開中のAIサービスを外から調べた監査研究 |
| 実験データとコード | 論文中に公開先の記載は見当たりませんでした |
| 研究資金 | カナダの政府系の研究助成と、大学の学生研究賞(謝辞に記載) |
論文はこちらで読めます。arXiv(2405.14034)、会議録の正式版(DOI:10.1002/pra2.1021)。
この記事はarXiv版を読んで書いています。
この論文が答えた問い
論文が立てた問いは2つです。
生成AIの回答は、質問の言い方や話題によって、感情の向きが偏るのか。そして、AI検索は回答の中で、どうやって「頼れる答え」らしさを作っているのか。
情報学では、人が専門知識の出どころとして頼る相手を「認知的権威」と呼び、検索エンジンはその代表とされてきました。AI検索は、リンクの一覧の代わりに答えそのものを書きます。
著者は、その分だけ世論への影響が大きくなり得ると考え、公共性の高い話題で調べました。
どうやって調べたのか
方法は「アルゴリズム監査」です。外から同じ質問を繰り返し投げ、返ってきた回答を記録して、仕組みの癖を調べます。
| 項目 | 設定 |
|---|---|
| 対象 | ChatGPT(GPT-3.5)、Bing Chat(GPT-4。後にCopilotへ改名)、Perplexity(当時はGPT-3.5)。いずれも無料で使える版 |
| 話題 | 気候変動、ワクチン接種、代替エネルギー、メディアへの信頼の4つ |
| 質問 | 話題ごとに12問、計48問。すべて英語。検索エンジンの検索候補を集める有料サービスから、2023年5月にカナダで多かった質問を選び、前向き・後ろ向きの言い方が混ざるようにした |
| 期間 | 2023年6月の1週間。毎日、48問を3つのサービスに投入し、回答は計1,008件 |
| 投げ方 | PerplexityとChatGPTは規約で自動取得を禁じているため(Bing Chatは規定が見当たらなかった)、手作業で入力。大学の共用パソコン、既定の設定、1問ごとに新しい会話で、最初の回答だけを記録 |
| 分析 | 感情の向きは言語モデルで自動判定。語り口と立場は人が分類。出典は3,448件を355のドメイン(サイト単位)にまとめ、人が14種類に分類 |
「感情の向き」は、文章が前向きか後ろ向きかを、-1から+1の数で表したものです。論文の例では、「気候変動の利点」という質問が+0.76、「気候変動は人類を滅ぼすか」が-0.57でした。
同じ話題の中で、言い方の向きを変えた質問を並べています。
語り口と立場の分類は、第一著者が全672件を担当しました。研究に関わっていない1人が1割(67件)を別に分類し、一致の度合いを確かめています。
最初の一致度は0.59で、基準を見直した2回目は0.71でした(1が完全な一致を表す指標)。
結果
回答は、質問の感情の向きに寄っていた
論文の本文と表3から、サービスごとの数値を拾いました。
| サービス | 質問と回答の相関 | 回答の感情(中央値) | 回答の長さ(平均語数) | 出典数(1回答の平均) | 文章の難しさ(米国の学年換算) |
|---|---|---|---|---|---|
| ChatGPT | 0.435 | -0.01 | 336 | 出典なし | 測定なし |
| Bing Chat | 0.454 | -0.10 | 123 | 5.13 | 9.87 |
| Perplexity | 0.509 | -0.19 | 243 | 5.14 | 12.82 |
| 3つ全体 | 0.46 | 記載なし | 234 | 記載なし | 記載なし |
- 3つのサービスとも、相関は0.4〜0.5の同じくらいの強さでした。質問が前向きなほど、回答も前向きになる傾向です。論文は、回答の感情のばらつきの21%を質問の感情の向きで説明できる、と書いています
- 話題でも差が出ました。回答の感情の中央値は、気候変動が-0.33、メディアへの信頼が-0.39と後ろ向きで、ワクチンが0.25、代替エネルギーが0.24と前向きでした。解決策を扱う話題のほうが前向きで、論文はモデルと元のウェブ上の文章の感情を反映したものだろうと述べています
- Perplexityの回答は、他の2つより後ろ向きの値でした。文章も難しく、論文は大学レベル、Bing Chatは中学・高校レベルと述べています
- 論文は、この相関から因果関係までは言えないと断っています。そのうえで、話題の中で質問の向きだけを変えているので、話題の違いが原因とは考えにくい、と説明しています
回答の約8割は、質問の見方に沿っていた
表4から、Bing ChatとPerplexityの回答の語り口と立場を拾います。上の6段は、語り口と立場のそれぞれで、どれか1つに振り分けた割合です。
下の段は、1つの回答に複数あれば全部数えています。
| 分類 | Bing Chat(336件) | Perplexity(336件) |
|---|---|---|
| 「私」を主語に語る | 81.0% | 3.9% |
| 「検索結果によると」など、三人称や受け身で語る | 13.6% | 86.0% |
| 「私たち」を主語に語る | 5.4% | 10.1% |
| 質問の見方を支持する | 81.3% | 81.0% |
| 中立の立場を取る | 6.8% | 8.9% |
| 質問の見方に反対する | 11.9% | 10.1% |
| 「専門家は」「科学者は」と一般的な権威を持ち出す | 56.2% | 56.0% |
| 具体的な機関名などを権威として示す | 53.3% | 53% |
| 数字や統計を示す | 51.2% | 45.2% |
| 「一方で、〜と考える人もいる」と両論を並べる | 25.9% | 39.0% |
| 「〜かもしれない」「一部の」などのぼかし表現 | 74.1% | 83.6% |
| 自分の知識の限界に触れる | 0.3% | 2.4% |
- 語り口が、2つのサービスで正反対でした。Bing Chatは「私」を主語に語り、Perplexityは検索結果を根拠として示す語り方が86.0%です。論文は、前者を自ら知る者として、後者を仲介者として権威を作る方法だと読んでいます
- 反対は1割ほどでした。主に、事実と逆の前提を含む質問に対してです。たとえば「気候変動は人間のせいではない」「代替エネルギーはなぜ悪いのか」といった質問です
- ぼかし表現は、Perplexityで83.6%の回答に含まれていました。論文は、主張を弱めると同時に、提供者の責任や評判の危険を小さくする働きがあると指摘しています
- 科学的な合意がはっきりした話題でも、「一部の人は」と少数意見を並べる回答がありました。論文はこれを、報道が中立らしさを優先して科学の合意を薄めてきた問題と重ねて、懸念を示しています
- 権威として企業名や商品名が出る例もありました。Bing Chatが再生可能エネルギー株の質問に個別の企業の株を挙げた例や、Perplexityが代替エネルギーの質問で特定の1社をたびたび挙げた例です
出典は、ニュース・企業・政府の3種類で半分を超えた
表5から、出典の種類ごとの割合を拾います。論文は14種類に分けています。
この表では、全体で1%未満の3種類(個人サイト、検索エンジン、その他)を省きました。
| 出典の種類 | Bing Chatの出典 | Perplexityの出典 | 全体 |
|---|---|---|---|
| ニュース・報道機関 | 26.2% | 17.4% | 21.8% |
| 企業 | 14.3% | 21.6% | 17.9% |
| 政府 | 17.0% | 16.1% | 16.5% |
| 非営利団体 | 10.1% | 16.5% | 13.3% |
| 分野特化のウェブメディア | 15.1% | 8.3% | 11.7% |
| 非政府組織 | 6.8% | 5.0% | 5.9% |
| 専門職・学術の団体 | 1.5% | 4.7% | 3.1% |
| 学術出版社・論文誌 | 3.0% | 3.0% | 3.0% |
| 教育機関 | 2.6% | 2.6% | 2.6% |
| 政策研究機関 | 1.2% | 2.2% | 1.7% |
| SNS | 1.2% | 1.6% | 1.4% |
- 上位3種類の合計は、全体で約56%でした(概算:21.8+17.9+16.5)。質が高いとされやすい学術系の4種類は、どれも3%前後以下です
- サービスで出典の顔ぶれがほとんど重なりませんでした。355のドメインのうち、Bing Chatだけが引用したのが28%、Perplexityだけが46%、両方が26%です。4分の1のドメインは、全データの中で1回しか引用されていません
- 話題によって、出典の種類が入れ替わりました。気候変動とワクチンでは政府系が多く(Bing Chatのワクチンで36.2%、Perplexityの気候変動で32.2%)、代替エネルギーでは企業が約4割(Bing Chatで40.0%、Perplexityで43.6%)でした
- 論文は、企業サイトの多さを「商業的な偏り」と呼んでいます。企業がブログ記事で検索順位を狙ってきた結果か、広告に近い仕組みへの一歩か、の2つの可能性を挙げ、どちらかの判断は保留しています
- 質の低い出典も混ざっていました。作文代行サービス、高校生の生物の課題、気候変動を否定する記事、広告目的の量産サイトなどです。論文は、一覧の中の1件なら読み手が飛ばせるが、AIの回答では出典の1つ1つが答えの一部になるので、より高い基準が必要だと述べています
サービスごとに出典がほとんど重ならない点は、GEOとLLMOの研究をまとめたサーベイ論文の解説でも、実サービスの監査の1つとして取り上げています。
引用の65%は、米国のサイトだった
- 出典のサイトは24か国にまたがっていました。ただし、ドメインの95%は米国、英国、カナダと国際機関のものでした
- 引用の65%は米国のサイトです。質問はカナダから出しているので、論文はカナダの出典の少なさを意外だったと書いています
- Bing Chatは、Perplexityより英国とカナダの出典が多く、米国の出典が少なめでした。Bing Chatでは、ワクチンの質問でカナダの出典が増えていて、論文は位置情報をある程度使っている可能性に触れています
論文自身が書いている限界
- 調べたのは4つの公共的な話題で、時点も2023年6月の1回だけです。一般的な傾向と言うには、調査を広げる必要があると論文は書いています
- 人を対象にした実験は含まれていません。利用者が回答をどう受け取り、どれだけ信じるかは、今後の利用者調査で確かめるとしています
- 出典のページが、回答の主張を本当に支えているかは調べていません。分析はドメイン単位です
- 各サービスの中の仕組みは非公開で、どの程度まで利用者の地域に合わせているかも分かっていません
原文を読んで気づいた点
- 日本語での検証はありません。質問はすべて英語で、カナダから出しています。日本語で聞いたときに出典の国や種類がどうなるかは、この論文からは読み取れません
- 観測は2023年6月のサービスです。当時の名前はBing Chatで、Perplexityは当時GPT-3.5を使っていたと論文に書かれています。いまのCopilotやPerplexityはモデルも検索の仕組みも変わっているので、数値はその時点の記録として読むのが適切です
- 感情の向きは、公開されている感情分類の言語モデルによる自動判定です。人が判定を確かめたという記述は見当たりませんでした。語り口と立場の分類は人手ですが、全件を担当したのは第一著者1人です
- 査読の状況:arXiv版は、論文自身が「査読前の版」と明記しています。正式版は学会の会議録に載っています。正式版とarXiv版の差分は、この記事では確かめていません
- 数え方の単位に曖昧さがあります。図1の件数(3,190件)は、出典3,448件の約92.5%に当たります(概算:3,190÷3,448)。図の説明にある「ドメインの95%」とは一致しません。表5の割合も、ドメインの数と引用の回数のどちらで数えたかが明記されていません(値の細かさからは、引用の回数で数えたと読めます。私の推定です)
- Bing Chatでは同じ回答が別の日に返った例が少しあり、そのまま分析に含めています(方法の節)。件数の記載はありません
- 質問は公共的な話題の48問だけです。商品選びや地域のお店探しのような、中小企業に近い質問は含まれていません
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 2023年6月の3つのサービスで、質問の感情の向きと回答の感情の向きに中程度の相関があった | いまのCopilotやPerplexityでも、同じ強さの相関があること |
| Bing ChatとPerplexityの回答の約8割が、質問の見方を支持していた | 日本語の質問でも、同じように質問に寄ること |
| 出典はニュース・企業・政府で半分を超え、学術系はそれぞれ3%前後以下だった | 出典のページが、回答の主張を正しく支えていたかどうか |
| 代替エネルギーの話題では、企業サイトが約4割を占めた | 企業がブログを書けば、AIに引用されるようになること |
| 2つのサービスの出典は、両方に共通するドメインが26%にとどまった | 利用者が、どちらの語り口をより信じるか |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
自社の見え方は、前向き・後ろ向きの両方の聞き方で確かめる
回答が質問の向きに寄るなら、「〇〇社の評判は?」と「〇〇社はなぜ評判が悪い?」
では、違う答えが返ってくる可能性があります。自社がAIでどう語られているかは、言い方を変えた質問を並べて確かめるほうが実態に近づきます。
話題ごとに、選ばれる出典の種類が違う
健康や環境のような公共性の高い話題では政府系が、代替エネルギーの話題では企業サイトが多く引用されました。著者は商業的な話題として設計していなかったが、2つのサービスは代替エネルギーを商業的な質問として扱ったように見えた、と論文は書いています。
自社の分野が、どちらに近い話題として扱われているかを知っておくと、自社サイトが出典に入る余地を見積もりやすくなります。ただし、これは2023年の英語の観測です。
「企業サイトも引用される」を、手放しで喜ばない
論文は、企業サイトの多さを良い知らせとしては書いていません。質の低い出典が混ざることへの懸念として書いています。
サービス側が今後、出典の質を厳しく見るようになれば、根拠の薄い記事は外される側に回ります。引用される側を目指すなら、数字や主張の元になった一次資料を、記事の中で自分から示しておくのが筋です。
ニュースと第三者の記事の比重は、以前から大きかった
2023年の時点で、出典の2割強はニュース・報道でした。AI検索が第三者の記事を重く見る傾向は、第三者の情報源が偏って引用されることを示した別の論文でも扱っています。
業界紙や地域の報道で紹介されることも、見え方の一部と考えておくとよさそうです。
よくある質問
生成AI検索の偏りと権威を調べたこの監査論文の結果は、今のCopilotやPerplexityにも当てはまりますか
そのまま当てはめることはできません。観測は2023年6月の1週間で、当時のBing ChatとPerplexityが対象です。
その後、どちらもモデルや検索の仕組みが変わっています。「質問の言い方で回答の向きが変わり得る」「出典の種類は話題で入れ替わる」という見方は、今のサービスを確かめる観点として使えます。
AI検索の出典に企業サイトが多いという監査結果は、自社ブログを増やせば引用されるという意味ですか
その意味にはなりません。論文は企業サイトが多い理由を2つの可能性として挙げただけで、判断は保留しています。
質の低い商業サイトが混ざることを問題として書いている点も大切です。ブログの本数と引用の関係は、この論文の調査の外にあります。
AI検索の回答が質問の感情の向きに寄る偏りは、日本語の質問でも起きますか
この論文には、日本語で確かめたデータがありません。質問はすべて英語で、カナダから出しています。
日本語でも起きる可能性はありますが、確かめるには日本語で同じような調査を行う必要があります。
まとめ:今日できる1つのこと
自社の業種で、お客様がAIに聞きそうな質問を1つ選んでください。それを前向きな言い方と後ろ向きな言い方の2通りに書き換え、AI検索に聞きます。
回答の向きがどう変わったかと、出典がニュース・企業・公的機関のどれだったかをメモしておくと、自社の分野でAIが何を頼りに答えているかが見えてきます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


