AI の答えが毎回違うのに、効果は測れるのですか?
測れます。ただし「1 回聞いて出たかどうか」ではなく、「何回聞いたうち何回出たか」で測ります。AI の答えが毎回違うことは、調査でも確かめられています。
米国の SparkToro は、600 人の協力者に、12 の質問を ChatGPT・Claude・Google の AI(AI による概要。出ないときは AI モード)へ入力してもらい、合わせて 2,961 回の答えを集めました[1]。その結果、同じブランドの一覧が 2 回返ってくるのは、100 回に 1 回未満でした[1]。同じ順番まで揃うのは、1,000 回に 1 回未満だったとしています[1]。
一方で、何度聞いてもほとんどの答えに出てくるブランドはありました。ところが、そのブランドでも、いちばん上に書かれるかどうかは答えによってばらばらでした[1]。「出てくる割合」は安定していても、「何番目に出るか」は安定しないということです。
同じ調査は、AI の中での「順位」を示す数字には意味がなく、たくさんの質問を何度も聞いたときの「出てくる割合」なら、妥当な指標になり得るとまとめています[1]。効果測定の物差しは、順位ではなく割合です。
何を指標にすれば、LLMO の効果を測れますか?
上司に報告するときは、次の 4 つを分けて数えると、何が良くなって何が残っているかを説明できます。「AI 引用率」という言葉は、ツールや記事によって分母や数え方が違います。ほかの数字と比べるときは、何を何で割ったかを必ず確かめます。
| 指標 | 何が分かるか | 数え方 | 架空の例 |
|---|---|---|---|
| 露出率 | AI の答えの中で、自社が紹介されているか | 自社の名前か製品名が出てきた答えの数 ÷ 集めた答えの数 | 21 回のうち 9 回に出てきた → 43% |
| 引用率 | AI が根拠として、自社のページを使っているか | 自社のサイトのページが引用元に入っていた答えの数 ÷ 集めた答えの数 | 21 回のうち 4 回で公式サイトが引用元 → 19% |
| 誤りの件数 | 紹介されたときに、正しく説明されているか | 製品資料の原文と食い違う記述の件数(価格・仕様・条件などの種類ごと) | 対応する規格の誤りが 3 件、古い型番が 2 件 |
| 競合との並び | 同じ質問で、ほかの会社がどれだけ出ているか | 同じ答えに出てきた会社ごとの回数と、その割合 | 競合 A は 21 回のうち 15 回、自社は 9 回 |
AI に紹介されなかった答えも「出てこなかった」という結果として残します。出てこなかった回を数えないと、露出率の分母が変わってしまい、直す前と後を比べられません。
何回、いくつの AI に聞けばよいですか?
「何回聞けば統計的に十分か」には、まだ決まった答えがありません。先の調査でも、それは今後の研究の課題とされています[1]。同じ調査は、1 つの質問について AI が挙げる顔ぶれを知りたいなら、少なくとも 60〜100 回は聞く必要があるとも書いています[1]。毎月の業務でそこまで聞くのは現実的ではないため、実務では次のように設計します。
| 決めること | 考え方 | 注意 |
|---|---|---|
| 質問の数 | 1 つの質問に頼らず、買う人が実際に聞きそうな質問を複数用意する | 質問を変えると割合も変わる。一度決めたら固定する |
| AI の数 | お客さまが使っていそうな AI を複数そろえる | Google の AI による概要と AI モードでも、使うモデルや手法が違う場合があり、答えとリンクも変わる[2] |
| 回数 | 1 つの質問を同じ AI に複数回聞き、割合にする | 1 つの質問の数回だけの割合は粗い。判断は質問をまとめた割合で行う |
| 頻度 | 毎月など、同じ間隔で測る | 1 回の結果より、月ごとの推移を見る |
ERABARE の既定は、7 つの AI に同じ質問を 3 回ずつ聞く設計です。無料診断では、1 製品・約 15 問を 7 つの AI に 3 回ずつ聞くため、合わせて 300 あまりの答えを見ます。1 つの質問の 3 回だけで良し悪しを決めるのではなく、「1 回で決めつけない」ための最小の反復として使い、判断は質問をまとめた割合と、月ごとの推移で行います。
直す前と後は、どう比べればよいですか?
比べるときにいちばん大切なのは、条件をそろえることです。質問の言い回しや回数が変わると、ページを直した効果なのか、聞き方が変わった影響なのかを区別できません。
質問を固定する
質問の文を一字一句そのまま保存し、聞く AI と回数も決めます。途中で質問を足すときは、元の質問とは分けて集計します。
直す前を測る
直す前の露出率・引用率・誤りの件数を記録します。できれば 2 回以上測り、もともとの揺れの幅を見ておきます。
変えたページを記録する
どのページの何を、いつ変えたかを記録します。複数のページを同時に変えると、どれが効いたかは分からなくなります。
反映を待つ
Google は、ページの更新の頻度に応じて、クロールに数日から数か月かかる場合があるとしています[2]。直した直後の結果だけで判断しません。
同じ条件で測り直す
固定した質問・AI・回数で測り、質問ごとに前と後を並べます。直したページと関係のない質問も一緒に測っておくと、AI 全体の変化と区別しやすくなります。
AI からの流入は、GA4 や Search Console で見られますか?
一部は見られます。ただし、流入の数字は「AI の答えに出たかどうか」の一部しか表しません。答えを読んで満足し、サイトを開かなかった人は数えられないからです。誤った説明をされていても、流入の数字には表れません。3 つの道具は、次のように使い分けます。
| 道具 | 見られること | 見られないこと・注意 |
|---|---|---|
| Google アナリティクス 4(GA4) | 2026 年 5 月に、既定のチャネルに「AI Assistant」が加わった[4]。ChatGPT・Gemini・Copilot・Grok などから来た訪問がここにまとまる[3] | 参照元が AI の一覧に一致した訪問だけが分類される[3]。Google の AI による概要と AI モードからの訪問は、このチャネルではなく、検索(オーガニック検索)のチャネルに含まれる[3] |
| Google Search Console | AI による概要と AI モードでの表示は、検索パフォーマンスの「ウェブ」に含まれる[2]。2026 年 6 月に、生成 AI の機能での表示だけを見る報告が一部のサイトで始まり、8 月 31 日の時点で世界のすべてのサイトに広がった[5]。表示回数をページ・国・端末・日付で見られる[6] | この報告で数えるのは表示回数で、対象は AI による概要と AI モード[6]。表示が少ないサイトでは、報告が出ないことがある[6] |
| Bing Webmaster Tools の AI Performance | 2026 年 2 月に公開プレビューとして始まった[7]。Microsoft Copilot や Bing の AI の要約などで、自社のページが引用元になった回数・引用されたページ・その推移が見られる[7] | AI が内容を探すときに使った語句(グラウンディングの語句)は、引用の一部の見本[7]。答えの中での位置や順位は表さない[7] |
ChatGPT・Claude・Perplexity・Grok の答えに自社が出ているかどうかは、上の道具だけでは分かりません。同じ質問を直接聞いて測る方法と、流入の数字を組み合わせて見ます。
「LLMO は意味ない」と言われたら、どう答えればよいですか?
誠実に答えるなら、「AI の答えに載ることを保証できる方法はない。ただし、測れば効いたかどうかは分かる」です。「意味ない」と言われる理由には、もっともなものもあります。理由ごとに答え方を分けます。
| 言われる理由 | 分かっていること | 答え方 |
|---|---|---|
| 載る保証がない | AI の答えは各社の仕組みで決まる。Google も、要件を満たしてもクロール・索引への登録・表示は保証されないとしている[2] | 保証はできない。だからこそ、直す前と後を同じ条件で測って判断する |
| 1 回聞いたら、出ていなかった | 同じ質問でも、同じ一覧が返ることはほとんどない[1] | 1 回の結果ではなく、繰り返して出てくる割合で見る |
| 特別な対策は要らないと Google が言っている | Google は、AI による概要と AI モードに出るための追加の要件や特別な最適化はないとしている[2] | その通り。やることは、AI が参照するページの事実を正しく書くことと、それを測ることになる |
| 流行りの施策を入れても変わらなかった | 約 30 万のドメインを調べた分析では、llms.txt を置いているかどうかと AI での引用の回数に、関係は見られなかった[8] | 効果の根拠が薄い施策は勧めない。測って変わらなければ、その施策はやめる |
「意味があるか」は、議論ではなく測った結果で答えます。同じ質問で直す前と後を比べ、変わらなければ打ち手を変える。この繰り返しが、上司にも説明できる LLMO の進め方です。
上司への報告は、どんな形にすればよいですか?
報告では「効果があった」と言い切るより、「同じ条件で測った割合が、いくつからいくつになった」と事実で書くほうが信頼されます。次の型を、毎月同じ形で使います。
| 項目 | 書くこと | 架空の例 |
|---|---|---|
| 測った条件 | 質問の数・AI の数・回数・測った日 | 15 問 × 7 つの AI × 3 回。前回と同じ質問 |
| 露出率 | 前回と今回の割合と、件数 | 28%(88/315)→ 37%(117/315) |
| 引用率 | 公式サイトが引用元になった割合と、引用されたページ | 9% → 15%。仕様のページが新たに引用された |
| 誤り | 見つかった誤りの件数と、直した件数 | 7 件のうち 4 件が解消。残る 3 件は古い型番 |
| 競合 | 同じ答えに出た競合の割合の変化 | 競合 A は 52% で横ばい |
| 実施した改善 | 変えたページと日付 | 製品の仕様のページに対応する規格の一覧を追加 |
| 次の打ち手 | 残った課題と、次に直すページ | 古い型番を説明しているページを特定し、新しい型番との違いを追記 |
AI からの流入(GA4 の「AI Assistant」など)は、参考の数字として添えます。露出率や誤りの件数と並べると、「答えには出ているが、クリックはされていない」のような状態も説明できます。
ERABARE では、どう測りますか?
ERABARE は、このページで説明した測り方を、毎月同じ条件で続けるためのサービスです。
同じ質問を、7 つの AI に 3 回ずつ
ChatGPT・Gemini・Claude・Perplexity・Grok・Google の AI による概要・Google の AI モードに同じ質問を聞き、自社が出てきた割合(露出率)を質問ごと・AI ごとに並べます。出てこなかったことも、結果として残します。
引用されたページと競合
AI が根拠にしたページを集め、自社のどのページが使われ、どのページが使われていないかを示します。同じ答えに出てきた競合と、その根拠になったページも確かめられます。
誤りを原文で確かめる
AI の答えを製品資料と照らし合わせ、価格・仕様・条件の食い違いを、資料のどこに書いてあるかと一緒に示します。原文にない値は推測で埋めません。
直した後も測り続ける
どのページに何を書けばよいかを改善カードで渡し、直した後も同じ質問で測り続けて、答えが変わったかを質問ごとに確かめます。年契約では、毎月の自動の観測と月 1 回の報告会で進めます。
Google の規約により、検索を使わない Gemini の答えを測っています。Google 検索の AI は「AI による概要」「AI モード」で測っています。AI の答えは各社の AI の仕組みで決まるため、ERABARE も紹介や順位を保証するものではありません。
よくある質問
AI 引用率と露出率は、何が違いますか?
露出率は、AI の答えの本文に自社の名前や製品名が出てきた割合です。引用率は、AI が根拠として示したリンクに自社のページが入っていた割合です。名前は出ても公式サイトが引用されない、引用はされても名前が目立たない、ということがあるため、分けて数えます。
LLMO の計測ツールを選ぶときは、何を確かめればよいですか?
同じ質問を繰り返して割合で出せるか、測る AI の種類、質問を固定して毎回同じ条件で測れるか、引用元のページが記録されるか、誤りを製品資料と照らして示せるか、を確かめます。1 回の答えの順位だけを出す方法は、答えの揺れを考えると判断の材料にしにくいです[1]。
自分たちだけで測ることはできますか?
できます。質問を 10〜20 ほど決め、同じ AI に同じ文で複数回聞いて、自社が出たか・どのページが引用されたかを表に記録します。手間はかかりますが、条件をそろえれば、直す前と後を比べられます。GA4・Search Console・Bing Webmaster Tools も、自社のサイトを登録すれば使えます。
効果が出るまで、どのくらいかかりますか?
決まった期間はありません。Google は、ページの更新の頻度に応じて、クロールに数日から数か月かかる場合があるとしています[2]。直した日を記録し、毎月同じ条件で測って推移を見ます。
AI の答えの中で、何番目に出たかは見なくてよいですか?
参考にはなりますが、判断の中心にはしません。同じ質問を繰り返しても、同じ順番の一覧が返るのは 1,000 回に 1 回未満だったという調査があります[1]。まずは「出てくる割合」を見ます。
出典
出典のリンクは、新しいタブで開きます。
- [1]
- [2]
- [3]
- [4]
- [5]
- [6]
- [7]
- [8]

