日本市場の測定方法

状態を分け、分母と証跡を残す。

ja-JPの全国基準と47都道府県の対象設定を、異なる証拠レールと混同せず測定します。

日本SEO + AEO + GEO + AIO + LLMO日本語の購買質問検索・AI回答を分離測定再測定可能な証跡完全非同期デリバリー

日本市場の可視性を、異なる結果ごとに分けて測定

収集失敗、AI回答の非表示、ブランド不在、ブランド言及、直接引用、事業成果を、それぞれ固有の分母と証跡で分けて測定します。

測定層確認する質問主な証拠意思決定
SEO発見日本の検索結果で見つかるか日本向け検索表示、順位、委任されたSearch Consoleデータ索引、サイト構造、需要獲得
AI取得ブランドや対象ページが取得されたか取得ソースと対象URLのレシート根拠へのアクセス性
AI回答名前が言及または直接引用されたか回答本文、引用URL、何回目の測定か、判定レシートエンティティ明確性、根拠力、回答適合性
事業成果自社流入とコンバージョンが動いたかGSC、Bing、GA4の委任データを外部観測と分離予算配分と次期優先順位

測定の前提 — パーソナライズ適用前のベースライン応答を測ります。 自動測定はログインなし・履歴なしの条件で行うため、数値は各表面のパーソナライズ以前の ベースライン可視性を示します。個々のユーザーが見る回答は、利用履歴やアカウント状態により これと異なる場合があります — だからこそ単発のキャプチャではなく、同一条件の繰り返し観測と 時系列で読みます。この基準条件はペルソナやメモリーが介入しないAPI統制条件で測定しており、 実ユーザー表面での回答変動は、知名度が中位のブランドで最も大きく観測されます。

ベースライン可視性は、注記ではなく測定の定義言語です。当社が測る ステートレス条件は、プラットフォーム自身が「パーソナライズ以前」と定義する状態と同じ層にあります。 OpenAIは一時チャット(Temporary Chat)を、メモリーを作らず使わないモードとして公式に説明しています (OpenAI公式ドキュメント)。GoogleもGeminiの一時チャットを、同じ層のものとして 説明しています(Google公式ブログ)。実際のユーザーの回答はこのベースラインから 出発し、アカウント状態や履歴で分岐します。では、ベースラインで見えないブランドが、パーソナライズの段階で 救済されるのか。それを示す公開された実証は、当社が確認した範囲では見当たりません。 外部ベンチマークはむしろ逆を測っています。モデルは、はっきり示されたユーザーの好みにさえ安定して従いません(10ターンの 対話で選好順守率10%未満 — PrefEval、長期対話シミュレーションで最高モデル52.8% — HorizonBench)。 まずベースラインで見えるブランドであること — この測定が狙う場所はそこです。

当社が扱うSEOは三つです。クロール・索引・レンダリング・構造化データの技術衛生 (自社サイトも毎回のデプロイで自動監査を通過してから公開します)。 検索結果の実測(AI回答と同じ質問・同じ繰り返し規格で、ひとつの格子で同じ測定先を同じ回数だけ観測)。 そして検索からAI引用への転移の測定。すべての数字に、根拠がついています。

方法を公開しているのは、あとで検算していただくためです

測り方が書かれていない数字は、翌年になると使えなくなります。担当者が代わり、当時の条件が誰にも分からなくなった時点で、その数字はただの過去の一枚になるからです。比較の相手として使い続けるには、何を何回どこへ投げたかが残っている必要があります。条件を記録しないと、翌年の数字と並べる相手を失います。

ここに書いてあるのは判定の基準と分母で、質問の選び方そのものではありません。基準と分母が分かれば、お渡しした数字が正しく計算されているかをお客様の側で確かめられます。競合他社も同じ規格で並べて測ります。だから比較の条件が揃っているかどうかも、その場で検算できます。当社を選ぶ理由も、その検算に耐えるかどうかでご判断ください。

条件を記録 何を何回どこへ 基準と分母を公開 判定の物差し お客様が検算 翌年も並べられる
条件が残っているから、翌年の数字と並べる相手を失いません。

測定設計 — 答えが出る場所を、ひとつ残らず

AIは同じ質問でも、日によって違う答えを出します。だから一度聞いて終わりにしません。 測定前に固定した質問を、同じ条件で7回ずつ聞き直し、答えの揺れ幅まで残します。 聞く先は17か所 — この下に名前をそのまま並べてあります。 計画した分を一つ残らず実行し、一つひとつの状態(観測・引用・失敗・判定不能)を公開するので、測定の抜けが残りません。 Google検索は1回の取得を、オーガニック検索とAI Overviewの2か所として観測します。質問を投げる先は15のサービス、ブランド名を数える場所が17か所です。

17か所

答えが出る場所 — 等級を変えても、見る場所はここで固定です

名前は下の一覧のとおり · completeness manifestで充足を確認

7回ずつ

同じ質問を聞き直す回数。1回だけでは、たまたま出た答えと見分けがつきません

すべての測定の状態を検証後に公開

50

パノラマ1回で投げる質問の数。エンジン15か所すべてに、同じ質問を投げます

適用可能な比率にはWilson 95%信頼区間を併記

※ 集計定義:言葉の定義はこうです。有効な主張=レジストリ上のstatus: active登録件数。記録確定済みの実行=有効な主張に結び付いた測定実行の件数。測定設計=どの質問を、どの場所で、何回聞くかの取り決め。件数の出典は上に挙げた公開クレームレジストリで、表示のたびに再計算されます(測定の基準日は各主張に併記)。

比較表の空欄を、先に埋めておきました

発注先を選ぶとき、たいてい表を一つ作ります。横に会社名、縦に確かめたいこと。その空欄が埋まるまでに一か月かかります。だからその表をここに置いて、当社の列を先に埋めました。そのままコピーして、他社にも同じ十項目を聞いてください。当社にも同じように聞いてください。

各行には三つ書きます。何をするのか、その数字は何のうちの何なのか、そしてどこから先はその数字では分からないのか。三つ目は商談ではまず出てこない話です。小さな注記で済ませず、表の中に書いています。

表に入れる項目当社の答え何のうちの何か、そしてどこまでか
どこを見るか有償診断は等級にかかわらず17か所を見ます。どの画面かは、すぐ下の一覧に名前のまま書いてあります。掛け算に入るのは15のサービスです。Googleは1回の取得を、オーガニックとAI Overviewの2か所として数えるためです。その市場のロスターに入っていない画面は測らず、測っていないと書きます。無かったことにはしません。
同じ質問を何回投げるか7回です。有償診断はすべて同じです。回数は測定の条件ハッシュに固定されて出ていくので、証跡そのものに刻まれて残ります。7回は幅を測るための回数で、精度の主張ではありません。区間の幅は出たまま載せ、広いものは広いまま残します。
測定の規模パノラマは50問を15のサービスへ7回ずつ聞きます。下の等級は質問の数だけが減り、規則は同じです。これは投げた回数で、返ってきた回数ではありません。失敗した回、遮断された回、判定できなかった回は、それぞれの状態を持ったまま比率の計算から外れます。
何を成功と数えるかあるか無いかの二値で判定し、その判定を原文と突き合わせます。引用(回答が自社ページを出典として挙げること)と言及は別の行で数えます。集める側と判定する側も分けています。10点満点の総合スコアにすると、どちらが動いたのかが見えなくなります。惜しく外れた回と最初から入っていない回が、同じ値に沈むからです。レポートには判定の横に回答の原文を並べます。
不確実性の書き方計算できる比率には、Wilson 95%信頼区間と有効標本数を必ず併記します。信頼区間が覆うのは標本から来る揺らぎです。質問リストの選び方が正しかったかは、区間からは分かりません。そこは判断で、レポートで当社が根拠を示す部分です。
測定1回ごとの出所インターフェース、モデル、地域、言語、該当すれば端末、キャッシュ方針、取得時刻、何回目の測定か、そして内容でアドレスが決まるレシートまで残します。レシートは、何がいつ返ってきたかを証明します。そのエンジンがなぜそれを選んだかは証明しません。だからレポートは、見たものと推論したものを分けて書きます。
自分で確かめられるか公開した比率の算式、その信頼区間、そして計算し直すコマンドまで公開クレームレジストリにあります。開くのは測定規格と公開数値の算式までです。どのクエリをどの順で入れるかという実行の順序は、契約の中で渡します。
いくつの市場・いくつの言語3ロケール、日本と米国と韓国です。翻訳ではなく、それぞれの国のことばで別に書きます。ロケールごとに何を備えるべきかは、機械が読む契約ファイルに固定してあります。検査ツールがその契約に照らして3つを毎回突き合わせるので、一つの国だけ画面が静かに欠けると赤が出ます。照らすのは構造で、文章の質ではありません。各ロケールは人が別に読みます。
改善が巻き戻らない仕組み改善規則189件を一つの台帳にまとめ、全件がなぜ入ったか(事故の記録か出典)を持っています。デプロイのたびに検査ツールが台帳を読み、実際にレンダリングされた画面に対して規則を一つずつ確かめます。内訳はこの下の節にあります。検査ツールが見るのは、その手法が付いているかであって、効いたかではありません。レンダリング後のHTMLだけを見て、台帳に無い手法は知りません。この三つは人が見る場所です。
当社は誰が検査するのかこのサイトに載せる数字はすべて、同じ値でクレームレジストリに登録します。想定と逆に出た回も、そのまま残します。登録するのは当社であって、第三者が当社に対して行った監査ではありません。レシートは誰でも確認できます。漏らさず登録することは規律なので、どの会社にも「その規律を何で強制しているか」を聞いてください。

表のどこかの行が重要なのに、ここの文章が稟議書にそのまま貼れるほど正確でなければ、support@citeangle.comまでご連絡ください。その行の契約文言をそのままお送りします。

日本市場で測定する17か所

Japan Search

Google・Bing検索を測定

2026年6月StatCounterの日本シェアはGoogle 59.04%、Bing 33.10%、Yahoo 6.23%です。このうち当社が同じ質問で測るのはGoogle検索とBing検索、面ごとに分けて数えます。世界共通の入口であるDuckDuckGo 0.72%も、日本語の質問で「DuckDuckGo検索アシスト」として別に測ります。Yahoo! JAPANへは、施設情報の入稿と日本語プレスリリースという掲載・運用の側から入ります。

AI Answers

日本向けAI回答

契約範囲のAI回答APIと検証済み地域観測を、正確なインターフェース名、対象都道府県、証跡で記録します。

Provenance

条件を固定した証跡

インターフェース、モデル、地域、取得時刻、何回目の測定か、出典レシートを保存し、同じ条件で再測定できます。

答えが表示される17か所。測定対象:ChatGPT・Perplexity・Claude・Grok・Gemini・Google AI Mode・Google検索・Google AI Overview・Googleニュース・YouTube・Googleショート動画・Bing検索・Bing Copilot・DuckDuckGo検索アシスト・Bingニュース・Yahoo! JAPAN検索・Yahoo! JAPANのAI回答の17か所です。 同じ質問を、7回ずつ投げます。パノラマ1回で、50問を15サービスに7回ずつ、合わせて5,250回聞き、答えが出る17か所で読み取ります。答えが日によってどれだけ揺れるかまで数字にします。 数える場所は17か所、質問を投げる先は15のサービスです。 仕様と実測は分けて書きます。上の仕様がご発注いただいた回で走るものです。自社ブランドで封印した日本の実測は2026年7月17日の回です。そのときのロスターは上の契約仕様より狭いため、日本の実測値を引用するときは測定日と観測の範囲を必ず併記します。

従来の検索での見え方も、同じ設計で測ります。Google検索・Bing検索のオーガニック結果は、独立した測定先として観測します。AI回答の引用と同じ質問で並べて読みます。SEOとAI検索最適化を、一つのレポート・一つの実行優先順位につなぐ設計です。

顧客測定では実行ごとに時刻・最終ホスト・取得先・取得条件を結び付けて、測った時点のまま固定します。どこをどの条件で取ったかが後から一件ずつ突き合わせられる形です。 Yahoo! JAPANには、掲載と運用の側から入ります — 施設情報の整備と日本語プレスリリースの配信です。日本のお客様が実際に開くのはsearch.yahoo.co.jpという独自の画面です。 LINEアプリ内のウェブ検索に表示されるAIの回答は、Yahoo! JAPANの「AI回答」と同一の機能であることがLY Corporationの公式発表(リリース第009460号)に明記されています。この仕様が変われば、Yahoo! JAPANとLINEの両方に同時に効くということです。当社はこの一次発表を追跡し、日本市場の施策設計にその前提で反映しています。 店舗や施設をお持ちのお客様には、Yahoo!プレイスへの入稿と分析データの運用まで引き受けます。管理ツールの分析タブにたまる表示数と、公式サイト・電話番号・道案内・予約ボタンのアクション数を根拠に、次に直す一箇所をレポートに書きます。 日本で出す側の手も持っています。プレスリリースは翻訳ではなく日本語で書き起こし、日本の配信網を通じて各媒体へ届けます。掲載するかどうかは各媒体の判断で、掲載された記事は日本語の一次情報として残り、検索とAIの回答の両方から引かれる素材になります。

検証ゲート付きの測定ループ

測定前にパネルを固定

質問、競合、対象・対照URL、インターフェース、モデル、地域、判定基準を、測定前にすべて固定します。

質問セットは日本語の実利用から設計

公開されているAIチャットコーパスは英語に 大きく偏っています — LMSYS-Chat-1Mではターンの78%(arXiv 2309.11998)、ShareGPTでは会話の92.35%が英語で、 WildChatの収集上位9カ国でも日本のIPは1.94%にとどまります(arXiv 2405.01470)。 英語コーパスの翻訳移植では、日本の買い手が実際に打つ質問文は測れません — だから日本語の質問は、 日本市場の実利用データと日本語の質問慣行に基づいて新規に設計します。

有料パネルは7回ずつ

同じ質問を7回ずつし、すべての測定の状態(観測・失敗・判定不能・未測定)を検証後に公開します。

AI・オーガニック・ニュース・動画を分離

AI直接引用を主指標とし、検索・ニュース・動画は指標を分けて報告します。

比較実験を事前登録

改善前後の比較は、対象・対照群と期間を測定開始前に登録します。

判定は二値ルールです。存在か不在か — 引用されたか、言及されたか — を判定し、 一つに束ねた多段階スコアは使いません。判定器の信頼性研究でも、二値判定は多段階スコアより ストレスに頑健と報告されています(RAND, arXiv 2603.05399)。

再測定と有効期間。すべての測定はプロビナンス(測定時刻・モデル・設定)を保存し、二つの層で確認できます。 整合性の層は、納品物のハッシュ照合でいつでも決定的に確認できます。統計の層(同一プロトコルの再実行で信頼区間の重なりを確認)は、 納品書面に明示する有効期間内で適用します。有効期間の外で生じる差は、サービス側の変化を測る「ドリフト測定」として別に読みます。

繰り返しと信頼区間の設計根拠は、外部研究にあります。1回だけの測定では答えが毎回変わること(arXiv 2603.08924)。標本抽出だけで10〜34%の出力変動が出ること(arXiv 2601.21339)。そして繰り返しと信頼区間を併記して報告する推奨(Search Engine Land、2026年6月10日)。当社が公開ページに掲載する主張は、公開クレームレジストリで出典・基準日とともにご確認いただけます。

サードパーティ測定の前提(Google公式ガイダンス)。Googleは2026年6月、 外部のSEOツール・サービスの利用について公式ガイダンスを公開しました。そこで明記されたのは一つの事実です。 外部のツールは、Googleの内部ランキングデータにアクセスできません (Google検索セントラル、 解説: 鈴木謙一氏 2026-06-08)。 当社の測定は、この前提の上に設計しています。内部データを代弁するのではありません。 答えの画面を同じ条件で繰り返し観測した、外部観測データとして提供します。Search Console等の公式データとは、出所を分けて扱います。

公式レポートの提供範囲と、第三者観測の役割。Search ConsoleのAI パフォーマンスレポートには、いま三つの制約があります。提供は一部のサイトに限られます。質問ごとのデータは出ません。 そしてAI検索の表示が通常の検索と合算され、完全には分けられない場合があります (鈴木謙一氏の解説 2026-06-26)。 だからこそ当社は、二つを別のレールとして扱います。貴社が委任する公式データと、質問ごとに競合まで並べて観測する第三者測定です。 両方を突き合わせて読みます。一方だけでは見えない部分を、もう一方が埋めます。

GSCのAIインプレッションは「実表示の下限値」として読みます。Googleの仕様では、 AI OverviewsやAIモードのリンクは、ユーザーが実際に展開・ホバーして表示されたときにのみ インプレッションとして計上されます。当社の実測は「AI回答にその要素があるか」を基準に数えます。 定義が違うので、GSC側の数値が低く出るのはむしろ正常です。二つは別のレールとして 突き合わせて読みます。

なぜ7回か — 精度のはしご

レポートと同じ本番Wilson関数(95%、z=1.96)で計算すると、1回の観測では全回引用(1/1:[20.7%, 100%])と全回非引用(0/1:[0%, 79.3%])の区間が重なり、統計的に区別できません。7回なら分離します — 7/7の下限64.6%が0/7の上限35.4%を上回り、「毎回引用される」と「一度も引用されない」が別の順位バンドに分かれます。

自社で1回だけ測り直しても、同じ結果でした。当社調べです。2026年7月17日、韓国市場の美容医療9ブランドに10問を6か所へ1回ずつ投げました。1回ごとの信頼区間の半幅は最大±24.5%ポイントまで開きます。6か所すべてで、測定パネルの9ブランド全員が最上位バンドに束ねられました。リーダーシップカウントも全員同値です。つまり順位を見分ける力がゼロでした。ここでバンドとは、幅が重なって順位をつけられない会社をひとまとめにしたものです。同じ設計で7回にすると、順位の情報が生まれます。7回の対照は2026年7月16〜17日、同じ韓国市場で美容医療9ブランドと法律事務所9ブランドを測ったものです。法律事務所では、すべての測定先で最上位バンドが2〜6ブランドに分かれ、リーダーシップカウントも0〜6に散らばりました。美容医療でも、カウントが4〜6に散らばります(ブランド名は非公開で、バンド数と散らばりだけを公開します)。

独立研究も同じ設計点に数字を与えています。4つのAI検索エンジンを対象にした大学の収束分析(Schulte et al. 2026、arXiv 2604.07585)では、1回測定のブランド検出率の標準誤差は±0.37 — 実質コイントスの幅です。繰り返すほど誤差は下がり、統計の安定線(標準誤差0.10未満)に最初に到達する繰り返し回数が7回。当社の既定値はまさにそこにあります:すべての有償診断は質問ごとに測定先別で7回測定し、この繰り返し回数はオプションではなく、測定条件ハッシュに一緒に固定される既定値です。公開数値はその集計の上に立ちます — パノラマでは50問を7回ずつ聞くので、1か所あたり350観測になります。その集計に信頼区間を添えて報告します。

7回の先は、繰り返しではなく波(ウェーブ)の仕事です。繰り返しを40回に上げると、測定作業量と原価は5.7倍になります。ところが区間幅の縮小は、そこまで届きません。上のチャートの全回引用ケースの実計算で4.0倍。中間の観測比率を支配する√kの漸近法則では、√5.7≈2.4倍です。だから精度の次の段は、同じk7規格の月次再測定(運用プログラム)を積み上げることです。同じ規格の再測定が毎月積み上がると、単発の診断には無い時間軸が生まれます。すると実際の変化と揺らぎの区別を、区間どうしの比較で判定できるようになります。本節の自社数値はすべて、本番の集計関数から再計算できます(外部研究の数値は本文に出典を併記)。再現コマンドとともに公開クレームレジストリに登録しています。

全国基準と47都道府県 — 分母を分けて測定します

日本全国の基準線と47都道府県の地域パネルは、別の質問になります。だから両者を合算せず、 分母を分離したまま別表で報告します — 地域の観測値を足して全国の数値を膨らませることはしません。

全国パネル

全国基準線は独自の質問セット・インターフェース・繰り返し回数・分母を保ち、地域パネルとは分けて集計します。

位置パラメータの固定

すべての測定呼び出しで、都市・地域・国・タイムゾーンを固定します。お客様の地域選択はsha256レシートに固定し、保存されたハッシュと毎回照合します。

検証済み地域スコア

位置レシートを通過したパネルからのみ検証済み地域スコアを発行し、都道府県指標は全国基準線と分母を分離して読みます。地域アドオンは見積もりで、質問・言語・インターフェース・繰り返し回数・競合とともに確定します。

韓国市場も同じ規格で測ります。NAVER AIブリーフィングを含む主要17か所を、ひとつ残らずたどります。 測定対象:ChatGPT・Perplexity・Claude・Grok・Google AI Mode・NAVER AIブリーフィング・Google検索・Google AI Overview・NAVER検索・NAVERニュース・Googleニュース・YouTube・Googleショート動画・Bing検索・Bing Copilotの17か所。

米国市場も同じ規格で測ります。見る場所は米国の検索環境に合わせて組み替えており、Yahoo Search・DuckDuckGoの検索アシスト・Bingニュースを含む主要17か所です。 測定対象:ChatGPT・Perplexity・Claude・Grok・Gemini・Google AI Mode・Google検索・Google AI Overview・Googleニュース・YouTube・Googleショート動画・Bing検索・Bing Copilot・Yahoo Search・DuckDuckGoの検索アシスト・DuckDuckGoのオーガニック検索・Bingニュースの17か所。 仕様と実測は分けて書きます。自社ブランドで封印した米国の実測は2026年7月27日の回で、50問を15か所で一巡させた単回パスです。7回まで重ねる回は、仕様どおり次の測定で回します。

測定責任者

測定を売る側が自社の数字を隠せば、その測定は商品になりません。 本サイトに掲げた数値は、同じ値のまま根拠レジストリに残しています。 集計の元データは公開データセットから取得できます。 測って出た区間は、値を動かさずそのまま載せます。区間の幅を広げたときは、広げた箇所を明記します。

— Jay Sim/CiteAngle 測定責任者

Jay Sim — ARTIFEX Co., Ltd. 代表・CiteAngle測定責任者。 質問設計、繰り返し測定の運用、判定基準の適用、レポートの最終検収まで一連の測定体系を統括し、 公開ページの数値主張がクレームレジストリと一致することを公開前に確認します。 リサーチ記事の著者表記はこの責任範囲を指します — お問い合わせはsupport@citeangle.comへ。

この名前で公開した記事は執筆者ページにまとめています。

自社サイトも、同じ検査を通してから公開します

測り方を売る会社が自分のサイトを測っていなければ、その測定は商品になりません。だから当社の改善のやり方は、記憶に頼らず台帳に一行ずつ書いてあります。公開しているHTMLページの全量に、デプロイのたび機械で当て直します。

ページを作り直すと、前に入れた改善はいっしょに巻き戻ります。構造化データも、内部リンクも、見出しの形も。これはどのサイトでも起きることで、記憶を頼りにするほど何件か抜けます。台帳に置いてビルドの条件にすると、抜けたまま公開へ進めなくなります。

189

台帳に載っている改善規則。SEO・AEO・GEO・AIOの技法を、機械が読める形にして一件ずつ登録したものです

新しい技法を採り入れたら、同じコミットで一行足します

141

ページそのものを見る規則。出来上がったHTMLに当てて、在るか無いかを判定します

対象は公開しているページの全量

48

検査する道具が手元に在るかを見る規則。ページは見ないので、上の件数と分けて数えます

内訳を出すのは、分母が変わると数字の意味も変わるからです

同じやり方の検査は、お手元のURLにも当てられます。無料ページ診断にURLを1つ入れてください。ログインなしで、その場に結果が出ます。点数の付け方を書いた配点表も、同じ画面に開きます。

この検査が見ている範囲を、先に書いておきます。見るのは「当てたかどうか」です。効果が出たかどうかは測定レールの担当で、そちらは別の数字として出ます。当てる先はブラウザに届いたHTMLです。そして検査の範囲は、台帳に載っている技法です。新しいやり方を見つけたら台帳に一行足す。足したその瞬間から、全ページで強制される。その順番になっています。範囲をこうして書き出すのは、数字を読むときの分母がここで決まるからです。

韓国語・英語・日本語の3ロケールは、構造を別の契約ファイルに書いて機械で照合します。三つを同じ形にそろえるのではありません。市場ごとに要る順番が違うので、ロケールごとに決めた構造をそれぞれ契約に書き、そこから外れていないかを見ます。この日本語ページも、日本語で書き起こしたものです。韓国語からの翻訳ではありません。

お客様のサイトに対しても、同じ考え方で当てます。何がどれだけ外れているかを数え、直す順番をレポートに書き、直したあとに同じ条件で測り直すところまでです。質問の数・聞く先・繰り返しの回数と、その回を締めるための合格ラインは測定の仕様に一枚でまとめています。診断の範囲と料金は料金ページに、納品物の実物はサンプルレポートに置いてあります。

買い手は、検索の前にAIへ尋ねています

購買の入口は「検索してクリック」から「AIに尋ねて答えを受け取る」へ移っています。

買い手シフトの根拠 — 実行計画への束ね方・日本の検索シェア・米連邦裁判所の認定

どのブランドがAIの答えの材料に選ばれるかは、クリックより前に決まります。

CiteAngleは、日本の見込み顧客が使う質問、 検索結果、AI回答内の言及・引用、日本語コンテンツの根拠を一つの実行計画にまとめ、同じ条件で再測定します。

AIの答えは貴社を単独では語りません — 推薦にも比較にも、名指しされる競合が同じ答えの中に並びます。 だからCiteAngleは、貴社と競合ブランドを同じ回答の中で並べて測定し、誰が言及され、誰が引用されたかを1回ごとに記録します。

この前提は、米国の連邦裁判所の記録にも載りました。US v. Google の 是正措置判決(2025年9月2日)で、裁判所は一般検索に接地したGenAIチャットボットが「検索エンジンに 類似した情報検索機能」を果たし、情報を探すクエリへの回答に「ウェブサイトへの引用とリンクを しばしば含む」と明文で認定しています(判決原文 PDF・事件番号 1:20-cv-03010)。AIの答えの中の引用が検索に 続く次の表面だという本サービスの前提は、業界の仮説にとどまらず連邦反トラスト判決文に記載されて います。なお、この是正措置判決は現在控訴係属中で、確定判決ではなく係属中の判決として引用しています。

計画した測定を1回も落とさず実行します

測定に抜けがあっても、レポートの見た目は変わりません。表は埋まり、比率も出ます。ただし読めなかった回を分母から外していれば、その比率は別の測り方をした数字です。それを知らずに翌月と比べると、改善したのか分母が動いただけなのかが判別できません。だから当社は、計画した回数を一つ残らず実行し、読めなかった回も「読めなかった」として残します。

「見えている気がする」で止めません。質問と、聞き直しと、聞く場所 — その組み合わせを一つ残らず実行し、一つひとつの結果(観測済み・引用・失敗・判定不能)を そのまま公開します。

測定設計の根拠 — 模式図と測定回数、揺らぎと信頼区間、設計の理由

合計の測定回数と実行済みの内訳を示すので、測定の抜けが残りません。

計画 引用・観測済み 言及 失敗・判定不能
20
コンパスの質問数 — 答えが出る場所ぜんぶへ、7回ずつ聞きます
全量実行・状態公開 — 測定プロトコルを公開
50
パノラマの質問数 — 答えが出る場所ぜんぶへ、7回ずつ聞きます
全量実行・completeness確認 — 測定プロトコルを公開

AI回答の揺らぎと信頼区間の扱い

AI回答は同じ質問でも変わります。だからCiteAngleは有料測定を開始すると、同じ質問を7回ずつ聞きます。 判定できた回の比率にWilson 95%信頼区間を付けて報告します。信頼区間とは「本当の数字はこの幅のどこか」を示す幅です。 たとえば「引用率33%(95%信頼区間 12〜65%、n=9)」のように、点ではなく幅で示します。

なぜ7回ずつなのか、なぜ信頼区間か — 公開されている根拠

同じ質問でも、AIの答えは実行のたびに変わります。だからCiteAngleは、1回の観測を「点」として売らず、 繰り返しと信頼区間で「幅」として納品します。この設計の根拠は、公開されている外部研究と業界の公式発表です。

設計根拠の詳細 — 学術研究と業界の公式発表・推奨

学術研究

単一実行は本質的に信頼しがたい

答えが毎回変わるため、1回だけの測定は本質的に信頼しがたい。そう指摘する学術分析があります(arXiv 2603.08924)。LLMの出力は標本抽出だけでも10〜34%変動する、という学術測定もあります(arXiv 2601.21339)。

業界の公式発表

繰り返しはノイズを実測で減らす

海外大手ツールの一社も、公式ブログで実測を出しています。10回の繰り返し測定で、引用シェアの日次ノイズが約40%減ったという報告です(tryprofound.com、2026年7月8日)。

業界の推奨

繰り返しと信頼区間の併記

検索業界の専門誌への寄稿も同じ方向です。1回の観測は点推定と見なし、繰り返し測定と信頼区間を併記して報告することを推奨しています(Search Engine Land、2026年6月10日)。

当社が公開ページに掲載する主張は、出典種別・基準日とともに公開クレームレジストリでご確認いただけます。 測定の再現性そのものは、リサーチ記事「AI可視性測定の再現性」で詳しく解説しています。

信頼区間の収束 — 1回から7回へ報告形式例の引用率33%で計算した模式図 — ライブ画面ではありません

この模式図の読み方 — 幅と繰り返しの関係

1回の観測が言えるのは「広い幅のどこか」までです。繰り返すほど幅は狭くなります — だから納品レポートでは、適用可能な比率ごとに実測のWilson 95%信頼区間と有効標本数を、出た幅のまま併記します。 Wilsonスコア区間(z=1.96)による計算で、縦線は固定した例示比率です。詳細は測定プロトコルへ。

測定方法について、よくいただく質問

なぜ同じ質問を繰り返し測定するのですか?

1回の観測は点推定にすぎないからです — 測定前に固定した同じ質問を繰り返し 実行し、引用・言及と回答の揺らぎまであわせて測り、適用可能な比率には信頼区間を併記します。 反復が「毎回引用される」と「一度も引用されない」を統計的に分離していく実計算は、上の なぜ7回かに、レポートと同じ本番関数で公開しています。

ログインなしの測定は、実際のユーザーが見る回答と違いませんか?

当社が測るのはパーソナライズ適用前のベースライン可視性で、この統制 された基準条件こそが再現と比較を可能にします。個々のユーザーの回答が利用履歴やアカウント状態で 変わり得ることまで、設計に織り込んでいます — だから同一条件の観測を重ね、 時系列で読みます(上の「測定の前提」参照)。統制された基準条件の上でだけ、改善前後の 変化を同じ物差しで測れます。

測定結果は第三者が検証できますか?

はい。検証できるように設計しています。公開ページに掲載する主張は 公開クレームレジストリに出典・基準日とともに登録します。納品される すべての実行には、由来(インターフェース・モデル・取得時刻・設定)が付きます。繰り返し回数も、 測定条件のハッシュに一緒に固定されます。中身が一致するかは、ハッシュ照合でいつでも確かめられます。 方法は公開しており、証跡もそのまま照合できます。レポートのどの数値も、ご自身で確かめられます。

なぜ順位追跡ツールではAI検索の可視性が見えないのですか?

引用は、順位とは別の段階で決まるからです。米国デスクトップの取引型 質問を対照した独立実測を見てください。Google AI Modeの引用のうち、同じ質問の検索上位20位から来た ものは19%にとどまりました(seoClarity、データ2025-09)。順位表が強くても、引用の 大半は順位表の外で決まります。だから当社はAI回答を直接測ります。同じ質問の検索結果と 並べて、どの段階で接続が切れているかをお見せします。

私たちの測定が間違っていた場所

測る道具が間違っていれば、その上に積んだ数字はすべて間違う。だから自分の道具が外した場面を記録に残し、そのとき何を変えたかも一緒に書く。

何を載せ、何を載せないかは、一つの文で決まる。 この値を消したら、私たちが出した別の数字が根拠を失うか。失うなら載せる。失わないなら載せない。

アクセシビリティ検査が自社ページでだけ止まり、集計はその失敗を「違反ゼロ」と読んだ。

どう見つかったか. 同じ検査が競合のページでは通った。こちらは123件すべて失敗なのに、結果表は違反ゼロ。ずれが自分に有利な方向にしか出ていないことが手がかりだった。

何を変えたか. 自社のセキュリティ設定に当たらない方法で検査を入れ直し、246件すべてが通った。失敗をゼロに畳む集計を禁じ、自分に有利な結果はまず疑うという判定規則を置いた。

2026-08-01

画面の色のコントラストをピクセルで測る検査が、競合を含むすべてのサイトを不合格にした。

どう見つかったか. 文字の縁のぼやけた画素が背景の標本に混ざっていた。自社だけでなく標本28社が全部不合格で、値そのものが判定に使えないと分かった。

何を変えたか. 合否の判定は要素単位で測る別の検査に移した。ピクセルの値はサイト同士の順位を見るときだけ使い、その限界を表の見出しに書く。

2026-08-01

種類の違う標本どうしを比べた。自社の120ページを、相手の28ページに重ねていた。

どう見つかったか. ファーストビューの文字量が79.31%対0.96%と出た。差が大きすぎて見直すと、こちらはサイト全体、相手は代表ページ数枚だった。同じ種類で測り直すと、自社の料金ページは19社中1位だった。

何を変えたか. 比較のたびに分母の標本の種類を文章に書くことにした。全体対全体なのか、同じ性格のページどうしなのかが書かれていない比較は使わない。

2026-08-01

試験用に作った偽の観測が本物の山に混ざり、集計が静かに汚れていた。

どう見つかったか. ありえない大きさの件数が出た。形式が本物と同じで集計では引っかからず、回答の長さの分布を描いてやっと別の集団が見えた。

何を変えたか. 偽物は消さずに二重の目印を付けた。消すと同じ失敗をもう一度検証できない。判別する検査を集計の手前に置き、混ざったままでは数字が出ないようにした。

2026-08-01

「テストランナーが消えたら検知できる」ことを証明するはずのポラリティ試験が、実際には何も測っていませんでした。狙っていた行はすでにヘルパーへ移しており、注入は一行も一致しません。生存確認のガードもそれを見逃しました。原因は末尾の改行です。`splitlines()`と改行結合でファイルを前後比較すると末尾の改行が落ちるため、一行も削っていなくても両者は違う文字列になり、ガードは何を削ったかに関わらず「差異あり」と答え続けます。

どう見つかったか. 配備ゲートがこの一件だけで赤くなりました。そこで注入を手で再現します。削られた行は0件でした。それでもガードは差異ありと報告し、検査器は元のファイルと、壊したはずの写しに、同じ3つの経路を返しました。

何を変えたか. ガードは削除行数を数え、ちょうど1件であることを要求します。読み込みは改行を保持します。狙う行は定数に出しました。改修のとき直す場所が一箇所で済みます。両方向を実証済みです。実ファイルではウェブの経路が現れ、その行を切ると消えます。

2026-08-11

グラフ検索が、典拠の証拠がグラフより古いと警告していました。常時点灯です。証拠はルートごとに測って統合しますが、統合が基準時刻をそのまま引き継ぐため、鮮度の比較は入力が何であれ前へ進みません。

どう見つかったか. 出典の付いた割合が99.31%・98.28%・72.52%の証拠三組が、すべて古いと報告されました。常に点灯する警告は、健全な組と腐った組を区別できません。そこで比較そのものを廃止しました。すると、その軸を読んでいた試験2本が宙に浮きます。一方は失敗できず、もう一方は成功できません。

何を変えたか. 対は被覆率を測るように移しました。鮮度が代わりに答えていた問いは、等級のないまま描かれる節点があるか、だからです。4件中4件に等級が付いていれば、警告は出ません。1件でも欠ければ必ず出ます。閾値は設定で変わるので、試験は数値ではなく文言を固定しました。

2026-08-11

状態ドリフトのゲートでは、アンカー未宣言と検出されたドリフトが同じ終了コード1を返します。そのコードを期待していたポラリティ試験2本が、別の理由で1を受け取っていました。何も測らないまま通過していたことになります。

どう見つかったか. ゲートがアンカー宣言を求め始めた時点で、兄弟の試験が落ちました。宣言を足すと、黙っていた2本がようやく名前どおりの経路を通り始めます。同じコードを返す失敗経路が2つあると、試験はどちらを見たのか報告できません。

何を変えたか. 合成した事実の設置を1つのヘルパーに集めました。そこでアンカー宣言と、実目録向けラチェットの無効化も同時に行います。当該ファイルの18件はすべて通ります。あわせて、登録済みの事実40件に対して既知リスク目録が27件しかなく、分母が分子より小さい状態も見つかりました。欠けていた17件を、それぞれが揺れる理由とともに記載しています。目録は44件になりました。

2026-08-11

料金表を見る →

このページはCiteAngle 測定責任者のが書いています。載せる数値は、公開前に根拠と突き合わせます。基準日

日本市場の可視性を実行計画に変えます。 対象都道府県、顧客、意思決定日をお知らせください。

お問い合わせ

このページの CTNG-CANARY-JA-20260725-4MB8 は、公開した内容がAIの回答に届くまでの日数を測るために置いた固有の文字列です。それ以上の意味はありません。