大多數“AI visibility”儀表板衡量的東西都不對。一篇網誌發佈後數字上升並不是證據——這只是穿上了實驗服的相關性。

唯一誠實的設計:處理組 vs. 對照組

對於你上線的每一項優化,我們都會運行同一組 prompt 兩次:

  1. 對照組 — 在你修改之前的 prompt 集,由引擎今天回答。
  2. 處理組 — 同一組 prompt,但你的修改已上線後。

lift 就是這個差值,相同的問題,相同的措辭。其他一切都是噪音。

公式

lift 以 prompt 集中引用率的變化來表示:

lift = citation_rate(treatment) − citation_rate(control)

其中 citation_rate 是在一個固定的、配對的 prompt 集中,你的品牌被點名、引用或暗示的 prompt 所佔比例。

一個實例

假設有一組關於你所在品類的 200 個問題。修改前,你的品牌出現在其中 64 個中(對照組率 = 32%)。在經過一輪結構化主張驗證衝刺之後,它出現在 92 個中(處理組率 = 46%)。

lift = 46% − 32% = +14 percentage points

相同的 200 個問題,同一天,其他什麼都沒變——這是一個被測量的效果,而非巧合。

引用率 · 對照組 vs 處理組
對照組
32%
處理組
46%
Δ +14pp 置信度 95%

四個歸因誤報陷阱

即使設計嚴謹,團隊還是會以四種可預見的方式自欺欺人:

  1. 新鮮感峰值。 大型發佈那一週會推高提及量;你會把功勞算到錯誤的改動上。務必將處理組 prompt 集與同一天測量的對照組集配對。
  2. 季節性漂移。 Q4 品類關注度對所有人都會上升。12 月“出現”的 lift 其實只是日曆效應。
  3. 單引擎海市蜃樓。 某個引擎改了預設設定;你卻把它讀成全局 lift。先按引擎分別報告,再聚合。
  4. 措辭重構偽影。 你改的是查詢措辭,不是品牌。如果 prompt 集本身變了,前後對比就不可比。

用置信度報告,而不是憑感覺

單次觀察只是軼事。我們在多個 prompt 集之間聚合,並報告:

  • 變化的方向(被引用更多 / 更少)。
  • 變化的幅度。
  • 一個置信區間,讓利益相關方知道該信多少。

這就是“我們覺得有效”和“這是被測量的效果,置信水平能讓你的 CFO 接受”之間的差別。

為什麼這對預算很重要

如果你無法為 lift 歸因,你就無法為支出辯護。歸因級別的驗證把 GEO 從一項營銷實驗變成一個可衡量的支出項。