大多數“AI visibility”儀表板衡量的東西都不對。一篇網誌發佈後數字上升並不是證據——這只是穿上了實驗服的相關性。
唯一誠實的設計:處理組 vs. 對照組
對於你上線的每一項優化,我們都會運行同一組 prompt 兩次:
- 對照組 — 在你修改之前的 prompt 集,由引擎今天回答。
- 處理組 — 同一組 prompt,但你的修改已上線後。
lift 就是這個差值,相同的問題,相同的措辭。其他一切都是噪音。
公式
lift 以 prompt 集中引用率的變化來表示:
lift = citation_rate(treatment) − citation_rate(control)
其中 citation_rate 是在一個固定的、配對的 prompt 集中,你的品牌被點名、引用或暗示的 prompt 所佔比例。
一個實例
假設有一組關於你所在品類的 200 個問題。修改前,你的品牌出現在其中 64 個中(對照組率 = 32%)。在經過一輪結構化主張驗證衝刺之後,它出現在 92 個中(處理組率 = 46%)。
lift = 46% − 32% = +14 percentage points
相同的 200 個問題,同一天,其他什麼都沒變——這是一個被測量的效果,而非巧合。
對照組
32%
處理組
46%
Δ +14pp
置信度 95%
四個歸因誤報陷阱
即使設計嚴謹,團隊還是會以四種可預見的方式自欺欺人:
- 新鮮感峰值。 大型發佈那一週會推高提及量;你會把功勞算到錯誤的改動上。務必將處理組 prompt 集與同一天測量的對照組集配對。
- 季節性漂移。 Q4 品類關注度對所有人都會上升。12 月“出現”的 lift 其實只是日曆效應。
- 單引擎海市蜃樓。 某個引擎改了預設設定;你卻把它讀成全局 lift。先按引擎分別報告,再聚合。
- 措辭重構偽影。 你改的是查詢措辭,不是品牌。如果 prompt 集本身變了,前後對比就不可比。
用置信度報告,而不是憑感覺
單次觀察只是軼事。我們在多個 prompt 集之間聚合,並報告:
- 變化的方向(被引用更多 / 更少)。
- 變化的幅度。
- 一個置信區間,讓利益相關方知道該信多少。
這就是“我們覺得有效”和“這是被測量的效果,置信水平能讓你的 CFO 接受”之間的差別。
為什麼這對預算很重要
如果你無法為 lift 歸因,你就無法為支出辯護。歸因級別的驗證把 GEO 從一項營銷實驗變成一個可衡量的支出項。