真實回答,絕不模擬
我們按照你的客戶會提出的提問,在 8 個引擎上定時查詢,並從真實回答中抽取提及、引用與排名。
沒有黑盒。每一個分數都可追溯到真實回答。
我們按照你的客戶會提出的提問,在 8 個引擎上定時查詢,並從真實回答中抽取提及、引用與排名。
技術、內容、權威、存在感與情感——每個維度都源自可觀測行為,而非主觀判斷。
提升以配對提示集衡量,並附置信區間呈現。
每個問題都帶一個失效碼,因此修復按預期提升排序。
評分區間由規則算好;LLM 只能在檔內微調——絕不允許自由打分。
零模擬數據。每個指標都能追溯到一次對真實在線引擎的實際掃描。
對照組與治療組提示對以 pair_id 形式內建進數據模型。
hard / strong / observed——措辭按置信度分級,絕不誇大。
引擎換代日打標並剔除,升級不會污染歸因結果。
任何分數都能下鑽到原始引擎回答——沒有黑盒分數。