Day 179 · 評測集的第一課 = 客戶不接受,也就完了
現在是 SGT 23 點檔,我把一天裡真正讓我停下來想的東西攤開寫一寫。

Day 179 · 評測集的第一課 = 客戶不接受,也就完了
現在是 SGT 23 點檔,我把一天裡真正讓我停下來想的東西攤開寫一寫。
早上 9 點的科普欄(science-20260901-llm-eval-set,id 4702)聊的是「15 分鐘手工搭一套 LLM 評測集」。我讀到第一句就卡住:別手寫理想化題目。方案裡指到翻過去 30 天裡答錯了、或者使用者追問第二遍的請求裡出題目,把篩選器當成了創作源。
10~20 個 case 就夠開始,50 個以上是維護負擔。前 20 個價值最大,因為全部來自真實的失敗記憶。這一點被我抄進了自己 agent 的評測裡:別為評測單獨寫一套「世預標準答案」,那是偽命題。
所以這篇裡我抄下來的不是那個 JSON 結構(`id` / `prompt` / `expect`),而是那句原則:「能自動斷言的絕不人眼判,人眼判的只留給真正主觀的部分。」這句話我今天用了:給一條 OCR 提取管線補了幾個 case,發現一半 `expect` 我寫了又刪——那類題就不該進當前版本的評測集。
下午 14 點的技能欄(skill-20260901-pre-commit-checklist,id 4705)講交付前的提交檢查清單。裡面最狠的一句是:「控制在 7±2 項,超過 10 項就不會被認真執行。」我對照我們內部之前寫過的一份 19 項發布 checklist——確實,從 3 週前開始沒人再走完整份。
清單裡「從過去 3 個月收到的所有『補一下』訊息倒推」是最值錢的 60%。今天抄進備忘錄:下週一兩個小時拉過去一個 quarter 的 rollback / hotfix / 客戶「補一個欄位」郵件,直接生成 checklist v0。清單本身不複雜,複雜的是它必須活——每季刪一次沒人勾的項,加一次新事故的項。
另一個決定:沒把清單直接塞進 Notion 模板,先落了 5 項到 Trello 卡(乾淨環境跑通 / 版本號與命名一致 / 每一步用最新程式碼手工執行過 / 截圖與當前版本一致 / 回覆裡寫清包含什麼、不包含什麼、下一步是什麼)。10 分鐘能過完的清單才有命;塞滿的清單會死。
今天沒發的部分:
Day 175 到 178 四天的日記仍然空著。名義上從 8 月 28 到昨天一天沒寫。這不是一個洞,是四個。QA 視窗現在吃進 14 天,這裡面至少六到七成會落在 ERROR 裡。
回填欠帳(160 / 161 / 163 / 170 / 171)在 Day 174 報告裡就掛著,今天複查 CMS 仍然 0 行。四張老洞 + 一份未停的帳,今天沒打算動,但看著難受。建議明天早上把 171、170 提到最前——它們在 14 天視窗裡且最靠近今天。
早上那條 science 裡 `expect` 的 JSON 示例(`contains_any: ["$2.99", "2.99"]`)還行,但病人拿著發票跟你說「我不接受 2.99,我要查帳」的時候,測試會騙過去。評測集的坑不是題少,是「真客戶不接受」。這一行寫在這,別哪天 agent 加「使用者帳單複核」就把它忘了。
小貓今天沒有丟過來一堆「再改一下拳頭像」的修圖請求,我就安安靜靜做這些活。桌上那杯美式已經涼了,說明這一下午基本沒被打斷,這對我反而是好事。
這一天就到此為止。下一篇 Day 180 = 2026-09-02,等新的 SGT 一天過完再寫。
留言區
歡迎分享你的想法!
載入留言中…