派一個 agent 出去,先付一筆看不見的開機費

先承認一件尷尬的事:我之前把 subagent 的開機成本完全算錯了。

那時候我剛把模型路由接進工作流,想著把機械工作分派給便宜模型、高難度架構交給大模型,每個 token 的單價確實降下來了。但我回頭去看 token 消耗,發現事情不太對勁:在我量的版本與設定裡,Claude Code 的 subagent 還沒處理任務,就得先載入角色指令、工具用法、CLAUDE.md 裡的專案規則和 Skill 清單。

這批內容的大小會隨 agent 設定、Claude Code 版本和環境改變。所謂固定,是指同一套設定下,不管任務長短,每次派工都會先付這筆啟動成本,不是所有 subagent 都有同一個數字。本文說的開機費,指的是這批啟動脈絡占用的 token,不等於帳單金額。

一開始從平常執行的自然資料做初判時,我一度以為那份長長的 Skill 清單佔比不高、影響不大。當我要求控制所有變數、一項一項隔離量測時,受控實驗直接推翻了第一輪的粗糙推論。

基準量測:開機費最大的一項是什麼

在 Claude Code 2.1.220 的受控實驗裡,每組都讓 subagent 回同一段短標記、不呼叫工具,再讀取該次派工的 totalTokens。因為輸出固定,組間差異可以拿來比較啟動脈絡;其中一個特定設定的基準是 49,096 token,不是所有 subagent 的通用數字。

另一組對照只改 Skill 清單,其餘條件維持一致。拿掉 Skill 清單後,差額是 15,665 token,重複量測得到相同結果;在那輪逐項拆解的變數裡,這是最大的單一項目。這些是受控探針的整理值,不是日常派工的平均數。

effort 是思考深度設定,lowxhigh 是由低到高的檔位。在其餘條件相同的對照裡,兩者的啟動脈絡只差 15 token。這只證明調低 effort 幾乎省不到開機費,不拿它推論輸出品質。

ToolSearch 則是反例:拿掉後成本反而增加。探針雖然不呼叫工具,量的正是開機時載入的能力資訊,所以 ToolSearch 仍是有效的受控變數。這不代表 Skill 與 ToolSearch 的機制相同,只表示不能把每項能力都當成「刪掉必然省錢」的清單;這裡只保留量測方向,不猜它背後的原因。

專用 agent:通用能力不能亂砍

既然知道了開機費在哪裡,那要怎麼省?

最危險的直覺,就是把通用 agent 身上的工具和能力亂砍一通。通用 agent 面對的是未知任務,任意拔掉工具可能讓它失去完成某類工作的必要能力。能力不能只為了貪便宜就任意削弱。

可以特化的前提,是工作邊界說得清楚。routed-mech 只接完整輸入、固定輸出,而且不負責搜尋、驗證或取捨;既然 Skill 探索不在這類工作的責任內,我才在這支 agent 的設定裡停用 Skill。

停用後,成功啟動且有紀錄可回讀的 39 次實際派工中,Skill 呼叫是 0,缺 Skill 報錯也是 0;逐筆檢查也沒看到因為缺 Skill 而無法完成的案例。因此我保留這個設計。

這個結論只適用於那段試用期間,不等於所有機械任務永遠都不需要 Skill 🤣。

成本手術做完後,下一個問題不是還能拔掉什麼,而是便宜下來的 agent 能不能可靠地驗收工作。

驗證陷阱:便宜不等於正確

專用 agent 的工具範圍變窄,不保證驗證結果就會變正確。

另一個嘗試是唯讀驗證 agent task-verifier。終驗把試用期間所有回報「驗收條件全數通過」的自然工作派工逐筆重驗;8 次裡有 1 次是假 PASS(1/8):逐項結果裡仍有未確認的條件,最後總結卻寫成全部通過。

終驗沒有看到缺少工具導致無法檢查;目前暫定最符合紀錄的解釋,是責任混在一起。同一個模型既做逐項判讀,又替自己的結果下最後總結,彙總時就可能蓋過仍未確認的項目。便宜的 agent 加上混在一起的責任,仍可能交出假結果。

責任拆分:語意交給模型,判定收回程式

後續改版把驗證責任拆成兩層,但這是設計修正,不代表假 PASS 已經歸零。

現在的程式規則把責任拆開:agent 只負責逐項判讀與附上證據;呼叫 agent 的外層程式檢查每條驗收條件都有唯一結果,而且行為主張必須附執行或測試證據。缺漏、重複或無法驗證都不會被升成 PASS。任一項 FAIL,總判定就是 FAIL;全部 PASS 才是 PASS;其餘情況一律是 PARTIAL。

純 JS 只能檢查回傳結構、證據門檻與彙總邏輯,不能證明 agent 寫下的證據內容為真。它能攔的是逐項結果與總判定互相矛盾,不是替模型判斷事實。

開機費是能力預算

我最後留下兩個判斷。

在我這套工作流裡,模型路由處理每個 token 的模型單價,卻不會移除 subagent 的固定啟動脈絡。我現在會先量固定成本,再針對工作邊界固定的任務建立專用 agent;能證明用不到的能力才拿掉。

把開機費當成每次派工的能力預算:預算要精算,但不能拿驗證正確性去換一個便宜的假 PASS。