找不到符合條件的文章。
Advisor:換顆腦袋,不用換整個 session
對 AI 這一次的判斷不滿意時,不必把整個對話換成更貴的模型;把這一題打包送給另一顆模型當顧問就好。成敗取決於三件事:你給它看什麼、它看得到什麼,以及意見回來後誰裁決。
2026年9月10日 · / / / / /
最危險的不是 AI 忘了,是你不知道它忘了
記錄一次 GPT 自動壓縮丟失關鍵結論的事故,以及如何透過自製跨介面存證機制在自然事件中完成驗證與保留。
2026年8月31日 · / / / /
裝工具很容易,結案才是工作:我的 AI 工具試用回顧制度
裝工具前的評估只回答值不值得試,到期的結案才回答當初判斷對不對。152 筆結案裡近六成 KEEP,這個數字該怎麼讀。
2026年8月30日 · / / / /
GPT 不是停不下來,是看不見停止線:Review 隧道視野與停止條件治理
記錄 GPT-5.6-sol 如何在 review 裡把 finding 持續轉成實作目標,以及我如何用核心行為、範圍與具名處置理由畫出停止線。
2026年8月27日 · / / / /
省 token 工具說能省多少,扣掉暖機費後才算數
評估省 token 的 proxy 工具時,先扣除新 session 的暖機費,再看工具最後能省下多少,以及 session 規模能否跨過回本門檻。
2026年8月25日 · / / / /
GPT-5.6 Sol 沒做錯,卻做了 7,700 行我不需要的東西
從一場個人 repo 收尾提醒的過度實作事件,拆解需求如何一路膨脹,以及事後形成的 YAGNI 審查。
2026年8月24日 · / / /
AI 報表會說兩次謊:查詢欄位是假的,解讀數字也可能是假的
AI 報表的可信度不能只看查詢是否成功。從欄位存在性、資料列引用到儲存格對位,拆解查詢層、證據層與敘事層的防線設計。
2026年8月22日 · / /
不是每條規矩都要寫成 hook:從一句話到硬攔截的四層階梯
一條規矩該用多強的手段執行,由可數的復發紀錄決定。從一句話提醒、skill、hook 到人類放行碼,四層強度階梯與換位置、往側走的決策邏輯。
2026年8月20日 · / / / /
派一個 agent 出去,先付一筆看不見的開機費
拆解 subagent 啟動時的固定開機脈絡成本,透過受控實驗與專用 agent 實測,找出真正能省與不能省的能力預算邊界。
2026年8月20日 · / / / /
skill 也要有考卷:我給 skill 上了回歸測試
skill 改壞了不會有語法錯誤,只會有語意偏差。光有考卷不夠,還要讓改檔的人看得到考卷存在、改完不跑走不掉。
2026年8月17日 · / / / / / /
AI 寫的測試全綠,但可能什麼都沒測
AI 寫的測試常常跑得過但沒真的在檢查。用 mutation testing 故意把程式改壞 86 處實測抓漏率,再講怎麼讓這個檢查真的持續發生:溫和提醒 0/5 全漏接,推送前強制攔截才用起來。
2026年8月17日 · / / / /
抄 awesome 清單不難,難的是決定不抄什麼
面對百條規模的開源清單,真正有價值的不是把工具整包裝上去,而是讓每一條都拿到一個寫下來的判決,含「不抄」的理由。
2026年8月15日 · / / / /
AI 只拿得到 diff:我用 sem 補上改動影響面
讓 AI 改程式碼一陣子後發現它看不到「改動會炸到誰」,用 sem 加兩支 hook 補上,附兩個月試用期成績單。
2026年8月13日 · / / / / / /
我裁掉了兩個 AI 檢查員,留下的那個能者過勞
三個同期 AI 檢查員兩死一留。翻完帳本後,我發現精確率、出勤成本與責任位置要一起對上,判官才找得到自己的生態位。
2026年8月12日 · / / / / /
防得了失誤,防不住意圖:給 AI 的 shell 裝一把鎖
在 AI agent 執行 shell 指令前架一道攔截器,四週實測下來的三個確定判斷:誤攔數量不是重點、關不掉不等於繞不過、它防得了失誤卻防不住意圖。
2026年8月10日 · / / / / /
半年 20 萬星的祕密是「少」:Matt Pocock 的哲學,我信六條、不信一條
拆解 Matt Pocock 的 skill 設計哲學(觸發歸人、認知負擔是主導權的價格、spec 是會過時的快取、流程主導權不外包),用我在大量吸收他之前先取樣的九軸立場當對照:六軸同構、三軸對立,而三個對立收攏成同一條分歧:稀缺的人類注意力該花在哪。那一條,就是我不信的那一條。
2026年8月9日 · / / /
最強模型不是每件事都該用:配額逼我重劃 AI 分工
Fable 5 只能吃掉共用週額度的一半,逼我把派工改成按「需不需要判斷力」分類:機械給 Sonnet、判斷給 Opus,規則釘進定義檔而不是寫在文件裡,帳用額度算不用 token 算。
2026年8月8日 · / / / / /
規則寫下來了,agent 真的有收到嗎
把規範放進檔案還不夠。這篇記錄我怎麼從互相打架的量測答案追出規則送達斷在哪裡,再把內容直接送進對話。
2026年7月29日 · / / /
聽話,不代表懂你:GPT 接進 Claude Code 第二週的性格觀察
接入後第二週八場對話的逐場統計對照:GPT 對寫下來的規則執行得比 Claude 徹底,卻讀不到規則之外的訊號。附一場對話壓縮吃掉關鍵結論的完整事故。
2026年7月21日 · / / / /
接得上,不代表合得來:把 GPT 接進 Claude Code 的三顆雷
把 ChatGPT 訂閱額度接進 Claude Code,協議通了只是開始。真正難搞的是內建生態錯配、設定靜默蓋值,還有三個意思完全不同的上下文視窗數字。
2026年7月20日 · / / /
雲端太遠,hook 等不了:低延遲給了本地小模型就業機會
本地 LLM 當日常主力碰到天花板,縮到 hook 裡當語意判官後,反而找到雲端免費層坐不穩的窄職位。
2026年7月18日 · / / / / /
工作能外包給 AI,決策不能
AI 幫你挑出 spec 漏洞之後,你有沒有逼它認錯過一次?三段真實對話拆開這個常常被跳過的步驟。
2026年7月18日 · / / / /
AI 說做完不算數:拿證據來
哪些判斷交給死規則就夠、哪些規則根本寫不成——兩條監工 hook 的實測,把邊界畫出來。
2026年7月17日 · / / / /
一個模型不夠:五軸交叉審的 code review 工作流
四個 AI reviewer 全漏掉一顆死掉的 Save 按鈕,第五個抓到了。從這個案例拆我的 /pr-review command 三個設計哲學:視角是餵出來的、找的不准自己驗、模型不可信的部分用程式保證。
2026年7月8日 · / / / /
Claude Code 換第三方模型,換到的是有條件的韌性
換掉 Claude Code 的模型供應商,真正換到的是額度韌性。但這個韌性的備用方案會踩到中國模型的內容審查、靜默降級成 200K 的舊模型而爆炸——有條件的韌性。
2026年7月8日 · / /
Claude Code 換第三方模型的踩坑指南
把 CC 接到 DeepSeek、Kimi、GLM、Qwen 加第三方中轉站的踩坑清單:WebSearch 四種死法、計費校準、context 隱形縮水、同 endpoint 三條呼叫路徑結論完全相反、中介層破口跟 repo 活躍不同步。
2026年7月3日 · / /
我以為 Opus 沒遇到麻煩,後來發現是它根本沒在報
換 Opus 一個多月沒看到 agent 回報摩擦點,我以為沒問題。grep 一下才發現,是它根本沒在報。
2026年6月27日 · / / /
偷確定性層:否決整套 AI 工具後,還能帶走什麼
三題篩掉三個 AI 工具的本體後,把它們不靠 AI 的那一層拆回家。三案顯示這層移植成本最低、永遠帶得走。
2026年6月25日 · / / / /
嘴上說想要,但 agent 根本沒在用
量 revealed adoption 的方法:為什麼口頭意願不能當投資依據,怎麼從 session log 數出真實的自發採用率,還有量法本身踩過的坑。
2026年6月20日 · / / / /
codebase 工具數據很強,到我 agent 手上剩不到一成
FFF 宣稱快、省 token、給 AI agent 用,但接進 Claude Code 後我的 agent 實際吃得到不到一成。一個套件值不值得接,要看它宣稱的能力到你 agent 手上實際用得到多少,四個專案的 session 統計算給你看。
2026年6月14日 · / / / /
你已經有的越多,新工具能給的越少
評估熱門 AI 工具的方法總綱:先列自己已有的,再把工具賣點一條一條對上去,多數工具會自己歸零,剩下的那一點才值得認真看。
2026年6月11日 · / /
讓額度不大的帳號,也能掛機過夜跑完大型研究 workflow
想讓一個跑上百 agent 的重型研究在我睡覺時自己跑完,連額度不大的帳號也扛得起。難點是它幾十分鐘就燒爆一段每 5 小時的額度,得靠 pause→resume 跨段續跑。而 resume 能不能省 token,卡在一個官方沒明說的前提:workflow 夠不夠確定性。
2026年6月8日 · / / /
下架八個月的惡意 extension 還躺在我硬碟,bumblebee 抓到了
一個下架八個月的 GlassWorm 惡意 extension 還躺在我硬碟上,被 bumblebee 掃出來。市集下架、編輯器自動更新、傳統掃描型工具都擋不住,只有掃磁碟實際安裝狀態才抓得到。
2026年6月7日 · / / / / /
官方 deep-research workflow,我用 Opus 跑一次掛一次
拿官方 deep-research workflow 密集跑研究,75 個 verify agent 一次湧入、直接頂破 Anthropic 的 acceleration limit。撞名、撞限、自己 fork 一支批次節流版的復盤。
2026年6月3日 · / /
ultracode workflow,別跑完就丟
dynamic workflow 是繼 skill 之後第三種「把成功流程固化成可復用資產」的載體。ultracode 的真正價值不在現場生一支腳本跑完,而在把編排本身存下來復用。三個實際遷移案例講怎麼選。
2026年6月2日 · / / /
省 token 工具:省不了多少,但風險不小
親手試了五個主打省 token 的工具,從命令列代理到上下文壓縮層 proxy,宣稱跟實測常差一截,真正的代價在風險。連那個「做對了透明可逆」的也不值得裝。
2026年6月1日 · / / / /
裝了一堆 codebase 搜尋工具,agent 幾乎都不用
兩個月在一個 codebase 上前後評估了 8 個程式碼搜尋工具,前 7 個 agent 幾乎都不主動用。工具有沒有能力,跟它會不會被 agent 用起來,是兩件不同的事。
2026年5月31日 · / / /
MEMORY.md 只有 25KB,要當目錄用、別當倉庫塞
MEMORY.md 超出注入上限時有三類應對方向,但 A 類根本不存在,B 類有副作用,真正走得通的是 C,而且降 size ≠ 縮敘述。
2026年5月30日 · / /
為什麼我不再相信 Explore Agent 說他做完了
LLM 工具鏈裡「報告成功」和「真的完成」差得很遠——subagent 捏造、安裝靜默失敗、排程一個月零進展、測試腳本自我推翻,四種場景、二十幾個案例,Anthropic 知道但選擇不修。
2026年5月24日 · / / / /
wiki 蓋好之後,讓它繼續活著才是真正的問題
Karpathy 的 LLM-wiki 範例給了結構,但結構不保證系統有用。不到一個月的密集迭代後,讓它持續活下去的是每天主動量健康度、由我手動拍板的迴圈,跟架構、演算法無關。
2026年5月19日 · / / /
我把自己裝的向量記憶砍掉了——928 次寫入換來 3 次搜尋
安裝 mempalace 跑了 2-3 週,hook 自動寫入 928 次,我主動查了 3 次,0.09% 的搜尋/drawer 比,6 個對照測試 grep 全勝——最後親手拔掉。
2026年5月18日 · / / / /
AI 說它查過官方文件,但它沒有
2026-05-10 實測:同一個查詢,WebSearch 回傳 10 條連結,沒有一條是官方文件專頁。瀏覽器走真實 Google 第一條就是。
2026年5月18日 · / / / /