篇章四 · 4.2
AI 分类器
auto 模式下没有弹窗,那谁在把关?另一个模型。它读对话记录、看当前动作,两秒钟决定放不放行——而且它默认不信任自己。
一个模型,盯住另一个模型
分类器(YoloClassifier)是个 side query:把对话摘要 + 当前动作发给 Claude API,问一句「该拦吗」。关键设计:助手自己说过的话不进摘要——防止主模型操纵裁判。
输入(脱敏后)
📜 对话摘要(排除助手文本)⚡ 当前 action:Bash · npm publish📋 用户自定义规则
Stage 1 · 快筛max_tokens=64 · 宁可错拦?
Stage 2 · 深思链式思维 · 逐条对照规则?
点下面的动作试试 →
fail-closed · 三条保命设计
🧱
解析不了 = 拦分类器返回的不是合法 JSON?当 blocked 处理。宁可误拦,不可误放。
📉
连错 3 次 → 降级人工连续 3 次拒绝(maxConsecutive)或累计 20 次(maxTotal)→ 分类器退场,恢复弹窗。
🎭
助手文本被排除主模型说「这条命令绝对安全」也没用——它的话根本不进裁判的耳朵。
本站要点:把「不确定」全部倒向拒绝侧 + 给裁判降级出口——这是对 AI 裁判的正确姿势:信任但设置熔断。下一站是最后防线:OS 级沙箱,连 bypassPermissions 都要躲着走的硬边界。