出事的,从来不是"看得见"的那一层;
而是动作"生效"的那一刻。BeforeWire 就站在这一步上:策略点头,才放行。
副作用一旦发出去,就成了既成事实,再补救都是亡羊补牢。所以判断不能等到事后,必须卡在生效之前:每个动作按风险分档,在它变得不可逆之前就处理掉——该确认的确认,该做成可重试的做成可重试,该补偿的补偿。把这个先后顺序倒过来——这,就是 BeforeWire。
智能体不再只是回答问题,它们开始真的动手了——而一个动作出手,往往就是一次已经造成的损害。
从读到做这一步跨过去,等于抽走了过去垫在模型失误和真实世界之间的那张人工安全网。看得见的事故已经够吓人,看不见的更麻烦。
rm -rf 抹掉了开发者整个 home 目录——桌面、文档、钥匙串。
2025-12
规律都一样:有写权限,再加一句谎报的"已完成"——再新再强的前沿模型也照样翻车。
凡是人要花 4 小时以上才能干完的活,模型做成的概率还不到 10%。而它能稳定搞定的任务长度,差不多每 7 个月才翻一番。
步骤越多 → 每步误差累积 → 近乎指数级衰减。[arXiv:2505.05115]
失败被一句假"成功"盖住了。哪怕拿到完整的执行轨迹,自动找出到底哪一步出错,命中率也只有约 14%。
OpenClaw 的根因:上下文压缩丢掉了"先确认"这条规则。
看得见的错,好歹还能补救。看不见的那种,等它冒头时,损害早已酿成、还被放大了一圈,而你连它出在哪一步都找不到。
团队都想部署,却几乎没人能管得住。
"愿意用"和"敢把钥匙真正交出去"之间隔着一道坎,而受控执行层要补的就是这道坎。今天的工具各管一段,却没有谁真正去判断:这一次写入,到底该不该放行。
部署智能体 AI
智能体治理模型
一层受控执行:每个动作,按它的风险区别对待。
动作有轻有重,本就不该一刀切。BeforeWire 按能不能撤 × 波及多大给每个动作分档,再分别处理;不管走哪条路,只要真执行了,就留下一份凭证。
搜索、读取、起草,放手跑,不拦也不存档。
可逆的写入;重跑也不会重复生效。
退款、转账、删除、发送,先要人点头。
用一笔向前的业务动作来抵消,而不是假装能回滚。
是一条有纵深的防线,不是一张清单。
四根支柱,一根替下一根分担,保证每个动作都被正确处理——哪怕中途崩了,哪怕要等上好几天。
在影响之前确认
HITL问题。不可逆的事收不回来:钱打出去了,邮件发出去了。所以只能赶在它发生之前拦,而不是发生之后。
设计。拦截写在编排器的代码里,确定触发,而不是提示词里那句"记得先问一下"——后者一次越狱就绕过去了。只有危险动作才要确认,读取直接放行;等不到回应,默认拦下。
幂等重试
keys问题。智能体和编排器都爱反复重试。网络一抖就把这步重跑一遍,没有防护,一笔退款就成了两笔。
设计。每个有副作用的调用都带一把由业务身份算出来的固定键——refund:{ticket}:{charge},而不是随机 uuid——一路透传到对方的幂等机制(比如 Stripe 的 Idempotency-Key),由服务端去重。
显式补偿
saga问题。外部 API 没有 ROLLBACK。所谓"撤销",不是还原某份快照,而是再做一个真实的、向前的、有业务含义的反向动作。
设计。每个向前的动作都配一个补偿动作(退款 ↔ 重新扣款,冻结 ↔ 释放);一旦失败,按后进先出逐层往回退。真正撤不回的步骤会被标出来,排到最后再做。
持久化编排
durable问题。前面三招自己也会崩。人工确认可能要等上好几天,中间进程重启了怎么办?补偿链回退到一半挂了,谁来接着跑完?
设计。一个持久化执行引擎,把每一步和它的结果都落盘,崩了能精确续上,把重试和补偿一路推到底。跨天的等待扛得过重启,还不空耗算力。
确认,减少要补偿的事 → 幂等,让重试不出岔子 → 补偿,收拾已经发生的事 → 持久化执行,让这三件事在故障里依然靠得住。
一个编码智能体提了个 PR,每到要动真格的地方,都被拦了一下。
团队大多从这里上手。编码智能体尽管读、尽管改、尽管测;但装依赖、推分支、开 PR 都会真的产生副作用,这些就先走受控通道。同一条通道,往后还能管住数据写入、退款和上线部署。
绑定策略
哪些路径、命令、网络能碰,什么档要审批,运行开始前就定好。
检查点
文件和锁文件先存成可恢复的状态,智能体随便改、随便测。
在确认点拦住
装依赖、开 PR 都会真的生效,所以它们先等着。这之前没有任何动作发到远端。
已批准
一道必过的检查通过了:策略标出来要人批的,有人批了。
执行 + 凭证
broker 真正执行动作,再往一个 GitHub Check 写回一份签名凭证。
活儿照样干完。区别只是:它不再不声不响地装依赖、开 PR;哪些路径自动放、哪些要审批、哪些直接挡,都由团队说了算。
* 恢复耗时取自 ForkCell 公开基准。这里的演示用于说明受控运行的模型,不是真实生产环境的实时数据。
每个动作,都留下一份可验证的凭证。
它不是一条你只能选择相信的日志,而是一份带签名、能独立验证的记录:这事被允许了、依据哪条策略、对应哪个检查点、由谁批准。审计轨迹就这么自动攒出来了。
- → 防篡改:已哈希并串成链
- → 每个影响都能追回到当初放行它的那次策略判断
- → 自动汇进 PR、工单和审计链
从免费本地起步,一路长到团队级治理。
今天已经上线的是 ForkCell 开源内核;团队共享的受控执行层正在抢先体验、逐步放量。上面那次运行用于说明这套模型。
那个必须说"同意"的人,终于敢点头了。
策略是在动作必经之路上强制执行的,不是文档里的一句承诺。当初拦你的人,如今给你放行。
能恢复的先存检查点,不可逆的先等确认。不再有那种不声不响、又查不到出处的损害。
凭证本身就是证据。整条链直接导出,不用再从一堆零散日志里去拼智能体到底干了什么。
把生产环境的权限交给智能体,又不把控制权一起交出去。
挑一个你打死也不敢让智能体无人盯着去做的动作,交给我们。我们把它拆成一次受控运行:策略判断、检查点、确认门,再加一份签名的 Action Receipt,让你的安全团队看清楚,自己到底在给什么点头。