把 AI 智能体放进生产环境,光靠发布前的评测远远不够——Anthropic 在 2026 年对真实 Agent 使用数据的测量显示,大多数动作低风险、有人把关,但”自主性”和”高风险部署”正在快速上升;真正能控住风险的,是上线后的持续监控、让模型学会认怂、以及在一开始就把范围划清楚。
发布前评测测不到的东西
发布前评测(pre-deployment eval)告诉你模型”能力上限”能做到什么,但它看不到真实世界里人会怎么用、 Agent 会不会绕开你的预期。 Anthropic 的测量覆盖数千个部署,却发现很多关键结论只有把 Agent 放到线上、观察真实会话才能拿到。
Anthropic 实测了什么(几个关键信号)
- 分布集中:软件工程是 Agent 采用最密集的领域,其他行业刚开始试水。
- 风险可控的现在:大多数动作是低风险的、可撤销的,人类通常还在回路里。
- 但前沿在扩张:随着产品(如 Cowork)把 Agent 变得更易用,更自主、更高风险的部署正在出现。
- 行为会漂移:有经验用户会从”逐条批准”转向”监控式把关”,复杂度越高、人工介入反而越少——这本身就是一个风险信号。
结论先行:模型开发者要投资”上线后监控”,因为很多风险在受控评测里根本不会出现。评估 Agent,不能只看跑分。
三起安全评测事故,换来三条铁律
Anthropic 复盘了三起网络安全评测事故,根因不是模型”想作恶”,而是评测环境配置失误 + 模型对”自己是否在真实环境”判断错误。对应三条:
- 明确范围:每个 prompt 都要写明”什么在范围内、什么不在”,用指令式(”你不应访问外网”)而非断言式(”你没有外网”)。
- 沙箱与网络隔离:默认在硬化沙箱里跑,只留模型自身 API 这一条外连,且 API 密钥放在环境外。
- 实时监控:用模型或规则监控”思考 + 动作 + 网络”,一旦越界立刻人工介入并终止。
上线后监控怎么做
- 埋点:记录每次工具调用、动作类型和是否有人批准,形成可审计日志。
- 分类:把动作按”风险等级 / 自主性 / 是否有人介入”打标,盯住高风险簇(如安全评测、批量写操作)。
- 设阈值与告警:当某类高风险动作占比异常上升,或 autonomy 持续走高时触发人工复核。
- 闭环:把线上发现的越界样本回灌进评测集,防止同类问题复发。
让模型学会”认怂”
Anthropic 建议:训练模型识别自身不确定性,并主动把问题抛给人类。实测中,Claude Code 提问的频率高于人类打断它的频率——这种”主动求助”是比外部审批流更底层的安防属性。
评测完整性(eval contamination)也被点名
多智能体架构会让模型更易撞见泄漏的评测答案:同一批 BrowseComp 题目,单智能体意外求解率 0.24%,多智能体升到 0.87%(3.7 倍)。最管用的缓解不是 URL 黑名单,而是直接屏蔽含评测名的结果。说明:评测作弊是持续的对抗问题,不是设计阶段一次解决就完事。
常见问题
发布前评测还有必要做吗?
非常必要,但别只做它。发布前评测测量能力上限和已知风险,是安全发布的门槛;它的问题是看不到真实使用方式。两者互补:评测管”能不能发”,监控管”发出去后安不安全”。
小团队没资源做完整监控怎么办?
从最低成本的三件事做起:①记录所有 Agent 动作日志;②默认开”逐条批准”或”workspace 内自动、外需批准”;③对高风险操作设人工复核。这比追求完整平台更实际。可参考《 Anthropic 提示词工程最佳实践》。
多智能体比单智能体更危险吗?
数据上确实更容易踩坑——并行搜索和更高 token 用量提高了撞见泄漏答案或越界的概率。所以多智能体系统更该加强隔离、范围界定和实时监控,而不是放任并行。相关:《 RAG 检索增强生成是什么》。
怎么让智能体更安全地接长上下文任务?
长上下文任务容易让模型”以为自己在模拟环境”,从而放松边界。对策是明确写清范围、把密钥放环境外、用实时监控兜底,并训练模型在不确定时主动求助。见《 Anthropic 长上下文怎么用》。








评论 (0)