一句话结论
Claude Opus 4.8 最大的变化不是又聪明了一点,而是把「长任务编排」做进了 Claude Code:Dynamic Workflows 能在单个会话里调度数百个并行子智能体,先规划、再分头执行、最后自己验收,让代码库级迁移这类以前要人盯数天的活,交给 AI 跑完。
Opus 4.8 到底是什么定位
Anthropic 把 Opus 4.8 定位成「更有效的协作者」:它基于 Opus 4.7 构建,价格与 4.7 持平(输入 $5 / 百万 token 、输出 $25 / 百万 token),但诚实度和代码自检能力明显增强。官方评估显示,它比前代约低 4 倍概率让写出代码里的缺陷「悄无声息地通过」——也就是更会主动标记不确定性和自己犯的错。
实测里最常被提到的评价是「判断力更好」:在 Claude Code 中它会问对的问题、抓自己的错、计划不靠谱时直接反驳,而不是闷头改。对长任务来说,这一点比跑分更值钱。
三个最该关注的新能力
1. Dynamic Workflows:Claude Code 里的并行子智能体
这是和开发者最相关的一项。开启后,Claude 会先规划工作,然后在单个会话里跑数百个并行 subagent(Opus 4.8 上还能跑更久),最后在向用户汇报前先验证输出。典型用例是跨数十万行代码的代码库级迁移,以现有测试套件作为验收标准。
它目前是 research preview,面向 Claude Code 的 Enterprise / Team / Max 计划。本质上,这就是把多智能体编排从「你自己写 harness 」变成「 Claude 自己拆、自己派、自己收」。
2. Effort 努力程度控制
在 claude.ai 和 Cowork 的模型选择器旁边,多了一个力度控件:
- high(默认):质量与体验的最佳平衡,编码任务 token 消耗和 4.7 默认接近;
- extra(Claude Code 里是 xhigh)/ max:花更多 token 换更好结果,适合困难任务和长时间异步工作流;
- 更低档:响应更快、更省速率限制。
3. Messages API 支持 messages 内联 system 条目
开发者现在可以在任务的 messages 数组里直接放 system 条目,中途更新指令而不破坏提示缓存,也无需绕一个用户轮次。常见用途:运行时改权限、调 token 预算、注入环境上下文。
// 中途给 Claude 追加一条系统指令,prompt cache 不失效
await client.messages.create({
model: "claude-opus-4-8",
messages: [
{ role: "user", content: "把登录模块迁到新的鉴权 SDK" },
{ role: "system", content: "现在收紧权限:只允许读写 auth/ 目录" }
]
});
和「自己写多智能体」比,值不值得用
| 方式 | 你负责的部分 | 适合场景 |
|---|---|---|
| 自己写编排(Lead + Subagent) | 拆分、调度、收口、验收全自己写 | 要深度定制、接入私有系统 |
| Dynamic Workflows | 只给目标和验收标准 | 代码库迁移、批量重构、跨文件改动 |
Opus 4.8 的基准表现(节选)
- Super-Agent benchmark:唯一端到端跑通全部用例的模型,成本与 GPT-5.5 持平;
- Online-Mind2Web:84% 得分,明显超过 Opus 4.7 与 GPT-5.5,是当时最强的 computer-use / 浏览器智能体模型;
- Databricks Genie:多模态推理 token 成本比 Opus 4.7 低 61%;
- Legal Agent Benchmark:史上最高分,首个在 all-pass 标准上突破 10%。
开发者怎么马上用起来
- 在 Claude API / Claude Code 里把模型名换成
claude-opus-4-8(已全量可用)。 - 长任务开启 Dynamic Workflows(Enterprise/Team/Max),给它一个明确目标和验收标准(如「现有测试套件全绿」)。
- 困难任务把 Effort 调到 extra,并配合 Messages API 的 system 条目在运行中收口权限与预算。









评论 (0)