Anthropic 发布 Claude Opus 4.8:更诚实,支持数百子智能体并行

信息来源: X
看点:解决大模型“死不认错”痛点,代码漏报率大降;新增动态工作流支持数百子智能体,Agent能力再上台阶,且加量不加价。

Anthropic 刚刚发布了旗舰模型 Claude Opus 4.8。距离 Opus 4.7 仅过去六周,这次更新不算代际飞跃,官方也承认是“适度但明显的提高”,但它直击了当前大模型最让人头疼的痛点——盲目自信。

Opus 4.8 最核心的改进是“诚实性”。当信息不足或拿不准时,它更愿意承认“我不确定”,而不是强行给个看似靠谱的结论。内部评估显示,新模型对自己生成代码的缺陷漏报率比 4.7 降低了约四倍,自我纠错能力显著增强,欺骗和误导行为的发生率也降到了与对齐标杆 Mythos Preview 持平的水平。

独立工作能力也更强了。在代理编码测试中,得分从 64.3% 升至 69.2%,知识工作得分也有明显提升。伴随新模型,Anthropic 还推出了“动态工作流”功能,允许 Claude 在单次任务中协调数百个并行子智能体,自动规划、拆解和验证复杂流程,比如处理数十万行代码的迁移。

价格没变,常规模式依然是输入 $5/百万 Token、输出 $25/百万 Token。同时新增了 Fast Mode,速度是常规模式的 2.5 倍,价格为输入 $10、输出 $50,比此前的 Fast Mode 降价约三分之二。不过要注意,动态工作流目前仅面向企业版、团队版和 Max 版的 Claude Code 用户开放,且处于研究预览阶段。

另外,Opus 4.6 已经被下架,而此前备受关注的更高级别 Mythos 模型预计将在未来几周向所有客户开放。

怎么用

  • 官网及 APP 已直接更新至 Opus 4.8,API 同步上线
  • Fast Mode 可在模型选择时切换,适合需要快速响应的场景
  • 动态工作流功能需 Enterprise/Team/Max 版 Claude Code 用户才可体验
  • 常规价格:输入 $5/百万 Token,输出 $25/百万 Token

图片来源:X

相关快讯

OpenAI 今天发布了 GPT-5.6大模型, 但是普通人用不了。

今天凌晨,OpenAI 扔了个不大不小的炸弹 GPT-5.6 系列发布了。 GPT-5.6 系列 包括三款模型,名字挺有意思:Sol(太阳)、Terra(地球)、Luna(月亮)。 三款各有分工: Sol 是旗舰,最强大,面向复杂推理、科研...
2026-06-27
QQ邮箱推出AI专属版,腾讯全面AI化

QQ邮箱推出AI专属版,腾讯全面AI化

腾讯QQ邮箱内测专为AI Agent设计的“Agently Mail”。它为Agent提供独立邮箱身份,与个人邮箱数据隔离,解决了以往授权主邮箱带来的隐私风险。支持OAuth授权及CLI一键配置,已适配Cursor、Claude Code等...
mp.weixin.qq.com
2026-06-25
Google发布Gemini 3.5 Pro:200万上下文与Deep Think模式

Google发布Gemini 3.5 Pro:200万上下文与Deep Think模式

Google发布Gemini 3.5 Pro模型,上下文窗口扩展至200万Tokens,可一次性处理整本书或长篇合同。新增Deep Think模式解决复杂推理问题。对长文档处理需求的研究者和开发者极具吸引力,但实际效果与成本仍需观察。
X
2026-06-24

美国政府发出口管制令,Anthropic全面下线Fable 5与Mythos 5

美国商务部对Anthropic的Fable 5和Mythos 5实施出口管制,禁止境外出口及境内外国人访问。因无法按国籍精确切分用户,Anthropic被迫对所有客户全面下线这两款模型。导火索疑似某公司声称越狱模型,政府仅提供口头证据。目前...
mp.weixin.qq.com
2026-06-13

暂无评论

none
暂无评论...