Claude Opus 5

Claude Opus 5 – Anthropic 最新发布的旗舰级模型

Claude Opus 5,Anthropic 最新推出的旗舰级人工智能模型,以其卓越的性能和亲民的价格迅速成为行业焦点。这款模型的设计理念是提供“媲美 Fable 5 的前沿智能,而价格仅为其一半”,在同等成本下,相较于 Opus 4.8,其性能实现了质的飞跃,现已成为 Claude Max 的默认模型,并为 Claude Pro 用户提供了最强大的选择。

Claude Opus 5 究竟是什么?

Claude Opus 5 是 Anthropic 隆重推出的最新一代旗舰模型。其市场定位清晰——“媲美 Fable 5 的尖端智能,价格仅为其一半”。与 Opus 4.8 相比,在不增加成本的前提下,Opus 5 的性能得到了显著提升。它已无缝集成,成为 Claude Max 的标配,同时也是 Claude Pro 用户能够获得的最高级别能力选择。Opus 5 的一大亮点在于引入了可调节的“effort”思考档位,允许用户在追求极致推理能力与追求更低延迟、更节省 token 之间进行灵活权衡。在编程、知识工作、商业自动化及电脑操作等多项权威评测中,如 Frontier-Bench、GDPval-AA、ARC-AGI 3、AutomationBench、OSWorld 2.0 等,Opus 5 多次拔得头筹,仅在网络安全等少数细分领域略逊于 Mythos 5。

Claude Opus 5 的核心功能

  • 灵活的“effort”思考档位:该模型支持 low、medium、high、xhigh、max 等多个档位。提高档位可获得更强大的推理能力,而降低档位则能实现更快的响应速度和更低的 token 消耗。这使得用户能够根据具体任务的需求,在质量、速度和成本之间找到最佳平衡点。
  • 强大的 Agentic 编程能力:专为终端用户和软件工程任务设计,在 Frontier-Bench v0.1 评测中,Opus 5 取得了 43.3% 的高分,超越了 Fable 5、Opus 4.8 和 GPT-5.6 Sol。官方数据显示,其性能较 Opus 4.8 提升了一倍以上,且单任务处理成本更低。
  • 优化代码协作体验:在 CursorBench 3.2 的最高档位测试中,Opus 5 与 Fable 5 的表现仅有 0.5% 的差距,而其成本却只有 Fable 5 的一半。在同等预算下,high、xhigh、max 档位的表现均领先于其他模型。
  • 卓越的知识工作与写作表现:涵盖分析、研究、文档撰写、办公类任务等。在 GDPval-AA v2 评测中,Opus 5 获得 1861 分,领先于 Fable 5、GPT-5.6 Sol 和 Opus 4.8。
  • 智能搜索与高效浏览:具备强大的 agentic search 能力,在 BrowseComp 评测中获得 90.8% 的得分,略高于 GPT-5.6 Sol 的 90.4%。这使其非常适合处理复杂的资料检索和信息综合任务。
  • 出色的电脑操作能力:在 OSWorld 2.0 评测中,Opus 5 取得了 70.6% 的得分,超越了 Fable 5 和 GPT-5.6 Sol。官方表示,Opus 5 仅用约三分之一的成本就能达到 Fable 5 的最佳成绩。
  • 高效的商业流程自动化:能够端到端地完成商业任务。在 AutomationBench 评测中,Opus 5 的通过率为 26.0%,在同等成本下,其效率约为次优模型的 1.5 倍。即使在最低的 effort 档位下,其完成任务的数量也超过了所有竞争对手。
  • 应对新颖问题的能力:在 ARC-AGI 3 评测中,Opus 5 获得 30.2% 的得分,是第二名 GPT-5.6 Sol 的三倍,充分展现了其处理训练数据之外新任务的强大泛化能力。
  • 科学研究的有力助手:在生命科学领域的评测中,Opus 5 全面超越了 Opus 4.8,涵盖了结构生物学、有机化学和生物信息学。例如,在光谱推断分子结构方面提升了 10.2 个百分点,在预测蛋白序列变异功能影响方面提升了 7.7 个百分点。
  • 更主动、更审慎的交互体验:官方将其定位为一款更具主动性、更深思熟虑的模型,能够减少不必要的来回确认,进行自我检查,并在任务执行过程中有效地从错误中恢复。同时,它依然强调安全护栏的稳固性。
  • 高频日常与产品集成优化:Opus 5 的运行效率更高,非常适合日常使用。它已成为 Claude Max 的默认模型,并且是 Claude Pro 上提供的高能力选项。用户界面也提供了“Opus 5 High”等档位入口,方便用户直接调用。

如何充分利用 Claude Opus 5

  • 便捷的平台访问:打开 Claude 应用程序或访问其网页版,在模型选择器中轻松切换到 Claude Opus 5。
  • 依订阅层级使用:Claude Max 用户已将 Opus 5 作为默认模型使用。Claude Pro 用户则可将其视为当前最高能力的选择。
  • 按任务调控“effort”档位:对于简单的问答、摘要或文本润色任务,使用低档位可以更快且更省 token。对于代码调试、复杂分析或研究类任务,则应将档位调至 high、xhigh 或 max,以获取更强的推理能力。
  • 提供清晰的目标和约束:在与 Opus 5 交互时,明确说明期望的交付物、格式要求、字数限制、截止日期、可用的工具以及验收标准,这样可以最大限度地减少来回沟通,充分发挥其“更主动”的特性。
  • 在编程场景中的应用:提供仓库结构、错误日志、接口文档以及期望的行为描述。Opus 5 最擅长的问题定位、代码修改、测试运行及结果解释。
  • 应用于知识工作:提供背景资料、目标读者和输出模板,然后让 Opus 5 进行调研、撰写大纲、生成初稿、进行校对和改写。GDPval-AA v2 的优异表现证明了其在知识工作领域的领先地位。
  • 实现智能搜索与信息整合:明确要求“先检索后归纳,标注信息来源,并区分事实与推测”,以充分发挥其 agentic search 能力(BrowseComp 得分 90.8%)。
  • 构建自动化流程:将重复性的办公流程分解为具体步骤,明确输入、输出和异常处理机制,然后让 Opus 5 端到端地执行。AutomationBench 的结果显示,其同成本下的任务通过率约为次优模型的 1.5 倍。
  • 处理电脑操作类任务:明确定义可操作的软件、文件范围以及禁止的行为,然后指示 Opus 5 执行。在 OSWorld 2.0 评测中,Opus 5 获得了 70.6% 的高分。
  • 应用于科研场景:可用于解决结构生物学、有机化学、生物信息学等领域的问题,例如推断光谱数据中的分子结构、预测蛋白序列变异的功能影响等。但仍需专家进行最终的复核。
  • 精细化成本控制:初期可尝试使用低档位进行初步测试,对于难度较大的任务再逐步提高档位。长任务可以拆分成小批量执行,将最高 effort 档位优先留给最关键的难题,因为高档位虽然更智能,但也会消耗更多的 token。

Claude Opus 5 的核心优势

  • 半价体验旗舰级智能:其智能水平已逼近 Fable 5,但价格却仅为其一半。在 CursorBench 3.2 的最高档位测试中,Opus 5 与 Fable 5 的峰值表现仅相差 0.5%,而成本却低至一半。
  • 性能大幅提升,成本不变:与 Opus 4.8 相比,在成本保持不变的前提下,Opus 5 的性能得到了显著提升。官方数据显示,在 Frontier-Bench 编程任务中,性能提升超过一倍,且单任务成本更低。
  • 编程能力尤为突出:在 Frontier-Bench v0.1 评测中,Opus 5 获得 43.3% 的得分,大幅领先于 Fable 5(33.7%)、GPT-5.6 Sol(34.4%)和 Opus 4.8(21.1%)。
  • 同预算下更具竞争力:在 high、xhigh、max 等高档位下,Opus 5 在同等成本下的得分均领先于其他模型。官方的宣传口号可以概括为“花费一半的预算,完成接近 99% 的工作”。
  • “effort”档位的弹性优势:一个模型即可满足从快速响应到深度推理的多种需求。低档位适合日常高频使用,高档位则可用于攻克难题,使得成本曲线更加可控。
  • 知识工作领域的领先地位:GDPval-AA v2 评测得分 1861,超越了 Fable 5、GPT-5.6 Sol 和 Opus 4.8,是研究、分析、写作和办公决策的理想选择。
  • 新问题求解能力跃升:ARC-AGI 3 评测得分 30.2%,是第二名 GPT-5.6 Sol 的三倍,表明其在面对未知任务时的泛化能力显著增强。
  • 自动化与电脑操作的性价比极高:AutomationBench 的同成本通过率约为次优模型的 1.5 倍。OSWorld 2.0 评测中,Opus 5 仅用约三分之一的成本便超越了 Fable 5 的最佳成绩。
  • 搜索与信息综合能力位居前列:BrowseComp 评测得分 90.8%,略高于 GPT-5.6 Sol 的 90.4%,非常适合进行复杂检索、资料比对和综述生成。
  • 科研能力提升显著:在生命科学领域的各项评测中均超越 Opus 4.8,尤其是有机化学领域提升最大。光谱推断分子结构能力提升 10.2 个百分点,蛋白序列变异功能影响预测能力提升 7.7 个百分点。

Claude Opus 5 的项目地址

Claude Opus 5 的同类竞品对比

对比项Claude Opus 5Claude Fable 5GPT-5.6 Sol
定位高性价比旗舰:提供接近前沿智能的体验,适用于高频日常及专业工作。更高阶的前沿模型,是 Opus 5 主要的“追赶目标”。重要的外部竞品,在多项性能指标上处于第一梯队。
价格/成本约为 Fable 5 的一半;与 Opus 4.8 相比,成本不变但性能大幅提升。价格约为 Opus 5 的两倍。整体成本曲线不如 Opus 5 优化,多项同成本得分落后。
Frontier-Bench v0.1 终端编程43.3%,位列第一。33.7%。34.4%。
CursorBench 3.2最高档位表现与 Fable 5 峰值仅差 0.5%,成本约一半。峰值表现最高,但成本也更高。在同等预算下,整体表现落后于 Opus 5。
GDPval-AA v2 知识工作1861 分,位列第一。1747 分。1736 分。
ARC-AGI-3 新问题求解30.2%,约为第二名 GPT-5.6 Sol 的三倍。数据未在表格中列出。7.8%。
BrowseComp 智能搜索90.8%,微幅领先。87.4%。90.4%。
OSWorld 2.0 电脑操作70.6%,位列第一;约三分之一成本即可超越 Fable 5 的最佳成绩。66.1%。62.6%。
AutomationBench 商业流程26.0%,位列第一;同成本下效率约为次优模型的 1.5 倍。17.4%。18.1%。
DeepSWE v1.168.8%。69.7%。72.7%,在此项中位列第一。
FrontierCode v1.153.4%。53.5%,微幅领先(也是官方文本现乌龙的部分)。47.5%。
HLE 多学科推理无工具 56.3%,有工具 64.7%。无工具 56.5% 微胜,有工具 63.9%。数据未在表格中列出。
Legal / HealthLegal 11.7%;Health 59.8%。Legal 13.3% 更强;Health 项目未列 Fable,Mythos 5 为 66.0%。Legal 2.5%;Health 60.5%。
更适合追求“接近旗舰性能且控制成本”的编程、知识工作、自动化、科研日常用户。预算充足,追求极限峰值能力的高难度任务。已在 OpenAI 生态内,或看重 DeepSWE/Health 等个别强项的团队。

Claude Opus 5 的应用场景

  • 软件开发与代码重构:适用于需求澄清、代码生成、错误定位、测试用例补充、代码重构解释以及终端命令辅助。其在 Frontier-Bench 终端编程评测中以 43.3% 的得分登顶,是其最擅长的应用领域。
  • 日常化 AI 编程助手:在类似 Cursor 的工作流程中,可以承担长任务拆解、跨文件修改和回归测试等工作。CursorBench 的最高档位测试显示,其性能接近 Fable 5 的峰值,但成本仅为其一半,非常适合高频调用。
  • 企业级知识工作处理:例如撰写方案、进行深度研究、整理会议纪要、生成汇报材料、修改简历、公文或商业文档。GDPval-AA v2 的 1861 分证明了其在办公室高频使用场景下的出色表现。
  • 深度信息检索与报告撰写:用户可以提出研究课题,Opus 5 将自动进行信息检索、来源比对、结论归纳,并标注不确定性。其 BrowseComp 90.8% 的得分使其成为竞品调研、行业研究和文献梳理的理想工具。
  • 商业流程自动化实现:能够端到端地处理表单填写、数据迁移、审批草稿生成、客户跟进和报表生成等流程。AutomationBench 评测显示,其同成本下的任务通过率约为次优模型的 1.5 倍。
  • 电脑操作与轻量级 RPA 部署:在明确的安全权限范围内,Opus 5 可以执行软件操作、文件整理、批量表格处理和网页流程自动化等任务。OSWorld 2.0 70.6% 的得分,且成本效率优于 Fable 5,使其成为一个高效的选择。

Claude Opus 5 的常见问题解答

问:Claude Opus 5 和 Claude Fable 5 该如何选择?
答:如果您追求极致的峰值性能且预算充足,Fable 5 是更优选。而如果您需要高性价比且面向日常高频使用的场景,Opus 5 是不二之选。值得注意的是,在 CursorBench 的最高档位测试中,Opus 5 的表现与 Fable 5 的峰值差距仅为 0.5%,但成本却低至一半。


问:Opus 5 相较于 Opus 4.8 有哪些提升?
答:根据官方信息,Opus 5 在成本不变的前提下,性能实现了大幅提升。在 Frontier-Bench 编程任务中,其得分从 21.1% 跃升至 43.3%,官方宣称性能提升超过一倍,且单任务成本更低。


问:如何理解 Claude 目前的模型层级?
答:可以粗略理解为:Opus 5 主打高性价比的旗舰级体验;Fable 5 定位为更前沿的模型;Mythos 5 则在少数极高难度的特定任务上表现更强。Opus 5 仅在网络安全等少数任务上明确落后于 Mythos 5。


问:在哪里可以体验 Claude Opus 5?
答:Claude Max 已将 Opus 5 作为默认模型集成。Claude Pro 用户则可将其视为最高能力选项。在用户界面中,您可以看到类似“Opus 5 High”的档位入口,方便直接调用。


问:“effort”档位是什么,应该如何使用?
答:“effort”是指模型的思考强度档位。提高档位会使模型更“聪明”,而降低档位则能实现更快的响应速度和更低的 token 消耗。对于简单的任务,建议使用低档位;对于代码编写、深度研究或自动化等复杂任务,则应将档位提升至 high、xhigh 或 max。


问:Opus 5 最擅长哪些方面?
答:Opus 5 最突出的优势在于软件工程和终端编程领域。其次,它在知识工作、智能搜索、商业流程自动化、电脑操作以及新问题求解方面也表现出色,这在 Frontier-Bench、GDPval-AA、BrowseComp、AutomationBench、OSWorld 和 ARC-AGI 3 等多项评测中得到了充分体现。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...