← 吴兆华个人网站站内作者版本 · 本页为长期 canonical · 最近核验 2026-07-26
Frontier Model Research · 2026.07.25

Opus 5,不只是
“半价 Fable”

把 Fable 5、Claude Opus 5 与 GPT‑5.6 Sol 放在一起,真正值得比较的不是“谁赢了几张榜单”,而是三家公司正在把前沿智能做成三种完全不同的产品。

作者:吴兆华事实核验:官方发布与独立测评交叉比对阅读时间:约 26 分钟版本:旗舰研究版
Fable 5、Opus 5、GPT-5.6 Sol 三种前沿智能产品哲学对比图
AI解释图|图像用于建立阅读框架,不承担模型性能证明。能力和价格结论以正文中的官方资料与独立测评为准。
如果你只想知道结论先读第 1、7、10 节
如果你要做模型采购重点读第 4、6、8 节
如果你关注行业变化重点读第 3、9、10 节
01先给结论

Opus 5 的意义,不是“又一个最强模型”

2026年7月24日,Anthropic 正式发布 Claude Opus 5。最容易传播的说法是:它拥有接近 Fable 5 的能力,只收一半的价格。但如果只把它理解成“Fable 平替”,就会错过这次发布真正重要的部分。

过去两个月,前沿模型市场出现了一次很清晰的分层:Fable 5 把能力上限往前推;GPT‑5.6 Sol 把浏览、电脑操作、文件、代码、图像和多智能体整合成一套更完整的执行系统;Opus 5 则试图占领两者之间最有商业价值的位置——让足够强的智能,以可预测的成本和努力档位,持续完成日常最难的生产任务。

一句话判断 Fable 5 代表“能力上限”,Opus 5 代表“生产前沿”,GPT‑5.6 Sol 代表“工具系统”。三者不是同一条赛道上的三个名次,而是三种不同的智能产品哲学。
Fable 5
能力上限

适合极少数、极困难、长周期、容错率低的研究与工程任务。

你为“多一点上限”付费。

Opus 5
生产前沿

用五档努力、较低单价和更主动的执行风格,覆盖复杂编码、知识工作和业务自动化。

你为“稳定完成难事”付费。

GPT‑5.6 Sol
工具系统

把模型放进浏览器、终端、文件、电脑操作、图像和多智能体运行时中。

你为“跨工具交付结果”付费。

因此,“谁更强”这个问题只有在你补上任务、工具、预算、时间、验收标准之后才有意义。脱离运行时谈模型,已经越来越像脱离操作系统谈芯片:并非错误,但不足以解释真实体验。

02新品拆解

Opus 5 到底好在哪里?

Anthropic Opus 5 官方发布视觉
ANTHROPIC 官方素材

它把“最高能力”改造成了一条可调的生产曲线

官方将 Opus 5 定位为“thoughtful and proactive”。这两个词比“更聪明”更准确:它更愿意检查上下文、补测试、找根因、验证结果,也更容易主动扩展任务。

资料来源:Anthropic 2026年7月24日发布页。图片为官方视觉,文字为本文分析。

第一,接近最高能力,但成本进入主力生产区

Opus 5 的 API 公开价为每百万输入 Token 5 美元、输出 25 美元;Fable 5 为 10/50 美元。两者都提供 100 万上下文和最高 12.8 万输出。定价直接减半,并不意味着每个任务成本一定减半——模型会使用多少思考 Token、调用多少工具、是否重试,都会改变账单——但它确实让更多团队可以把 Opus 作为默认复杂任务模型,而不只是故障升级时的“奢侈品”。

第二,五档 effort 不是参数选项,而是一条新的产品曲线

Opus 5 提供 low、medium、high、xhigh、max 五档努力级别,API 与 Claude Code 默认 high。低档让它用较少推理处理常规工作,高档让它在复杂工程、研究和跨工具任务中投入更多计算。独立测评显示,从 low 到 max 的输出 Token 使用量可相差约八倍。换句话说,Opus 5 不是一个固定点,而是一条“质量—成本—时间”曲线。

Anthropic 官方 Frontier-Bench 不同 effort 的能力与单次尝试成本图
官方图表|Anthropic 内部 Frontier‑Bench v0.1 运行:不同 effort 会显著改变得分与单次尝试成本。官方脚注说明使用 mini‑SWE‑agent、GKE 后端、每任务 5 次均值,并对安全分类拒答设置 Opus 4.8 回退。它证明“努力曲线”的存在,但不是跨平台统一结论。

第三,它优化的不是答题,而是“收尾能力”

Anthropic 展示的案例重点并非代码能不能写,而是能否发现根因、补建测试支架、验证修复、处理缺失数据、在工具变化后继续执行。对企业而言,这类差异很关键:真正昂贵的不是模型少写一段代码,而是它留下一个表面可运行、实际不可验收的半成品。

第四,工具可以在对话中变化

Opus 5 推出对话中工具变化的测试能力,并支持服务端自动回退。前者意味着长任务运行过程中可以新增或替换工具,不必完全重启上下文;后者则意味着你在产品层实际使用的“Claude”,有时可能由不同模型共同完成。它提高了连续性,也再次提醒我们:用户体验到的是一个编排系统,不再只是一个模型权重。

第五,它更主动,也更容易“做多了”

Anthropic 自己在提示词指南中承认:Opus 5 更倾向于解释过程、反复验证、扩大范围和委派子任务。对于复杂项目,这是优势;对于边界严格的修改,它可能变成额外成本。使用时应该明确写出:只修改哪些文件、何时停止、是否允许重构、最多调用几次工具、什么算完成。

不要忽略的限制:Opus 5 在 Artificial Analysis 的综合智能和知识工作指标上表现突出,但在该机构的事实知识测试中仍落后于 Fable 5,且其特定测试中的幻觉率升至 50%。这不是“所有回答一半都错”,而是说明:高努力、高自主性不等于更可靠的事实记忆。涉及数字、法规、医学和投资时,仍必须检索与复核。
03本质区别

不是三台发动机,而是三套不同的整车

今天再用“参数量、上下文、榜单分数”理解模型,已经不够了。用户真正接触到的,是基础模型、推理努力、工具、记忆、多智能体、安全分类、回退模型和验收机制共同组成的产品。

模型经过基础模型、推理努力、工具浏览、多智能体、安全回退和验收机制成为产品
AI解释图|模型与产品的六层差异。图中结构是本文分析框架,并非任何厂商公开架构。
Fable 5:把天花板做高

Fable 5 与 Mythos 5 使用同一底层模型,但通过安全分类和回退机制向公众开放。它追求的是在最难、最长、最陌生任务上的能力上限。代价是更高价格、更慢速度,以及在网络安全、生物化学、模型蒸馏等敏感查询上更严格的路由。

Opus 5:把前沿做成产线

Opus 5 并不在每个指标上击败 Fable,但通过半价定价、五档 effort、较低摩擦的安全策略、代码审查和业务自动化能力,把大量原本需要“最高模型”的工作移入日常生产。

Sol:把智能做成系统

GPT‑5.6 Sol 的差异不仅在模型,而在 Responses API 的工具面:网页搜索、文件搜索、图像生成、代码解释器、Hosted Shell、Apply Patch、Skills、Computer Use、MCP、Tool Search 与多智能体协作。它更像一套可编排的智能操作系统。

Fable 5 的问题是“这件事能做到多好”;Opus 5 的问题是“这件事能否稳定做完”;Sol 的问题是“这件事能否跨工具直接交付”。

这也解释了为什么同一榜单会出现相反结论:如果测试只允许文本回答,模型本体占主导;如果允许浏览、终端、文件和多智能体,运行时就会改变结果;如果测试又限制时间和成本,effort 与工具调用策略会再次改变排名。所谓“最强模型”,本质上是一个条件句。

04参数与产品面

先把能直接比较的事实放在一张表里

维度Fable 5Opus 5GPT‑5.6 Sol
正式发布2026-06-092026-07-242026-07-09
公开定位Anthropic 广泛开放的最高能力模型;与 Mythos 5 同底模面向日常复杂任务的主动型前沿模型OpenAI 5.6 系列旗舰,强调性能/成本和端到端工作
输入 / 输出价$10 / $50$5 / $25$5 / $30;缓存输入 $0.50
长上下文1M / 128K 输出1M / 128K 输出1.05M / 128K 输出
知识截止2026-012026-052026-02-16
努力控制自适应思考,面向高复杂度low 至 max 五档;high 默认多档 reasoning;ultra 可协调并行 Agent
速度选项官方标注较慢常规中速;Fast 约 2.5× 速度、2× Token 单价常规与不同 reasoning 档位;具体延迟取决于运行时
强项重心长周期研究、复杂推理、视觉与科学问题Agent 编码、代码审查、知识工作、业务流程工具调用、浏览、终端、电脑操作、设计与可编辑交付物
安全产品形态敏感请求分类并可能回退 Opus 4.8更少介入;被标记请求仍可能回退模型与产品政策、工具权限、组织控制共同约束
重要价格注释高思考和长任务提高实际成本effort 与 Fast 改变实际成本超过 272K 的提示按整次请求提高输入与输出费率

价格单位均为每百万 Token 美元;公开价不含工具、存储、网络、失败重试与人工复核成本。参数与价格截至 2026-07-25,以官方 API 文档为准。

一个常见误区:100万上下文不是“100万 Token 都能同等精确地推理”。上下文容量描述能放进去多少内容;检索位置、注意力分配、任务结构、压缩策略和工具记忆决定模型真正能用好多少内容。
05榜单真相

三家公司都能证明自己赢了——这恰恰说明不能只看一张表

Anthropic 的发布页把 Opus 5 放在 Frontier‑Bench、GDPval‑AA v2、ARC‑AGI‑3、BrowseComp、OSWorld、AutomationBench 等多项领先位置。OpenAI 的发布页则显示 Sol 在 Agents’ Last Exam、TerminalBench、BrowseComp 等任务上强势,并在自己的表格里保留了 Fable 在 SWE‑Bench Pro 和 GDPval‑AA 的优势。

Anthropic 官方 Opus 5、Fable 5、Opus 4.8、GPT-5.6 Sol 多项基准对比
官方图表|Anthropic 发布页的多基准对比。它有助于理解 Anthropic 如何定位 Opus 5,但属于厂商自测;不同工具、提示、effort、采样次数和安全回退都会影响结果。

为什么官方数字会互相“不一致”?

以 GDPval‑AA 为例,Anthropic 官方图中 Opus 5 为 1861、Fable 5 为 1747、Sol 为 1736;OpenAI 发布页中的另一套表格则给出 Sol 1747.8、Fable 1759.6。差异可能来自评测版本、运行时间、模型快照、工具与 harness、采样数或裁判配置。它不必然意味着谁“造假”,而是说明模型榜单从来不是物理常数。

61 / 60 / 59Artificial Analysis 综合智能指数:Opus 5 max / Fable 5 max / Sol max
1861 EloArtificial Analysis GDPval‑AA v2:Opus 5 max;知识工作表现突出
50%AA Omniscience 特定测试中的 Opus 5 幻觉率;只适用于该测试口径

Artificial Analysis 在发布前获得 Anthropic 支持进行测试,结果相对独立于厂商官网,但仍不是绝对中立的“宇宙真理”。其结论值得注意:Opus 5 max 在综合智能和知识工作上领先,编码 Agent 指数并列第一;但 Fable 5 在事实知识上仍更强,GPT‑5.6 家族在较低 effort 时经常位于更好的成本—能力前沿。

正确读榜单的方法不是问“第一是谁”,而是问:这张榜单允许了哪些工具?用了哪个 effort?每题几次采样?失败有没有回退?成本和延迟有没有进入排名?
06任务实战

把模型放回真实任务,区别才会显现

1. 复杂编码与代码审查

Opus 5 很可能是新的默认优先项。它在 Agent 编码、代码审查、根因定位、补测试和长任务收尾之间取得了较好平衡;Fable 5 更适合极难架构、陌生系统和必须榨取最后一点上限的任务;Sol 则在终端、Apply Patch、Hosted Shell、文件和多 Agent 配合中占据系统优势。值得注意的是,OpenAI 自己公布的 SWE‑Bench Pro 中 Fable 明显领先 Sol,而 TerminalBench 又是 Sol 更强——“编码强”本身就不是单一能力。

2. 深度研究与知识工作

如果任务是数小时到数天的研究、科学推理、跨文档综合,Fable 5 的上限仍然最有吸引力。Opus 5 在知识工作 Elo 上更突出,且成本更适合频繁使用;Sol 在需要边搜索、边运行代码、边生成表格、图片、幻灯片和最终可编辑文件时更完整。事实敏感任务三者都不能“裸答”:必须绑定一手来源、证据台账和人工复核。

3. 浏览器、电脑操作与跨应用流程

Sol 的核心优势最明显。OpenAI 把网页搜索、文件搜索、Computer Use、MCP、Tool Search、多智能体和图像生成统一在同一产品栈里。Opus 5 的 OSWorld 和 AutomationBench 表现说明模型自身的操作判断非常强,但企业能否真正用好,仍取决于其工具环境、权限控制和可观测性。

4. 演示文档、可视化与可编辑交付物

Sol 官方强调 design judgment 和 polished editable artifacts。下面这张图是 OpenAI 发布页展示的模型生成幻灯片示例:它不是能力基准,也使用明确标注的合成数据,但体现了 OpenAI 把“回答”推进到“可编辑成品”的产品方向。

OpenAI GPT-5.6 官方发布页展示的合成数据演示幻灯片示例
OpenAI 官方产品示例|页面明确说明数据为演示用途的合成数据,不代表真实市场信息。此图仅用于说明 Sol 的可编辑交付物定位,不用于证明性能领先。

5. 高风险决策

医疗、法律、投资、监管与安全任务,不应该直接按“最强模型”采购。应优先看来源可追溯、工具权限、拒答与回退机制、数据保留、人工审批和结果验收。Fable 的更强安全分类、Opus 的较低摩擦、Sol 的广泛工具面,各有不同风险:一个可能过度阻断,一个可能过度主动,一个可能拥有过多执行面。

最危险的误解:把模型拒答少理解成“更自由”,或把工具多理解成“更能干”。对企业而言,真正重要的是权限是否最小化、动作是否可回滚、证据是否完整、异常是否能中止。
07经济账

Token 价格只是发票的第一行

如果一个便宜模型需要三次重试、两轮人工纠错和一次返工,而一个更贵模型一次通过,后者可能才是低成本模型。

前沿模型真实成本由Token价格、工具调用、失败重试、人工复核和交付结果共同构成
AI解释图|不代表任何模型报价或实测结果。真实项目应使用自己的调用日志、人工时间和验收通过率计算。

Opus 5 的战略冲击正在这里:它不是单纯把 Token 降价,而是试图在更低单位价格下维持较高的一次完成率。Anthropic 在 CursorBench 中强调其 max 得分接近 Fable 峰值,但每任务成本更低;Artificial Analysis 又提醒我们,在低 effort 区间 GPT‑5.6 家族可能拥有更好的成本—智能组合。两者并不矛盾,因为不同任务、不同 effort 会得到不同最优点。

企业真正应该跟踪四个指标:

A
一次验收通过率
B
平均人工复核分钟数
C
单任务总工具与Token成本
D
失败造成的业务损失

当模型进入代码合并、数据分析、客户沟通和业务操作,D 往往比 A、B、C 都大。此时最优选型可能不是“平均最聪明”,而是“失败模式最可控”。

08选型建议

什么任务该选谁?

优先 Fable 5

超长周期科研、极难数学与工程、陌生领域探索、少量高价值任务、失败成本高且预算充足。

优先 Opus 5

复杂代码库、代码审查、企业知识工作、流程自动化、要求主动验证和稳定收尾的日常重任务。

优先 GPT‑5.6 Sol

需要浏览、电脑操作、终端、文件、图像、MCP、可编辑文档或多智能体共同完成的端到端任务。

不要直接选模型

高风险或大规模场景先做自己的评测集;事实任务绑定检索,执行任务绑定权限、回滚和人工门禁。

一套比看排行榜更可靠的 20 题实测法

从真实工作流取样选20个过去三个月真实发生的任务,不用为模型定制的“漂亮题”。
统一输入,不强求统一工具记录每个模型实际可用的工具与运行时,否则比较出来的不是产品体验。
先写验收标准在跑模型前定义正确性、完整性、格式、引用、可执行性和停止条件。
统计总成本Token、工具调用、运行时间、失败重试和人工复核全部计入。
记录失败模式区分事实错误、逻辑错误、工具错误、权限越界、遗漏、过度执行和拒答。
分层路由让便宜档处理常规任务,复杂任务升级 Opus/Fable/Sol 高 effort,而不是所有请求固定用一个模型。

最终得到的不是“模型总分”,而是一张任务路由表。真正成熟的企业不会只买一个冠军模型,而会把不同模型放进不同风险、成本和能力层级。

09容易被忽略的边界

安全、回退与可用性,已经成为性能的一部分

Fable 5 发布后三天曾因美国出口管制相关问题暂停访问,7月1日才恢复。这段经历说明:模型能否持续获得、在哪些地区可用、会不会被政策突然切断,已经与价格和榜单同样重要。

Anthropic 对 Fable 5 的产品化采用安全分类器:网络安全、生物化学、模型蒸馏等敏感请求可能路由到 Opus 4.8。Opus 5 的安全干预率按 Anthropic 口径比 Fable 低约85%,但标记请求仍可能回退。结果是:你在同一个产品名称下获得的回答,可能并不总来自同一模型。

Sol 也不能只看模型卡。其能力依赖 OpenAI 的 Responses API、工具权限、组织设置、地区政策和数据控制。工具越多,潜在价值越大,同时权限面、数据面和误操作面也越大。

采购时必须问为什么重要
是否会自动回退到其他模型?影响一致性、可解释性、成本和安全评估。
工具调用是否纳入零数据保留?模型本身 ZDR 不代表外部工具、日志与附件也自动 ZDR。
长任务如何压缩上下文?压缩、持久笔记和记忆策略会改变结果,不只是上下文窗口。
哪些动作需要人工确认?浏览与分析可以自动,付款、发送、发布、删除和部署通常需要更高门禁。
中断、重试和回滚怎么做?自主性越强,失败恢复机制越重要。
10最终分析

前沿模型市场,正在从“单一王者”变成三层结构

Opus 5 最重要的行业意义,是证明前沿能力不再只存在于最高价模型。能力开始像云计算资源一样,被拆成不同 effort、速度、工具和安全等级,按任务动态调度。

第一层:少量极限任务,继续追逐能力上限

Fable 5 这样的模型不会消失。科研、复杂架构、最难推理和未知问题仍愿意为最后几个百分点付出高价。它更像超算中心:不是所有人每天都用,但决定能力边界。

第二层:大多数高价值任务,转向生产前沿

Opus 5 最可能改变的是这一层。它会推动企业把更多复杂代码审查、分析、流程编排和知识工作从“试验”搬进“默认生产”。如果实际一次完成率和官方口径接近,它带来的不是替代一个模型,而是扩大整个前沿模型可用市场。

第三层:工具系统决定最终体验

Sol 代表的路线会持续增强。模型差距缩小以后,浏览器能不能操作、文件能不能编辑、终端能不能跑、工具能不能搜索、多智能体能不能协作、权限和证据能不能管理,会比单项分数更影响用户选择。

作者最终判断 如果今天必须为复杂日常工作选一个默认模型,我会优先从 Opus 5 开始;如果任务极难、极少且价值足够高,我会升级到 Fable 5;如果任务的核心是跨浏览器、终端、文件、电脑和多智能体交付成品,我会优先测试 GPT‑5.6 Sol。

但这不是永久排名。Opus 5 的事实可靠性仍需更多独立验证,Fable 5 的政策可用性和成本仍是现实变量,Sol 的系统优势也依赖具体工具和权限配置。三个月后,最值得关注的不是谁又多赢一张榜单,而是三件事:

完成率是否真的提高

从演示走向大规模真实任务后,一次验收通过率还能不能维持。

成本是否真的下降

高 effort、工具、重试和人工复核计入后,每个成功任务是否更便宜。

自主性是否可控

模型越主动,企业能否设置边界、停止条件、证据和回滚。

产品差异是否扩大

当基础模型越来越接近,运行时、工具、数据和工作流会不会成为真正护城河。

Opus 5 不是前沿模型竞赛的终点。它更像一个转折点:从今天开始,我们不该再问“哪个模型最强”,而要问“哪套智能系统能以可接受的成本,把我的任务做完,并让我相信这个结果”。
11研究方法与来源

哪些是事实,哪些是厂商主张,哪些是本文判断

本文把证据分为三类:厂商资料 只证明厂商公开了什么;独立测评 用于交叉比对,但仍受 harness 与合作关系影响;作者分析 是基于前两类材料形成的产品与行业判断。

  1. Anthropic|Introducing Claude Opus 5(2026-07-24)
  2. Anthropic API Docs|Models overview(价格、上下文、输出、知识截止)
  3. Anthropic Docs|Prompting Claude Opus 5(主动性、委派、验证与提示建议)
  4. Anthropic|Claude Fable 5 and Mythos 5(2026-06-09)
  5. Anthropic|Redeploying Fable 5(访问恢复与政策背景)
  6. OpenAI|Introducing GPT‑5.6(2026-07-09)
  7. OpenAI API Docs|GPT‑5.6 Sol(价格、上下文、工具与长上下文计费)
  8. Artificial Analysis|Opus 5 analysis(综合指数、成本、知识工作与事实性测试)
核验边界:截至 2026-07-25,没有一套公开评测能在完全相同的提示、工具、effort、延迟、成本、安全回退和采样配置下覆盖三款模型的全部能力。因此本文不给出“全局第一”的绝对排名。正式采购前,应使用真实任务重新实测。

吴兆华|拓拔野的随笔

长期关注 AI、Agent、数字信任与产业变化。本文不是模型厂商广告,也不构成采购、投资或技术承诺。希望做的,是把榜单背后的产品逻辑讲清楚。

e签宝 吴兆华:13967449069
邮箱:tuobaye@tsign.cn

e签宝吴兆华名片,电话13967449069