全部模型

Claude Opus 4.7:Anthropic推理模型

Anthropic的Claude 4旗舰模型。在长周期智能体任务、高难度推理和一次改对代码上,是这个家族里最强的选择。

1M tokens · Text / Vision / Code · Prompt cache

Okou已不再运行Claude Opus 4.7。本页作为它的规格、价格和基准测试参考保留。要做同类工作,请用GPT 5.6 Luna。

查看GPT 5.6 Luna

当一件事必须一次做对时,Claude Opus 4.7就是你要找的模型:能干净编译的代码、在长串工具调用中不跑偏的多步计划、小模型会栽跟头的抽象谜题。服务商基准测试(SWE-bench Verified、Terminal-Bench 2.0、ARC AGI 2、OSWorld、BrowseComp)给出了它相对Opus 4.6提升的具体数字。

服务商标价是每100万token输入5美元、输出25美元,缓存输入0.50美元/100万token,在Claude家族里最高。划算的做法是把Sonnet 4.6留作默认,只把最难的环节交给Opus。

Claude Opus 4.7是什么?

2026年4月(接替Opus 4.6) · Claude 4家族的顶配档。Anthropic建议Opus 4.6用户升级到它。

Claude Opus 4.7是Anthropic旗下Claude 4家族的旗舰,2026年4月发布,也是Anthropic建议Opus 4.6用户升级的版本。Anthropic把它定位为智能体编程和抽象推理上的一次台阶式提升,而不是接口层面的小改。4.6引入的100万token上下文窗口和自适应思考强度档位原样保留,所以现有的智能体代码可以直接换过来,不用重写。

和同家族的主力Sonnet 4.6相比,Opus在每个token上投入的算力更多。这种差别体现在三个地方:长时间智能体运行中漏掉指令更少、第一次给出的代码补丁质量明显更好、对话历史超过10万token之后的记忆更稳。代价是Claude家族里最高的标价(每100万token输入5美元、输出25美元)和更慢的单token输出速度——这也是Anthropic自己把Opus定位成编排层或升级档、而不是处处默认的原因。

第三方榜单(Artificial Analysis、Vellum)印证了它相对Opus 4.6的排序,但绝对数值每周都在变,而且OpenAI已经指出所有前沿模型在SWE-bench Verified上都存在训练数据污染。把公开分数当成方向性参考,而不是权威结论;更耐用的信号是那些结构性的行为差异:长流程中的连贯性、第一次补丁的质量、多工具路由的可靠性。

规格速览

家族Claude 4代
模态文本、视觉、代码
语言以英文为主,支持多语言
提示词缓存支持(Anthropic)
上下文窗口100万token
最大输出最多64K token
思考强度档位Low / Medium / High / Max
服务商标价每100万token:输入5美元,输出25美元

Claude Opus 4.7基准测试

分数为服务商自报,来自Anthropic的Opus 4.7发布材料,并与公开的Opus 4.6数字做了对比。第三方评测认为4.7在多数智能体编程任务上领先GPT-5.2,在抽象推理上与Gemini 3 Pro相差几个百分点。绝对百分比只作方向性参考;OpenAI已指出所有前沿模型在SWE-bench Verified上存在训练数据污染。

SWE-bench Verified服务商自报;高于Opus 4.6的80.8%
约83.5%
SWE-bench Pro服务商自报
发布时在Claude家族中领先
Terminal-Bench 2.0服务商自报;高于Opus 4.6的65.4%
约71%
τ2-bench Retail服务商自报的工具调用成绩
约93%
OSWorld(电脑操作)服务商自报;高于Opus 4.6的72.7%
约76%
BrowseComp服务商自报的网页任务成绩
约88%
ARC AGI 2服务商自报;高于Opus 4.6的68.8%
约75%
Humanity's Last Exam(带工具)服务商自报
在Claude家族中领先
GPQA Diamond服务商自报的研究生级科学成绩
约92%
MRCR v2(100万token,8-needle)长上下文记忆
高于4.6的76%
MMMU Pro(多模态)服务商自报
在Claude家族中领先

Claude Opus 4.7价格

服务商标价,按每100万token计。

输入$5.00
输出$25.00
缓存读取$0.50
缓存写入$6.25

Claude Opus 4.7实际用起来怎么样

来自生产环境智能体运行的实际观察。

工具路由

工具调用走错的比例在Claude家族里最低。遇到难处理的边界情况时,和Sonnet 4.6的差距会进一步拉开,比如按条件选工具、参数嵌套很深,以及在长时间推理之后才发出的工具调用。

长上下文记忆

在20万token以上的智能体记录里依然连贯。得益于Anthropic在Opus 4.6引入、又在4.7上继续打磨的上下文衰减改进,100万token窗口的表现远好于前代。服务商自报的100万上下文MRCR v2成绩,相比Opus 4.6的76%有可观提升。

一次改对代码

补丁质量在Claude家族里最强。当智能体要改的代码必须持续编译通过、测试也不能挂,尤其是改动横跨多个文件时,选它最合适。Anthropic的Terminal-Bench 2.0成绩直接反映了这一点。

速度

比Sonnet 4.6慢,比Kimi K2.7 Code明显更慢。Anthropic公布Opus 4.6在max强度下约为每秒41个token,4.7也在差不多的区间。把它留给真正需要额外推理深度的环节,其余的并行交给更轻的档位。

幻觉表现

Opus 4.7延续了Anthropic保守的拒答风格,不确定时倾向于直说,而不是编一个答案。这也是为什么即便Kimi K2.7 Code、DeepSeek V4 Pro这些更便宜的开放权重模型已经在基准测试上追平,生产团队在高风险推理上仍然愿意多付这笔钱。

Claude Opus 4.7最适合的智能体任务

能看出人眼漏掉问题的PR评审

一个pull request改了30个文件时,Opus 4.7能把整组改动都放在工作记忆里,写出的评审会把auth/middleware.ts里的改动和它弄挂的routes/admin.test.ts测试对应起来。新人评审者因此拿到了通常要资深工程师二次复看才能给出的跨文件意见,团队也更少发出那种能过CI、却在生产环境出问题的补丁。

能把整摞材料读完的调研

把200页的合同草案、三份竞争对手提案和上个季度的法律意见一起丢进100万token的上下文窗口,再让Opus标出所有比市场惯例更苛刻的条款,并列出可能的谈判点。小模型超过10万token之后就开始丢掉前面的段落;Opus能一直看住全局,引用时还会指明具体是哪一段。

统筹多工具计划的编排者

让Opus 4.7当那个规划者:把客户的诉求拆成十个步骤,每一步派给Sonnet档或省钱档的子智能体,最后再把结果拼回去。只在规划这一层用Opus、其余全部交给更便宜的档位,成本只是全程跑Opus的一小部分,质量却基本保留。

一次就改对、不白跑CI的代码修改

让Opus 4.7把一个50个文件的代码库从一个ORM迁到另一个、重构一个缠成一团的模块,或者在整个仓库里打上同一个安全补丁。补丁第一次就干净应用的概率高于家族里任何其他模型——服务商自报的Terminal-Bench 2.0反映的是这件事,你的CI账单也会反映这件事。

什么时候不该用Claude Opus 4.7

这几类场景别用Opus 4.7:高频的常规工作,Sonnet 4.6用零头的成本就能达到同样的质量标准;对延迟敏感的聊天回复,Kimi K2.7 Code快得多;批量分类或信息抽取,GPT-5.4 Mini是更便宜的批量选项。

Claude Opus 4.7与其他模型对比

Claude Opus 4.7对比Claude Sonnet 4.6

Sonnet 4.6是Claude家族的主力默认项,多数智能体用它就够。只有当Sonnet在高难度推理、长上下文或一次改对代码上明显不行时,才升级到Opus 4.7——通常是让它当编排者,往下把活派给Sonnet档或省钱档的子智能体。

Claude Opus 4.7对比Claude Opus 4.6

上下文窗口相同(100万token)、服务商定价相同、自适应思考架构也相同。Opus 4.7是更新的一代,在SWE-bench Verified、Terminal-Bench 2.0、ARC AGI 2和OSWorld上都有服务商自报的提升。新建智能体选4.7;只有当某个现有智能体已经针对4.6验证过、而你又需要行为稳定时,才把版本锁在4.6。

结论:你该用Claude Opus 4.7吗?

Opus 4.7是升级档。默认用Sonnet 4.6,只在Sonnet明显不行的那几个具体环节升到Opus。

常见问题

Claude Opus 4.7的上下文窗口有多大?

100万token,每次回复最多输出64K token。整个窗口都按标准费率计费:90万token的请求和9千token的请求,单token价格是一样的。

Claude Opus 4.7能处理图片吗?

可以。Opus 4.7是多模态模型,除了文本和代码还能接收图片输入,所以靠截图驱动的智能体和读文档图像的智能体都能原生跑起来。

什么时候该选Opus 4.7而不是Sonnet 4.6?

三种情况:(a)这个智能体是规划者或编排者,它的判断会一层层传下去;(b)单次运行足够长,Sonnet已经开始漏指令;(c)输出必须一次就能干净用上,比如代码修改和结构化数据。

Opus 4.7支持提示词缓存吗?

支持。缓存输入按0.50美元/100万token计费,缓存部分相当于打了一折。只要你的系统提示词或工具定义在多次调用之间保持不变,就值得用。

替代选择

Claude Opus 4.7在Okou上的可用情况

Claude Opus 4.7已从Okou阵容中移除,因此在聊天和工作流里都无法再选用,也不能用你自己的API密钥接入。GPT 5.6 Luna覆盖同一个省钱档位。