全部模型

GPT-5.4:OpenAI推理模型

OpenAI GPT-5系列的主力。和Claude Sonnet 4.6一样处在×1积分基准线上,是多数Codex框架智能体合适的默认选择。

400K tokens · Text / Vision / Code · Prompt cache

Okou已不再运行GPT-5.4。本页作为它的规格、价格和基准测试参考保留。要做同类工作,请用GPT 5.6 Luna。

查看GPT 5.6 Luna

GPT-5.4是OpenAI GPT-5系列的主力——默认铺开来一直跑的那个模型。厂商公布的SWE-bench Verified成绩为74.9%,在编码上与Claude Sonnet 4.6处在同一区间,而它的工具使用准确度,正是多数生产环境Codex框架智能体调校时对标的基准。

GPT-5.4是什么?

2026年4月 · GPT-5系列的主力。多数Codex框架智能体推荐的默认选择。

GPT-5.4是OpenAI GPT-5这一代的主力,2026年4月与旗舰GPT-5.5和成本优化的GPT-5.4 Mini一同发布。OpenAI把它定位为Codex框架上智能体的通用默认值——除非某个环节确实值得升级到5.5,否则每一步都用它。

架构上,GPT-5.4与GPT-5系列其余成员共享40万token的上下文窗口、reasoning_effort参数、提示词缓存和Responses API接口。与GPT-5.5的分野在于每个token投入的算力:5.4更快更便宜,5.5在推理深度上投入更多。与GPT-5.4 Mini的分野正好相反——在真正决定一次智能体运行成败的环节上,5.4的质量更高。

GPT-5.4有什么特别之处

架构与能力上的主要亮点。

GPT-5.4与GPT-5系列其余成员架构相同:40万token上下文窗口,reasoning_effort参数分四档(minimal、low、medium、high),提示词缓存让缓存输入只按输入价的十分之一计费,以及codex CLI默认使用的Responses API接口。支持工具调用、结构化输出和computer-use。输入为文本、视觉和代码的多模态。

规格速览

家族GPT-5系列
模态文本、视觉、代码
语言以英文为主,支持多语言
提示词缓存支持(OpenAI)
上下文窗口40万token
最大输出最高128K token
推理强度Minimal / Low / Medium / High
服务商标价输入$2.5/输出$15,每100万token

GPT-5.4基准测试

分数来自OpenAI GPT-5发布材料,并以上一代OpenAI模型为对照给出差值。独立评测把GPT-5.4放在与Claude Sonnet 4.6相同的编码质量区间。绝对百分比只当作方向性参考。

SWE-bench Verified厂商公布
74.9%
Terminal-Bench 2.0厂商公布的工具使用成绩
约58%
AIME 2025(不用工具)厂商公布的竞赛数学成绩
约92%
GPQA Diamond厂商公布的研究生级科学成绩
约85%
OSWorld(computer use)厂商公布
约62%
速度Artificial Analysis,medium强度
约110 token/秒

GPT-5.4价格

服务商标价,按每100万token计。

输入$2.50
输出$15.00
缓存读取$0.25
缓存写入不计费

GPT-5.4实际用起来怎么样

来自生产环境智能体运行的实际观察。

工具路由

在标准的Codex框架工具目录上,准确度是扎实的基准水平。5.5领先的地方在难的边缘情况(条件式工具选择、深层嵌套参数)——常规情况下5.4路由同样正确,延迟却低得多。

代码修改

在常规重构和修bug的工作负载上,补丁质量与Claude Sonnet 4.6相当。5.5开始拉开差距的地方,是那些要求补丁一次就能干净应用的跨文件改动。

速度

比5.5明显更快——据Artificial Analysis,medium强度下约110 token/秒。这也是5.4在交互式对话回复和短智能体流程这类用户能直接感知延迟的场景里保持默认地位的原因之一。

成本效率

×1积分,输出表现落在Sonnet 4.6那一档的质量区间。对已经在用Codex框架的团队来说,这就是成本与质量的甜点——只在明显需要的环节升级到5.5。

幻觉表现

它继承了OpenAI在GPT-5这一代做的校准改进。比GPT-4系列更少给出自信的错误答案,在超出训练时间范围的问题上尤其明显。

GPT-5.4最适合的智能体任务

Codex框架上默认的智能体环节

如果你的智能体已经建在codex CLI或任何Codex框架集成之上,GPT-5.4就是自然的通用默认值。×1积分,快到足以交互使用,准到足以应付占据大部分运行时间的常规工具调用。

什么时候不该用GPT-5.4

最难的推理、computer-use,以及跨文件代码修改这些5.5明显领先的环节,别用GPT-5.4;高频的批量分类和前置筛选也别用,服务商层面5.4 Mini便宜四倍。

GPT-5.4与其他模型对比

GPT-5.4对比GPT-5.5

同一个系列,定位不同。5.5(×2)给你最强的推理、computer-use和一次成型的代码质量;5.4(×1)用一半的积分成本给你同样的上下文窗口和功能集,速度还明显更快。默认用5.4,只在明显需要的环节升级到5.5。

GPT-5.4对比Claude Sonnet 4.6

两个生态各自的×1基准线。Sonnet 4.6跑在Claude Code框架上,GPT-5.4跑在Codex上。按你现有的智能体和工具定义面向哪个框架来选。纯看输出质量两者足够接近,正确做法是在你自己的工作负载上做A/B测试。

GPT-5.4对比GPT-5.4 Mini

同一个系列,定位不同。5.4(×1)每个token承载的推理质量更高;5.4 Mini(×0.3)给你一个便宜得多的选择,用于批量和前置筛选。扇出式分类交给5.4 Mini,决定一次智能体运行走向的环节交给5.4。

常见问题

GPT-5.4的上下文窗口有多大?

40万token,单次回复最高输出128K token。整个窗口都按标准价计费。

GPT-5.4能处理图片吗?

能。GPT-5.4是多模态的,原生接受图片与文本、代码一起输入。

什么时候该选GPT-5.4而不是Claude Sonnet 4.6?

当你的智能体已经建在Codex框架上,或者你需要OpenAI生态(工具目录、结构化输出、Responses API)的时候。两者都在×1积分档,成本一样,选择取决于框架契合度和实际表现。

GPT-5.4支持提示词缓存吗?

支持。缓存输入按每100万token $0.25计费——缓存的那部分成本降到十分之一。

替代选择

GPT-5.4在Okou上的可用情况

GPT-5.4已从Okou阵容中移除,因此在聊天和工作流里都无法再选用,也不能用你自己的API密钥接入。GPT 5.6 Luna覆盖同一个省钱档位。