全部模型

MiMo-V2.5:Xiaomi的多模态模型

1M tokens · Text / Vision / Audio / Video / Code · Prompt cache

Okou已不再运行MiMo-V2.5。本页作为它的规格、价格和基准测试参考保留。要做同类工作,请用GPT 5.6 Luna。

查看GPT 5.6 Luna

适合对成本敏感、又需要同时看混合媒体和文本或代码的智能体。它不像Moonshot那样是专门的代码路由,也不像GLM那样是Z.AI直连路由,所以当工具调用质量是主要约束时,留着Sonnet或Kimi备用。

MiMo-V2.5是什么?

2026年6月

这个模型把100万token的上下文窗口与文本、图像、音频、视频输入支持结合在一起。当智能体要在普通文本之外还读大量媒体素材时,它是务实的低成本选择。

规格速览

系列Xiaomi MiMo
模态文本、图像、音频、视频、代码
语言多语言
上下文窗口最高100万token
提示词缓存支持缓存读取

MiMo-V2.5价格

服务商标价,按每100万token计。

输入$0.14
输出$0.28
缓存读取$0.003
缓存写入不计费

MiMo-V2.5实际用起来怎么样

来自生产环境智能体运行的实际观察。

多模态覆盖

要在一个智能体步骤里同时处理文本、图像、音频和视频输入,MiMo-V2.5是低成本的那条路。

大上下文

100万token的上下文窗口给智能体留够了空间,长文档、文字记录和配套文件都装得下,不用激进地切块。

MiMo-V2.5最适合的智能体任务

混合媒体的研究轮次

当智能体需要把截图、视频片段、文字记录和笔记放在一起看完,再输出一份结构化简报时,用MiMo-V2.5。

大上下文文档审阅

把带图片或媒体引用的长篇原始材料装进去,让它给出跨文档的发现,不必一上来就换高端模型。

什么时候不该用MiMo-V2.5

需要最强的Claude式工具调用,或者工作流只处理文本、用更便宜的专用模型就够了,这两种情况别用MiMo-V2.5。

MiMo-V2.5与其他模型对比

MiMo-V2.5对比Kimi K2.7 Code

Kimi是Moonshot那条更强的代码路由。当更广的多模态输入和更大的100万上下文更重要时,MiMo-V2.5胜出。

MiMo-V2.5对比Claude Sonnet 4.6

工具调用和硬骨头推理上,Sonnet仍是更稳妥的高端默认项。MiMo-V2.5是成本更低的多模态探索路线。

MiMo-V2.5对比Hy3 Preview

Hy3 Preview更便宜,只支持文本,上下文256K。需要图像、音频、视频或100万窗口时,MiMo-V2.5更合适。

MiMo-V2.5在Okou上的可用情况

MiMo-V2.5已从Okou阵容中移除,因此在聊天和工作流里都无法再选用,也不能用你自己的API密钥接入。GPT 5.6 Luna覆盖同一个省钱档位。