开源模型又到了换“卷王”的时候。小米这次发布 MiMo-V2.6 的方式相当少见:后训练全程直播,训练步数、评测曲线、烧掉的费用全部实时挂在网页上,两天烧掉 200 万美元,最终 Flash 和 Pro 两个模型合计花了 347 万美元。这可能是开源模型团队按算力算最大规模的单次强化学习训练之一。

先看成绩单
在 Artificial Analysis 的智能指数榜上,MiMo-V2.6-Pro 以 46 分直接冲到开源模型第一,落在“能力更高、成本更低”的最划算区间,单任务成本约 0.13 美元。真实软件工程基准 DeepSWE v1.1 上,Pro 从 58.4 涨到 72.6,Flash 从 48.8 涨到 65.7——基座没换,全靠后训练提分,连 RL 代码、训练环境和技术报告都一并开源了。
五项真实任务的实际表现
跑分是入场券,实际用起来如何才是关键。在官方客户端 MiMo Desktop 里,用五项多轮迭代的真实任务做了实测:
3D 建模:用 three.js 程序化建模太和殿,它会主动查资料核对脊兽数量,发现不同来源把骑凤仙人算没算进去的差异,第二轮加上三层台基与铜龟铜鹤后,三角面数涨到 5.4 万。
前端审美:给一家高端极地旅行社做官网,三个版本分别走了包豪斯、原研哉式留白和电影感全屏路线,没有一版带“一眼 AI”的模板味。
真实代码任务:把一个开源仓库里挂了半个月的 bug 丢给它,读代码、定位、修复,五分钟收工,再用仓库里 15 份真实文件做改前改后对比验证。
办公数据处理:把直播页两个模型的逐节数据扒下来整理成 CSV 再做成数据页,还主动列出 6 处与官方报告不一致的数字并逐个修正。
长程研究与幻觉控制:研究一个发布仅七天、任何模型训练数据里都不可能有的新模型,三条联网路径全断的情况下,它转而操控真实浏览器完成了四十多次检索,交出十八页研报;核查表 18 条官方事实命中 14 条,五类编造点零命中。
账单才是惊喜
五项任务 18 轮共 171 分钟,输入 token 的缓存命中率高达 95.7%。缓存命中的单价远低于未命中,这意味着实际花费比标价更能打——五个复杂任务总共只花了约九块钱,一杯奶茶的价格。
结论很直接:如果你的常用 API 还停在上一代开源模型上,MiMo-V2.6-Pro 和 Flash 值得现在就替换上去,尤其是高频调用、对成本敏感的场景。
文章标题:小米 MiMo-V2.6 实测:五项真实任务跑完,开源性价比又卷出新高度
文章链接:https://www.muooy.cn/15554.html
更新时间:2026年09月23日
1.本站大部分内容均收集于网络!若内容若侵犯到您的权益,请发送邮件至:305582964@qq.com,我们将第一时间处理!2.资源所需价格并非资源售卖价格,是收集、整理、编辑详情以及本站运营的适当补贴,并且本站不提供任何免费技术支持。
3.所有资源仅限于参考和学习,版权归原作者所有,更多请阅读用户协议和免责声明。

