小米MiMo-V2.6模型评测:代码Agent和安全方向提升显著

[复制链接]
发表于 2026-9-22 12:54:11 来自手机 | 显示全部楼层 |阅读模式
小米自研大模型MiMo刚刚放出了V2.6版本的评测数据,Pro和Flash两个版本同步亮相。从放出的benchmark结果来看,这次升级的幅度相当大,尤其在代码Agent和网络安全方向表现亮眼。

代码Agent:相比上一代提升巨大

在DeepSWE v1.1测试中,MiMo-V2.6 Pro拿到71.9分,而上一代V2.5 Pro只有19.0分,提升幅度接近3.8倍。ProgramBench和MiMo Code Bench也都有明显增长。从横向对比来看,V2.6 Pro已经非常接近Claude Opus 5(74.0)和GPT-5.6 Sol(73.0)的水平。

通用Agent:多任务场景稳步追赶

General Agent部分覆盖了AutomationBench、Toolathlon-Verified、Terminal Bench等多个任务型测试集。MiMo-V2.6 Pro在Toolathlon-Verified上拿到76.9分(Flash 73.6),Terminal Bench 2.1更是达到89.9分,接近Claude Opus 5的89.1分。整体来看,通用任务处理能力和头部模型之间的差距正在缩小。

网络安全:CyberGym突破94分

这次最突出的单项可能是Cybersecurity方向。MiMo-V2.6 Pro在CyberGym上拿到94.0分,Flash版本甚至更高达到95.1分,远超V2.5 Pro的40.0分。MiMo Cyber Bench也有80.2分的成绩。不过ExploitBench和SEC Bench Pro这类更偏向攻防实战的测试上,和Claude Opus 5、GPT-5.6 Sol仍有差距。

Code Arena排行榜:WebDev全球第10

根据Arena.ai的Code Arena: WebDev排行榜,MiMo-V2.6-Pro以1628分位列第10名,在所有模型中约排第10,开源模型中约排第3。排名在它前方的包括GPT-6 Astra(1800分)、Claude Fable 5.1(1758分)、Claude Opus 5(1687分)、Qwen-3.8-0902(1681分)等。和它分数相同的有Claude Fable 5 (High)。

视觉Agent

MiMo Visual Coding测试中,Pro和Flash分别拿到72.3和71.5分,略高于Claude Opus 5的70.0分,和GPT-5.6 Sol(73.4)基本持平。

总结

MiMo-V2.6这次升级的关键词是"大幅追赶"。从数据来看,小米在代码生成、自动化任务、网络安全三个方向下了功夫,和Claude Opus 5、GPT-5.6 Sol等前沿模型的差距已经明显缩小。不过在一些需要深层推理的benchmark上(如Agents' Last Exam)仍有提升空间。

开源模型这个位置已经很有竞争力了,接下来就看实际落地体验和API性价比。
万狸温馨提示:理性消费
1.数码选品:先定用途,再比参数,拒绝 “加点钱更好” 的超支诱惑。
2.购车决策:看平台生命周期,算长期使用成本,刚需比潮流更重要。
3.重点提醒:多查真实评价,少信首发噱头,买得对远比买得新划算。
4.交流准则:聊产品讲实际体验,不抬杠不诋毁品牌,友善分享。
5.氛围维护:遇到分歧先理性沟通,不贴“粉黑”标签,温馨交流。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注QQ群
手机版|小黑屋|万狸社区-免费活跃数码论坛,手机/电脑/汽车+旅游美食游戏兴趣社区

相关侵权、举报、投诉及建议等,请发 E-mail:572109352@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|桂ICP备16003785号

在本版发帖
客服QQ:572109352
QQ客服返回顶部