在DeepSWE v1.1测试中,MiMo-V2.6 Pro拿到71.9分,而上一代V2.5 Pro只有19.0分,提升幅度接近3.8倍。ProgramBench和MiMo Code Bench也都有明显增长。从横向对比来看,V2.6 Pro已经非常接近Claude Opus 5(74.0)和GPT-5.6 Sol(73.0)的水平。
通用Agent:多任务场景稳步追赶
General Agent部分覆盖了AutomationBench、Toolathlon-Verified、Terminal Bench等多个任务型测试集。MiMo-V2.6 Pro在Toolathlon-Verified上拿到76.9分(Flash 73.6),Terminal Bench 2.1更是达到89.9分,接近Claude Opus 5的89.1分。整体来看,通用任务处理能力和头部模型之间的差距正在缩小。
网络安全:CyberGym突破94分
这次最突出的单项可能是Cybersecurity方向。MiMo-V2.6 Pro在CyberGym上拿到94.0分,Flash版本甚至更高达到95.1分,远超V2.5 Pro的40.0分。MiMo Cyber Bench也有80.2分的成绩。不过ExploitBench和SEC Bench Pro这类更偏向攻防实战的测试上,和Claude Opus 5、GPT-5.6 Sol仍有差距。