小米近日以MIT许可协议开源发布了MiMo-V2.5和MiMo-V2.5-Pro两款模型,为开发者提供了一个构建AI智能体的低成本新选择,支持编程开发、工作流自动化等长周期任务。
两款模型均支持100万Token的上下文窗口。MiMo-V2.5-Pro专为复杂智能体任务和编程场景设计,而MiMo-V2.5则是原生全模态模型,可同时处理文字、图片、视频和音频内容。
此次发布恰逢智能体AI工作负载对企业AI预算造成新压力之际。这类系统在规划、调用工具、编写代码及错误恢复过程中会消耗大量Token,使得成本管理和部署控制变得尤为关键。
采用MIT许可意味着允许商业部署、持续训练和微调,无需额外授权。Kadence International高级副总裁Tulika Sheel表示,MIT许可使该模型颇具吸引力:"企业可以自由修改、部署和商业化该模型,不受任何限制,这在当前AI领域实属罕见。"
小米在官方博客中表示:"在ClawEval测试中,V2.5-Pro以每条轨迹约7万Token的消耗达到64%的Pass^3成绩,相比Claude Opus 4.6、Gemini 3.1 Pro和GPT-5.4在同等能力水平下减少了约40%至60%的Token消耗。"
两款模型均采用稀疏混合专家架构(MoE)以控制算力成本。拥有3100亿参数的MiMo-V2.5每次请求仅激活150亿参数,而拥有1.02万亿参数的Pro版本则激活420亿参数。小米表示,Pro模型的混合注意力设计可在长上下文任务中将KV缓存存储量缩减近7倍。
在长周期任务测试方面,小米列举了多项成果:MiMo-V2.5-Pro在4.3小时内、经672次工具调用完成了一个Rust语言编写的SysY编译器,全部通过233个隐藏测试;此外,该模型还在11.5小时的自主工作中、历经1868次工具调用,生成了一个长达8192行代码的桌面视频编辑器。
MiMo-V2.5能否在智能体编程和自动化领域被企业开发者广泛采用,并与封闭前沿模型形成竞争,将取决于企业对性能、成本和风险的综合评估。
Omdia首席分析师Lian Jye Su表示:"在评估小米MiMo-V2.5及其衍生版本时,企业开发者应着眼于总拥有成本,即Token效率、每次成功任务的成本,以及免除专有模型许可费用所带来的优势。封闭前沿模型在通用任务和极端边缘场景中或许仍有优势,但开源权重模型在高容量智能体任务中表现更为突出。"
Pareekh Consulting首席执行官Pareekh Jain表示,企业不应将MiMo-V2.5视为Claude或GPT的替代品,而应将其定位为高Token消耗工作负载场景下的高性价比智能体模型。
"关键的基准信号不只是准确率,而是每次成功任务所消耗的Token数量,"Jain说,"前沿模型在复杂编程基准测试中往往能取得更高的成功率,但代价是巨大的推理开销。MiMo-V2.5的设计核心是Token效率,即以明显更少的输入和输出Token实现相当的结果。"
Jain认为,这使得MiMo类模型可成为重复性编程、质量保障、系统迁移、文档整理、测试及自动化等工作场景中的"经济型主力",而封闭前沿模型则依然是最复杂任务的质量标杆。
Gartner高级首席分析师Ashish Banerjee认为,MiMo类模型有望从根本上改变长周期智能体的企业AI经济模型。
"当任务规模扩展到数百万Token时,按量计费的专有API就不再像是一种便利,而更像是一种对迭代效率的额外税负,"Banerjee说,"相比之下,MiMo的MIT许可、开放权重、100万Token上下文窗口以及相对低廉的定价,使得私有云或自托管部署具备了战略层面的可行性。"
不过,Banerjee也指出,这并不意味着企业会放弃专有API。
"企业会继续使用专有API来追求前沿精度和低运维消耗,同时将规模化、可重复的智能体工作流转向开源模型——在那些更看重成本可预测性、数据控制权和定制化能力的场景中尤为如此,"Banerjee说,"简言之,长周期、高容量的智能体AI将演变为混合市场,像MiMo这样的开源模型将打破对纯API的依赖。"
Lian Jye Su补充道,来自中国的模型在受监管的西方机构中可能引发合规顾虑,这将对其采用构成一定挑战。
Q&A
Q1:MiMo-V2.5和MiMo-V2.5-Pro有什么区别?
A:MiMo-V2.5是原生全模态模型,支持文本、图片、视频和音频的混合处理;MiMo-V2.5-Pro则专注于复杂智能体和编程任务,拥有1.02万亿参数,每次请求激活420亿参数,并具备混合注意力设计,可将KV缓存存储量缩减近7倍,更适合企业级高难度工作负载。
Q2:MiMo-V2.5的MIT许可对企业意味着什么?
A:MIT许可允许企业自由修改、部署和商业化模型,无需额外授权,也不存在专有模型的许可费用。这使得企业可以在私有云或自托管环境中部署模型,从而更好地控制成本、数据安全和定制化需求,对于高Token消耗的长周期智能体任务尤其具有经济优势。
Q3:MiMo-V2.5的Token效率表现如何?
A:根据小米官方数据,MiMo-V2.5-Pro在ClawEval测试中每条轨迹仅消耗约7万Token,比Claude Opus 4.6、Gemini 3.1 Pro和GPT-5.4少40%至60%。分析师指出,其核心竞争力在于以更少的Token完成同等质量的任务,适合重复性编程、测试、迁移等高容量工作场景。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。