热点资讯

  • Home
  • 小米大模型6天训练烧掉347万美元,罗福莉发声

小米大模型6天训练烧掉347万美元,罗福莉发声

2026-09-22 2869

记者丨雷晨 编辑丨陶力 骆一帆 9月22日,小米发布并开源新一代MiMo大模型,包括全模态旗舰模型MiMo-V2.6-Pro和高效推理模型MiMo-V2.6-Flash,同时上线Pro版本的超高速模式V2.6-Pro-UltraSpeed和MiMo Desktop桌面客户端正式版,后者同步推出会员订阅方案。 第三方测评平台Artificial Analysis综合智能指数显示,MiMo-V2.6-Pro得分为46分,在当前开源权重模型中排名第一,超过了Kimi K3的44分和GLM-5.3的45分,也高于上一代MiMo-V2.5-Pro的26分。该榜单上,GPT-6 Astra和Claude Fable 5.1均为53分。 第三方测评平台Artificial Analysis综合智能指数显示,MiMo-V2.6-Pro得分为46分,在当前开源权重模型中排名第一 同一平台的智能指数单任务成本榜单显示,MiMo-V2.6-Pro单任务成本为0.13美元。小米方面称,同等智能水平下,该模型价格仅为海外模型的二十分之一至六十分之一,API定价沿用V2.5系列。 这次发布五日前,训练过程已经提前公开。9月17日凌晨,小米MiMo大模型团队负责人罗福莉在X平台发文,披露MiMo-V2.6正处于强化学习中间阶段,并上线实时训练页面,公开进度、Token消耗与成本数据。在国内大模型厂商中,将后训练环节以实时页面公开,此前尚无先例。 强化学习训练首度直播,小米六天花了347万美元 据小米方面披露,本轮强化学习的后训练耗时不到六天,Pro版本训练成本约262万美元,Flash版本约85万美元,各完成30步,累计约75万条轨迹。 罗福莉在发文中称,这六天背后,是长达半年的基础研究积累和工程试错。训练中途,公开页面显示的数据是另一个量级。 9月17日下午,两个版本累计成本已超过135万美元,每小时成本约3.1万美元。 成本曲线之外,页面同时披露了训练配置。罗福莉介绍,本次训练从三个方面扩展规模:算力上,采用大Batch与全异步架构,单次更新使用1568个样本,支持百万级上下文长度训练,单步训练Token达2.7B至3.7B;环境与工具上,构建覆盖代码、通用、视觉、安全等方向的多任务训练体系,并混合多个Harness框架运行;评估计算上,通过组内相对比较,为长程任务提供更精准、多样的奖励信号。 罗福莉发文截图 图为小米MiMo大模型团队负责人罗福莉(资料图) 结果显示,训练任务平均通过率分别相对提升25%和12%。在样本外的长程软件工程评测基准DeepSWE v1.1中,Flash版本得分由48.8升至65.68,Pro版本由58.4升至72.57。罗福莉称,MiMo-V2.6可能是目前国产开源模型中投入算力最多的模型之一。 投行测算提供了另一个观察角度。高盛研报称,按avg@3口径,两个版本在DeepSWE基准最高取得67.86分和72.57分,Flash版本提升超过19分,Pro版本提升超过14分。成本折算上,Flash每百万Token约10美元,Pro约35美元,同等支出下Flash的分数增幅更高。该行估计,两个版本的训练分别基于约4000个和8000个H200等效GPU集群。直播过程中出现的中途干预包括基建错误重跑、不良模式数据集、零梯度任务与GPU显存不足。高盛认为,这意味着强化学习的瓶颈已经转向工程优化。 罗福莉在发文中将问题归结为“强化学习究竟能扩展到多远”。她表示,强化学习是模型自我提升路径中可扩展性较强的方向之一。小米将本次发布定义为探索RSI(递归自我改进)路径的关键一步。 开源是本次动作的另一面。除Pro与Flash模型权重及技术报告外,小米同步开放了蒸馏版本MiMo-V2.6-Distill-Qwen-9B及配套强化学习代码,包括7000余个高质量任务环境、端到端训练框架与轻量化Harness。小米方面表示,开放这些资源意在帮助研究者复现和验证相关结果。以该蒸馏模型为起点开展训练,SWE-bench Verified得分由61.1升至66.2,Terminal Bench 2.1得分由37.1升至52.8。 46分登顶开源榜,距全球最强模型仍有差距 46分之外,榜单给出了更完整的坐标。综合智能指数总榜上,排在MiMo-V2.6-Pro之前的是GPT-6 Astra、Claude Opus 5、Fable 5.1和Muse Spark 1.3四款闭源模型,小米是前五名中唯一的开源权重模型。 按小米方面的说法,在多数智能体评测中V2.6-Pro已比肩Claude Opus 5和GPT-5.6 Sol,在综合智能指数上与榜首仍有7分差距。 价格方面,单任务成本指标与榜单捆绑出现,指向的是大模型竞争的旧命题:同等智能水平下的成本下探。本

about image

发表评论