小米MiMo团队负责人罗福莉直播MiMo-V2.6训练,Pro版耗资89万美元、Flash版39.7万美元,累计超128万美元
本文是 24TopNews 对公开财经信息完成重复合并后的事件分析,不是原始采访或证券推荐。
9月17日凌晨,小米MiMo大模型团队负责人罗福莉在X平台发文表示,目前正在研究强化学习(RL)能走多远。小米旗下最新大模型MiMo-V2.6正处于其强化学习运行的中途,团队在此期间进行三方面扩展:计算资源方面,每步约20亿token,1568个提示乘以16次rollout,完全异步;环境和测试框架方面,采用多任务代理式RL,在一次运行中混合多个测试框架;评估计算方面,采用代理式组内信用分配,带有测试用例和基于量规的奖励。罗福莉透露,相关细节将在未来几周逐步开源。
罗福莉同时分享了MiMo-V2.6的实时训练页面,这是外界首次看到这一代模型强化学习阶段的部分训练状态。页面展示模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化,包含MiMo-V2.6-Pro和MiMo-V2.6-Flash两个版本。
两个版本当前累计训练成本已经超过128万美元。其中,MiMo-V2.6-Pro训练时长为1天19小时,耗费89万美元,平均每小时耗费超2万美元;MiMo-V2.6-Flash训练时长1天14小时,耗费39.7万美元,平均每小时耗费超1万美元。
2026年3月,雷军曾在微博发文称,万亿参数大模型MiMo-V2-Pro在全球大模型综合智能排行榜Artificial Analysis上位列全球第八;按大模型品牌排名,位列全球第五,超过xAI Grok。
罗福莉本科毕业于北京师范大学计算机专业,硕士阶段在北京大学计算语言学深造。硕士毕业后,罗福莉加入阿里巴巴达摩院,担任机器智能实验室研究员,负责开发多语言预训练模型VECO,并推动AliceMind项目的开源工作。2022年,罗福莉加入DeepSeek母公司幻方量化从事深度学习相关工作,后担任DeepSeek的深度学习研究员,参与研发DeepSeek-V2等模型。
2025年11月12日,罗福莉在朋友圈发文称:“智能终将从语言迈向物理世界。我正在Xiaomi MiMo,和一群研究员致力于构建这样的未来,全力奔赴我们心目中的AGI。”这也是罗福莉首次正式宣布自己已经加入小米。