九游娱乐官方博客

“沉寂了近半年时间,我们一直在专注一个问题:强化学习究竟能拓展到何种边界。”

9月17日凌晨,罗福莉在社交平台X上分享了小米MiMo-V2.6的训练详情,同时发布了两个模型的训练数据实时看板,向公众“直播”MiMo-V2.6-Pro和MiMo-V2.6-Flash的训练步数、Token消耗、任务通过率、评测成绩和累计费用

官方说明指出,数据直接来源于训练日志,且模型仍在继续训练,新系列即将推出。

根据页面设定的费用速率计算,两轮训练合计每小时约为3.08万美元。用户可以看到成绩提升,也能观察到分数回落、训练重启以及GPU显存问题。

Jina AI创始人Han Xiao对公开训练流程的举措表示赞赏,称其“大胆且开放”,并调侃道“应该把这张动图发给CFO”。

01 罗福莉划重点

2025年12月17日,MiMo-V2-Flash上线后,罗福莉撰写了一篇技术说明,详细讨论了混合滑动窗口注意力、多Token预测以及多教师在线策略蒸馏。

她解释,团队选择混合滑动窗口注意力,既考虑了长上下文推理表现,也兼顾了缓存与现有基础设施的适配性。

在谈及多Token预测时,她特别强调了这项技术对高效强化学习的潜力:能加快生成速度,有助于减少小批量训练中长尾样本引发的GPU等待。

当时,罗福莉就指出,受时间限制尚未将这项优化纳入那轮强化学习训练

关于后训练,MiMo-V2-Flash当时采用多教师在线策略蒸馏,将不同领域模型的能力整合为一个统一模型。官方技术资料还介绍了大规模代码Agent训练环境,以及针对MoE训练和推理一致性的优化。

到今年4月,罗福莉将讨论焦点转向了Agent的运行方式与商业成本。

4月6日,在一篇长帖中,罗福莉分析了第三方Harness的资源消耗。她认为,低价值工具调用和反复携带长上下文会推高成本;单纯降低Token售价无法解决用户花钱却仍无法完成任务的问题,因此主张让更节省Token的Harness与更强、更高效的模型共同演进。

这也解释了小米随后在代码工具上的投入。

6月11日,罗福莉宣布开源MiMo Code,并表示模型演进需要可靠的Harness,而Harness也需要模型能力支撑。她同时透露,最初开发由5个人在14天内完成。

从2025年12月到今年9月,按时间线来看,这在一定程度上反映了罗福莉的思路:先提升推理和后训练效率,再改进模型执行任务的框架,随后扩大多任务强化学习

02 算力去哪了?

罗福莉披露,本轮MiMo-V2.6训练扩展了三个方向:计算规模、任务环境与Harness,以及评分器的计算投入

具体包括:每步训练涉及约20亿Token,配置为1568个提示、每个提示16次尝试,采用全异步方式。按此配置,一批包含25088条尝试轨迹。模型需在不同任务环境和执行框架中完成操作,再根据测试用例、评分标准等反馈进行学习。

MiMo-v2.6系列强化学习训练看板

这些设置将训练难点从答案生成扩展至完整的任务过程。

例如,模型修改一段代码后,需要运行测试、读取报错、继续修改。训练系统既要支持这些操作,也要判断修改是否有效。若环境启动失败,算力消耗可能无法换回有效样本;若评分方式存在漏洞,模型获得的高分也可能偏离真实需求。

因此,训练成本包含大量生成、工具执行和结果验证,模型参数更新只是整个过程中的一部分

罗福莉公开的看板中,能看到各种工程问题。

页面展示了环境运行数量、基础设施故障导致的样本损失,以及样本生成到进入训练之间相隔的模型版本数。在异步系统中,任务执行和模型更新并行推进,团队需要监测样本是否已落后于当前模型。

小米还公开过一条故障通知:Pro训练因一个节点的显存问题而重启。这真实反映了训练效率既取决于模型算法,也取决于系统运行的稳定性

X用户elie(@eliebakouch)特别关注看板公开的每批数据与Harness构成,以及大量内部训练指标。他认为这些信息能帮助研究者观察模型在哪些任务上学习、训练资源如何分配。

03 起起落落的跑分

截至北京时间9月17日早间核查时,官方公布的DeepSWE v1.1代码评测结果中,Flash从第1步的48.67升至第12步的60.77;Pro从第1步的58.41升至第10步的63.72。页面标明,评测采用mini-swe-agent,口径为avg@3。

中间存在明显波动。Flash第10步达到60.18,第11步降至54.13,第12步又回升。Pro前几步也多次出现下降。公开数据尚不足以解释每次变化,但已能看出投入与成绩之间并非每一步都同步增长。

网友Zain看到看板后,兴奋地提到训练开始约一天,DeepSWE就达到了60%左右。这类评论反映了开发者对提升速度的关注;后续能否维持增幅,仍需继续观察。

看板首页的训练平均通过率,需要与DeepSWE评测分开看待。官方对avg@n的定义,是计算每道采样任务在多次尝试中的成功比例,再对任务取平均。任务构成、难度和基础设施故障,都可能影响这一数字。

文章和社交平台上若只截取一条上涨曲线,很容易忽略这些条件。更有价值的判断,需要比较相同评测设置下的多个检查点,并等待最终模型在真实任务中的表现。

Pro和Flash同时公开训练,也让产品分工变得可观察。两轮运行采用相同的提示数量与尝试次数配置,页面设定的费用速率相差一倍。Flash的代码成绩已有提升,Pro在已展示的后续检查点上仍有更高分数。由于训练步数不同,现阶段无法直接得出严格的性价比排名。

但这组数据值得持续跟踪:更低成本的模型能覆盖多少复杂任务,更高成本的模型又能在哪些任务上拉开差距?答案将影响用户如何选择模型,也会影响小米如何定价。

04 降价的底层逻辑

罗福莉此前解释过MiMo API降价的逻辑,包括缓存优化、模型架构和推理系统效率。

据透露,滑动窗口注意力的分层KV缓存优化提高了缓存容量;混合注意力架构也降低了部分推理计算开销。

当时,罗福莉曾透露,降价后的生产推理服务接近满负荷运行,仍能基本实现收支平衡。

如果说之前的降价逻辑与技术和系统效率有关,那么这一次直播所反映的问题则是训练投入的回报。

按照小米MiMo官方接口设定的费用速率,每小时30834美元,两轮训练累计展示的费用约115万美元。不过,页面未完整说明硬件折旧、能源、人力等成本。这个数字可用于观察本轮训练的投入尺度,但无法代表完整的研发支出。

实际上,普通用户最终承担的成本还包括推理调用、工具执行、失败重试和人工检查。这意味着训练阶段增加投入,只有在模型交付后提高成功率、缩短任务流程或减少人工接管,才可能转化为商业价值。

不同的产品和入口,不同的场景和用户需求都存在差异。开发者关注调用成本与稳定性,直接使用Agent的人更关心任务能否完成。

罗福莉历次发言反复涉及的推理效率、上下文管理、后训练和Harness,都与这些要求有关。

某种程度上,可以把小米的技术站位概括为:面向Agent任务建设基础模型,并同时优化模型架构、训练系统和运行框架,让能力提升具备可承担的成本

只不过,这条路线对团队提出了双重要求。

模型需在困难任务上继续提高成功率,系统也要减少无效生成、重复调用和资源等待。更强的模型若需过长时间或过多重试,使用价值会受到限制;便宜的服务若无法可靠完成任务,同样难以留住用户。

公开训练看板增加了小米研发过程的透明度,也让这些要求更易被检验。

接下来值得关注的,是相同评测条件下的持续进步、Pro与Flash的能力差距,以及最终API和Agent产品能否把训练收益交付给用户。

每小时3万美元最终换来什么,需要由模型上线后的任务完成质量和成本来回答。对于关注前沿技术的用户,九游娱乐(中国)官网 - 官方娱乐平台下载- JIUYOU GAME提供了深入了解此类技术进展的渠道。本文来自“腾讯科技”,作者:晓静,编辑:徐青阳,36氪经授权发布。

最新文章

数字娱乐行业风控体系研究
如何在七天内掌握CSS核心技巧
学生团队协作解决实际问题

全部分类

  • 数字金融
  • 智能风控
  • 支付系统
  • 娱乐科技
  • 运营管理
  • 财务与会计