资讯动态

小米直播AI模型训练过程,燃烧资金惊人


每秒耗费超10美元,小米近日将两个模型的训练过程进行了现场直播,这不仅仅是一次例行的发布会,而是实时的后训练状态展示。屏幕上实时滚动着训练的指标,而不是事后的分析总结。更引人关注的是,直播中同时训练的是两个模型:mimo-v2.6-pro和mimo-v2.6-flash。从画面上看,训练已进入后期阶段,标注中显示为RL。用于评估训练效果的测试集是DeepSWE,这一选择揭示了其关注点,即训练Agent的能力,而非仅仅是对话或问答。

目前,mimo-v2.6-pro在DeepSWE测试集上的得分为62。作为一项对比,顶尖模型DeepSeek-v4.1-flash的分数为74.2。这一训练周期的分数和时间显示,模型仍处于早期训练阶段,距离最终收敛还有一段距离。但真正让观众关注的,是那令人咋舌的耗费速度:每秒至少10美元。这个数字不是信口开河,直播中有一系列可供推算的具体数据。

针对阶段10的数据,生成和推理的耗时为58分钟,在此阶段生成了22亿个token。经过简易计算,平均每秒生成约63万个token。再观察上下文长度,阶段10的平均上下文长度为89K,较长的上下文显著降低了吞吐率。按照H100的估算,单个GPU的吞吐量在100至150 tps左右,mimo-v2.6-pro用于解码大约需要4000到5000张H100,而flash模型估算需要2000到2500张H100,预计总卡量在6000到8000张之间。

另一个细节支持了上述推算。生成和推理耗时58分钟,反向传播计算耗时为64分钟,两者相加正好约等于每步的总耗时126分钟。这表明推理和反向传播使用的是同一组GPU。集群首先用58分钟进行全力的Rollout推理,待22.2亿token生成和环境评分完成后,这些GPU立刻转为分布式长序列的反向传播和梯度更新。

在训练的环境数据中,活跃沙箱的数量尤为显著。直播画面显示,mimo-v2.6-pro维持着23,180个活跃沙箱,而mimo-v2.6-flash则维持着37,786个。两者加起来,同时有超过60,000个真实的Linux/Docker沙箱在并发地运行代码和终端命令。这种规模足以解释每秒10美元的烧钱速度。Agent的强化学习并非仅仅让模型答题,而是在真实环境中执行任务、试错并获取反馈,每一个步骤都消耗计算能力。60,000个沙箱的同时运行,背后是强大的计算资源支持。

从直播提供的信息来看,此次训练仍处于早期发展阶段,当前得分和顶尖模型之间差距显著。然而,将这一训练过程公开直播,并允许观众根据指标推算卡量和成本,这在模型厂商中是相对少见的。直播过程中也留下了“稍后将给予大家更详细的解读”这一一语,进一步引发期待。