小米直播模型训练,成本每秒超10美元

9108

小米公司最近通过直播的方式展示了两个模型的训练过程,费用高达每秒10美元。这不是一场典型的发布会演示,而是实时监控的训练直播,屏幕上显示的是即时的训练指标而非总结。两个同时培训的模型为mimo-v2.6-pro和mimo-v2.6-flash,后者进行的训练已经进入后期阶段,并采用DeepSWE作为测试集,表明重点在于提升智能体的能力,将训练聚焦于更复杂的任务。

目前,mimo-v2.6-pro在DeepSWE上的得分为62,相较于 DeepSeek-v4.1-flash的74.2,显示出仍处于早期训练阶段,尚未达到收敛。观察到的核心数据是每秒耗费10美元,这一数字背后有一系列推算指标支撑。

在阶段10的训练中,生成/推理耗时为58分钟,成功生成了22亿token,换算下来大约每秒生成63万token。此外,阶段10的平均上下文长度达到89K,导致吞吐量显著减低。根据H100的性能估算,所需的GPU卡片数量相当可观,其中pro模型大约需要4000-5000张,而flash模型约需2000-2500张,总量预估在6000-8000张左右。 球友会

数据中还表明,生成和反向传播的计算耗时分别为58分钟和64分钟,说明推理和反向传播共用同一硬件资源。这意味着,在完成22.2亿token的生成和环境评分后,GPU立即转为进行反向传播和更新。

about image

同时训练的环境数据表明,Pro模型在运行时有23,180个活跃沙箱,而Flash模型则有37,786个,合计超过6万个沙箱并行执行,这解释了为何成本如此高昂。Agent式强化学习需要模型在真实环境中进行不断试错和反馈获取,每一步都是计算资源的消耗。尽管当前成绩与顶尖模型存在差距,但公开直播训练过程及其相关耗费和指标推算的做法在行业内较为少见,后续还将提供更多分析数据。

尽量避免不必要的冲突,保持冷静,并在有需要时寻求裁判的帮助。...

尽量避免不必要的冲突,保持冷静,并在有需要时寻求裁判的帮助。...