小米发布并开源Xiaomi MiMo-V2.6系列模型

9月22日,小米正式发布并开源Xiaomi MiMo-V2.6系列模型。据介绍,该系列包含Pro和Flash两个原生全模态模型,是小米探索RSI(递归自我改进)路径的阶段性成果。

在评测数据方面,得益于RL算力的扩展,MiMo-V2.6-Pro在Artificial Analysis Intelligence Index(AA综合智能指数)中取得46分。该分数超过Kimi K3和Qwen3.8 Max,成为当前最强开源模型;但对比最强闭源模型Claude Fable 5.1和GPT-6 Astra,仍存在差距。

MiMo-V2.6系列沿用V2.5系列的API定价,智能提升但价格不变。官方数据显示,MiMo-V2.6-Pro在同等智能水平下,价格仅为海外模型的1/20至1/60,刷新了国产模型性价比纪录。

在训练细节上,MiMo-V2.6进行了为期6天的Live RL训练。训练成本方面,Flash与Pro分别约85万与262万美元,各完成30步,累计约75万条轨迹。训练任务平均通过率分别相对提升25%和12%。在样本外长程软件工程评测基准DeepSWE v1.1中,Flash和Pro分别提升约17分(48.8 → 65.68)和约14分(58.4 → 72.57)。

据官方披露,本次训练主要从三个维度扩展RL算力:一是更大的Batch与更高吞吐,结合大Batch和全异步架构,单次更新使用1,568个样本,支持1M上下文长度训练,单步训练Token达2.7~3.7B;二是更多任务与复杂环境,构建覆盖Code、General、Visual、Cyber等方向的多任务训练体系,混合多个Harness;三是更大的Grader算力,通过Group内相对比较为Long-Horizon RL任务提供奖励信号。

在训练稳定性方面,随着训练规模扩大,小米冻结了MoE Router以抑制专家负载漂移,并建立了覆盖奖励设计、对抗性评测、异常检测和验证器交叉校验的Reward Hacking防线。

目前,小米已开源上述技术成果及配套资源,包括完整技术报告、训练环境与RL代码,以供研究者复现和验证相关结果。

c55323987efdf6352099a00da1bf982a.png

本文来自大风号,仅代表大风号自媒体观点。