【CNMO科技消息】小米正式发布并开源Xiaomi MiMo-V2.6系列。这是小米探索RSI(递归自我改进)路径的关键一步:以可验证的复杂任务为基础,规模化扩展强化学习(RL)算力,让模型在持续的探索与反馈中不断拓展智能边界。MiMo-V2.6系列包含Pro和Flash两个原生全模态模型。

Xiaomi MiMo-V2.6
得益于RL算力的扩展,MiMo-V2.6-Pro在Artificial Analysis Intelligence Index(AA综合智能指数)中取得46分,超过Kimi K3和Qwen3.8 Max,成为当前最强的开源模型;但与最强的闭源模型Claude Fable 5.1和GPT-6 Astra相比,仍有差距。

MiMo-V2.6系列沿用V2.5系列的API定价。智能提升,价格不变,“智能-成本”的帕累托前沿由此再度向外推进。MiMo-V2.6-Pro刷新了国产模型的性价比纪录:在同等智能水平下,价格仅为海外模型的1/20至1/60。
大规模扩展RL并全面开源
在RL训练阶段,MiMo-V2.6可能是目前国产开源模型中投入算力最多的模型之一。经过大规模、多任务强化学习训练,MiMo-V2.6-Pro在多数Agent Benchmark上取得了比肩Claude Opus5和GPT-5.6 Sol的效果,MiMo-V2.6-Flash则全面超越MiMo-V2.5-Pro。

历时不到6天,MiMo-V2.6-Flash与MiMo-V2.6-Pro训练成本分别约85万与262万美元,各完成30步,累计约75万条轨迹;训练任务平均通过率分别相对提升25%和12%,样本外的长程软件工程评测基准DeepSWE v1.1分别提升约17分(48.8 → 65.68)和约14分(58.4 → 72.57),体现出RL较高的样本效率、持续改进能力和样本外的泛化能力。

本次训练主要从三个维度扩展RL算力:更大的Batch与更高吞吐,结合大Batch和全异步架构,单次更新使用1,568个样本,支持1M上下文长度训练,单步训练Token达2.7至3.7B;更多任务与复杂环境,构建覆盖Code、General、Visual、Cyber等方向的多任务训练体系,并混合多个Harness;更大的Grader算力,通过Group内相对比较,为Long-Horizon RL任务提供更精准、多样的奖励信号,形成模型自我改进闭环。
随着训练规模扩大,小米冻结MoE Router以抑制专家负载漂移,并建立覆盖奖励设计、对抗性评测、异常检测和验证器交叉校验的Reward Hacking防线。为支撑大规模混合任务的智能体强化学习,团队设计了统一的轨迹表示与惩罚机制,支撑多种智能体框架的高并发交互,解耦控制面与数据面以支持海量轨迹的迁移,在混合批次中稳定各任务的样本配比,并优化训练与推理引擎的效率及一致性。小米已开源上述技术成果及配套资源,包括完整技术报告、训练环境与RL代码。
从Vibe Coding到Vibe World
MiMo-V2.6融合了3D空间推理、多模态感知与计算机操作(CUA)能力,进一步拓展了编程所能触及的边界,可将自然语言驱动的编程任务拓展为面向交互世界构建的“Vibe World”。
在3D开放世界游戏中,用户输入图片、视频或文字后,MiMo-V2.6会将需求拆解为多个任务,由多智能体协作完成游戏3D场景搭建、交互逻辑编写与视觉验证,并根据渲染结果不断修正,最终生成符合用户意图的可运行交互世界。在Blender 3D建模中,MiMo-V2.6能够根据用户的文字描述或参考图片,在Blender中完成物体与场景的三维建模,生成可用于动画制作、3D打印与游戏开发的3D资产。在具身智能方面,MiMo-V2.6在具身仿真环境中可直接以多视角相机画面为输入,持续进行推理与决策,并通过视觉反馈闭环控制Franka Panda机械臂,完成物体抓取、颜色匹配与精准放置。在Computer Use Agent方面,MiMo-V2.6将多模态感知与原生训练的行动能力相结合,可理解复杂图形界面,使用常见办公与生产力工具,完成信息检索、编辑和数据处理等任务,并根据视觉反馈检查结果、排查问题、调整后续行动。
推动前沿科学研究
未经针对科研任务的专项强化学习训练,MiMo-V2.6已在多个研究领域展现出应用潜力。在材料科研方面,MiMo-V2.6-Pro协助研究人员完成材料设计与计算筛选,提出了数种金属有机框架(MOF)材料的设计方案,目标是吸附被称为“永久性污染物”的全氟和多氟烷基物质(PFAS),并调用开源计算工具开展“干实验”,计算设计出的MOF材料与PFAS之间的结合强度,筛选出最有潜力的候选材料。在形式化数学证明方面,MiMo-V2.6-Pro协助研究员在Lean 4中完成了Li–Yorke经典论文《周期三蕴含混沌》原始主定理的完整形式化,项目最终形成6000余行Lean源码,完整证明通过Lean内核核验,无未完成证明占位。
代码驱动的内容创作与审美表现
MiMo-V2.6系列大幅提升了模型创建精美数字产品的能力,涵盖前端网页、Figma设计稿、幻灯片、SVG、视频、音乐等。在设计评测榜单Design Arena上,MiMo-V2.6-Pro取得了与Claude Opus 5、GPT-5.6 Sol相近的水平。MiMo-V2.6可将简单指令转化为完整的前端界面和PPT,熟练运用Figma和图像/视频生成工具;在视频创作中,能端到端完成视觉设计、镜头与动效编排、配乐合成及节奏卡点,并调用MiMo-V2.5-TTS合成旁白;在音乐创作中,MiMo-V2.6-Pro根据要求创作了一首包含约十种乐器的管弦乐作品,完成乐谱生成后自主将其转换为MIDI。
全面开源与使用方式
小米全面开源MiMo-V2.6-Pro、Flash模型权重与技术报告,同步开放MiMo-V2.6-Distill-Qwen-9B及配套RL研究资源。开源内容包括:7k+高质量RL任务环境,覆盖软件工程、漏洞复现、知识型工作、网页设计开发四类智能体任务;端到端RL训练框架,基于verl、uni-agent和mini-swe-agent;轻量可组合的Harness,开源极简mini-harnesses。
使用方面,MiMo Desktop桌面客户端及会员订阅方案同步上线,MiMo-V2.6系列已上线Xiaomi MiMo开放平台,API价格维持不变。MiMo-V2.6-Pro于开放平台提供UltraSpeed超高速模式可选,提供最高20倍的输出速度。
本文来自大风号,仅代表大风号自媒体观点。