Xiaomi MiMo-V2-Pro
Xiaomi MiMo-V2-Pro 专为现实世界中高强度的 Agent 工作场景而打造。它拥有超过 1T 的总参数量(42B 激活参数),采用创新的混合注意力架构,并支持 1M 超长上下文长度。在强大的模型基座上,我们在更为广泛的 Agent 场景中持续 Scaling 算力,进一步拓展了智能的动作空间,实现了从 Coding 到 Claw 的重要泛化。
在全球权威大模型综合智能排行榜 Artificial Analysis 上,MiMo-V2-Pro 位列全球第八,国内第二。

在 OpenClaw、Claude Code 等智能体框架中,MiMo-V2-Pro 展现出了优秀的端到端任务完成能力,能够在无人工干预的条件下完成复杂工作流编排、长程规划与精准工具调用,并持续可靠地交付最终结果。整体使用体感已超越 Claude Sonnet 4.6,逼近 Opus 4.6,但模型 API 定价仅为其 1/5,降低了前沿智能的使用门槛。
基座能力的全面跃升
通过 Scaling 参数和算力,MiMo-V2-Pro 拥有了更大、更强的模型基座。
- 万亿参数,高效架构:总参数量突破 1T(激活参数 42B),较前代 MiMo-V2-Flash 扩大约 3 倍。沿用前代 MiMo-V2-Flash 的创新 Hybrid Attention 机制,混合比例从 5:1 进一步提升至 7:1,在参数量大幅增长的同时依然维持了较高推理效率,并支持 1M 超长上下文。轻 量 MTP (Multi Token Prediction) 层实现了高效的生成速度。
- 从 Chat 到 Agent:通过后训练阶段在更广泛的 Agent 任务场景进行 Scaling,模型能力已不再局限于“回答问题”或是“生成精美 Demo”,而是“完成任务”。我们致力于将其深度集成至生产力场景,使其成为驱动系统运转的“大脑”,持续交付具有真实世界影响力的结果。
- 超越榜单的实际体验:在各个衡量模型重要能力的基准测评中,MiMo-V2-Pro 均表现优异,Coding Agent、通用 Agent 和 Tool Use 与 Claude 4.5 Sonnet、GPT5.2、Gemini 3.0 Pro 处于同一梯队,展现了其领先的智能水平。我们坚持以“实际体感”为导向进行训练优化,始终关注模型在应用场景中的落地表现。
为 Agent 而生的旗舰模型
MiMo-V2-Pro 专为 Agent 场景深度优化。
OpenClaw 的原生大脑
OpenClaw 是近期开源社区备受瞩目的通用智能体框架。作为驱动此类框架的核心,底层模型的能力上限直接决定了系统的业务表现。MiMo-V2-Pro 针对复杂多样的 Agent Scaffold 进行 SFT & RL,具备更强的工具调用与多步推理能力。
在 OpenClaw 标准评测榜单 PinchBench、ClawEval 上,MiMo-V2-Pro 效果处于全球顶尖。同时,凭借 1M 的超长上下文窗口,MiMo-V2-Pro 能够从容支撑高强度的真实 Claw 复杂应用流。下图中的 Hunter Alpha 为 MiMo-V2-Pro 的早期匿名版本。
Coding 能力持续进化
不止于 Vibe Coding,MiMo-V2-Pro 能够参与更严肃的代码工程构建。
在小米内部工程师的深度评测中,MiMo-V2-Pro 体感已接近 Claude Opus 4.6,并展现出高阶的代码智能:拥有更出色的系统设计与任务规划能力、更优雅的代码风格,以及更高效直接的问题解决路径。
在 Hunter Alpha 测试阶段,调用量前几的 APP 多为编程专用工具,这印证了 MiMo-V2-Pro 在真实研发场景下的高可用性与高可靠性。
百万上下文,开放 API
MiMo-V2-Pro 模型现已正式开放 API 服务,支持 1M 上下文长度,并根据使用量分段计价:
- 256K 以内:输入 $1 / 百万 tokens,输出 $3 / 百万 tokens
- 256K ~ 1M:输入 $2 / 百万 tokens,输出 $6 / 百万 tokens
Xiaomi MiMo-V2-Omni
MiMo-V2-Omni 专为现实世界中复杂的多模态交互与执行场景而生。我们从底层构建了融合文本、视觉、语音的全模态基座,并以统一架构将“感知”与“行动”深度绑定。这不仅打破了传统模型“重理解、轻执行”的局限,更让模型原生具备了多模态感知、工具调用、函数执行及 GUI 操作能力。MiMo-V2-Omni 可无缝接入各大智能体框架,实现了从理解到操控的跨越,大幅降低了全模态 Agent 的落 地门槛。
感知能力:图像、视频、音频,全面对标前沿
行动的前提是准确的感知。我们在所有感知模态上对比了 MiMo-V2-Omni 与国际领先模型,验证作为智能体的感知能力基础是否牢固。
视觉理解方面,MiMo-V2-Omni 展现出强大的多学科视觉推理与复杂图表分析能力,超越 Claude Opus 4.6,逼近 Gemini 3 等顶尖闭源模型水平。
音频理解方面,支持从环境声分类、多说话人分离、音频-视觉联合推理,到超过 10 小时连续长音频的深度理解。综合表现超越 Gemini 3 Pro,是当前最强的音频理解基座模型之一。
视频理解方面,支持原生音视频联合输入,实现真正的多模态视频理解。通过创新的视频预训练,模型具备强大的情境感知与未来推理能力。
而当多种模态同时输入时,统一架构的优势进一步放大:跨模态信号相互增强,而非相互竞争。
智能体能力:从理解到完成任务
感知是基础,行动是目标。
一个真正的智能体模型,能够跨越多个模态观察复杂环境、制定计划并执行、在出错时自主恢复,最终端到端地交付结果。
全模态智能体任务
在与真实数字环境交互的评测基准上,MiMo-V2-Omni 表现优异,比肩 Gemini 3 Pro。前沿的感知能力与原生训练的行动能力形成了复合优势:感知越准确,行动越有效。

与此同时,MiMo-V2-Omni 在纯文本智能体任务上也保持了高度的竞争力。

能力展示
💻 Browser Use场景
Browser Use 是衡量模型 Agentic 能力的试金石:真实世界交互、网页环境动态变化、交互方式异构、且存在主动的对抗机制。感知、决策、行动的闭环在开放环境中持续运转直至任务完成——同样的能力迁移到智能终端、机器人等场景,就是通用智能体的雏形。
- 替你逛街砍价下单 我们测试了一个端到端购物任务。模型操控浏览器,先在小红书浏览十余篇帖子完成信息搜集与购买建议,再跨平台切到京东多店比价,接着 转接人工客服用自然语言砍价,与客服实时交互,最终完成加购下单。模型自主应对了非标准 DOM 结构、多页签上下文管理、以及平台反自动化检测后的流程恢复。
- TikTok 视频创作发布 我们测试了一个端到端视频发布任务。模型自主设计四组画面并现场合成全部音效,零外部素材依赖;渲染时遇到中文字体报错,自动修复后继续执行;再操控浏览器打开 TikTok 上传页面,分析非标准输入控件完成文案填写,点击发布后继续点赞、评论,回查确认审核通过、视频公开上线。
🗒️ 智能办公场景
通过自然对话,MiMo-V2-Omni 能够直接生成高质量的 Word、结构化 Excel、排版规范的 PDF 与完整的 PPT。这些生成的文档不再是需要大幅修改的草稿,而是贴合实际需求的高质量“准终稿”。
-
2026高考志愿智能填报
我们测试了高考志愿填报任务。模型可以自主发起网络搜索,获取原始信息,调用 skill 处理文件,并输出一份包含详细志愿建议和分级的 Excel 表格文件。
Xiaomi MiMo-V2-TTS
Xiaomi MiMo-V2-TTS 是小米自主研发的语音合成大模型。它基于自研 Audio Tokenizer 和多码本语音-文本联合建模架构,经过上亿小时语音数据的大规模预训练与多维度强化学习,实现了高度可控的多粒度语音风格控制。MiMo-V2-TTS 支持从整体风格定调到局部情绪表达的精准调节,能在同一句话内完成语气转折和情感递变;真实还原人类说话的自然韵律;在唱歌时,也能准确表达音高和节奏,自然且富有表现力。
MiMo-V2-TTS 模型现已可通过 Xiaomi MiMo API 开放平台 (https://platform.xiaomimimo.com) 访问,限时免费。
文本风格控制
灵活自定义文本控制风格
MiMo-V2-TTS 支持任意自然语言风格描述,不局限于预设关键词,模型能理解并执行任意描述性表达。
- 情感控制:开心、悲伤、生气、温柔、兴奋、平静……
- 方言支持:东北话、四川话、河南话、粤语、台湾腔……
- 角色扮演:孙悟空、林黛玉、钢铁侠……
- 自由组合短语 — 真正的自然语言控制:"撒娇 夹子音"、"慵懒 刚睡醒 有点沙哑"、"深情款款 语速慢"、"慷慨激昂"
细粒度声音事件控制
MiMo-V2-TTS 能够在语音中自然地插入和控制各种副语言声音事件,让生成的语音更加真实、生动。
支持的声音事件:笑声、咳嗽、停顿、思考犹豫、叹气等。
深度文本理解
模型能够智能识别文本中的格式信号,将其转化为对应的语音表达,比如语气标点等,无需额外标注。
格式感知 → 语音表达:
- 全大写文本(如 "THIS IS IMPORTANT")→ 自动加重语气强调;
- 连续重复(如 "不不不不不")→ 自动映射为对应的语音节奏和情感。
模型在预训练阶段学习了大量文本-语音对齐数据,能够自动将书面格式信号转化为自然的语音表达。
超越语音:方言·角色·歌声
MiMo-V2-TTS 不止于标准语音生成,还具备丰富的多元表达能力:支持多种方言的自然发音,可进行角色扮演式的风格化演绎,更能实现高质量的歌声合成——让同一个模型既能说、能演、也能唱。
试用
目前模型还是处于免费期,OpenClaw 通过 Openrouter 免费接入 MiMo-V2-Pro/MiMo-V2-Omni,也可以在Cline、Kilo Code、Roo Code 通过配置使用,现在可以在opencode中免费使用
