MiMo-V2-Flash 开源
· 阅读需 3 分钟
MiMo-V2-Flash 正式开源!这是一个专为极致推理效率自研的总参数 309B(激活 15B)的 MoE 模型,通过 Hybrid 注意力架构创新及多层 MTP 推理加速,在多个 Agent 测评基准上保持进入全球开源模型 Top 2;代码能力超过所有开源模型,比肩标杆闭源模型 Claude 4.5 Sonnet,但推理成本仅为其 2.5%,生成速度提升 2 倍,成功将大模型推理效率推向极致。

秉持开放精神,模型权重和推理代码均采用 MIT 协议全面开源。API 限时免费。
推理成本与速度的极致优化
MiMo-V2-Flash 的 API 定价为: 输入 $0.1/M tokens,输出 $0.3/M tokens。
下图横轴为全球顶尖模型速度和成本的对比图,MiMo-V2-Flash 实现了最低成本、最高速度。

面向高效推理的结构创新
结构要点如下:
- 混合注意力:采用 1:5 的 Global Attention 与 Sliding Window Attention (SWA) 混合结构,128 窗口大小,原生 32K 外扩 256K 训练。经前期大量实证发现,SWA 简单、高效、易用,展现了比主流 Linear Attention 综合更佳的通用、长文和推理能力,并提供了固定大小的 KV Cache 从而极易适配现有训练和推理 Infra 框架。

- MTP推理加速:通过引入 MTP (Multi-Token Prediction) 训练提升基座能力的同时,并在推理阶段通过并行验证 MTP Token,打破了传统 Decoding 在大 Batch 下的显存带宽瓶颈,实测在 3 层 MTP 情况下可实现 2.5~3.7 的实际加速比。

免费白嫖
目前API限时免费开放中,进入MIMO开放平台申请API KEY。
API调用
python调用
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("MIMO_API_KEY"),
base_url="https://api.xiaomimimo.com/v1"
)
completion = client.chat.completions.create(
model="mimo-v2-flash",
messages=[
{
"role": "user",
"content": "please introduce yourself"
}
],
max_completion_tokens=1024,
temperature=0.8,
top_p=0.95,
stream=False,
stop=None,
frequency_penalty=0,
presence_penalty=0,
extra_body={
"thinking": {"type": "disabled"}
}
)
print(completion.model_dump_json())
curl调用
curl --location --request POST 'https://api.xiaomimimo.com/v1/chat/completions' \
--header "api-key: $MIMO_API_KEY" \
--header "Content-Type: application/json" \
--data-raw '{
"model": "mimo-v2-flash",
"messages": [
{
"role": "user",
"content": "please introduce yourself"
}
],
"max_completion_tokens": 1024,
"temperature": 0.8,
"top_p": 0.95,
"stream": false,
"stop": null,
"frequency_penalty": 0,
"presence_penalty": 0,
"thinking": {
"type": "disabled"
}
}'
Cline集成
MiMo-V2-Flash 具备良好的代码理解与编程能力,适用于代码助手、Agent 工具等多种场景。可参考以下步骤,在 Cline、Kilo Code 和 Roo Code 中体验模型代码能力。
请按照以下配置填写相关信息:
- 必填配置:
- API Provider:选择
OpenAI Compatible - Base URL:填写
https://api.xiaomimimo.com/v1 - API Key:从中 控制台-API Keys 获取 API Key
- Model ID:填写模型名称
mimo-v2-flash
- API Provider:选择
- 选填配置:
- 取消勾选 Supports Images
- Context Window Size 设置为
262144 - Temperature 设置为
0.8,可根据任务需求进行调整
配置成功后,可在输入框中输入需求,例如生成代码:
