Marvis
不只是聊天机器人,而是真正能"干活"的 OS 级 AI 助手。
让它帮你管理文件、操控应用、整理桌面、处理文档——你只需要用自然语言下指令。
引言
AI 工具的爆发式增长带来了无数"聊天机器人",但它们的边界止于对话框——能回答你的问题,却碰不到你电脑里的文件、打不开你的应用、管不了你的桌面。
Marvis 打破了这条边界。它深度集成在操作系统中,像一位坐在你身边的数字同事:懂你的文件体系、熟悉你的应用生态、理解你的工作流程。它不是"告诉我怎么做",而是"我来帮你做"。
不只是聊天机器人,而是真正能"干活"的 OS 级 AI 助手。
让它帮你管理文件、操控应用、整理桌面、处理文档——你只需要用自然语言下指令。
AI 工具的爆发式增长带来了无数"聊天机器人",但它们的边界止于对话框——能回答你的问题,却碰不到你电脑里的文件、打不开你的应用、管不了你的桌面。
Marvis 打破了这条边界。它深度集成在操作系统中,像一位坐在你身边的数字同事:懂你的文件体系、熟悉你的应用生态、理解你的工作流程。它不是"告诉我怎么做",而是"我来帮你做"。
Agent World(当前最主流的是字节跳动扣子 Coze 于 2026 年 4 月 7 日随 Coze 2.5 正式推出的 Coze Agent World)是一个为 AI 智能体(AI Agent)打造的平行数字世界 / 平行网络(The Parallel Web),让 AI 拥有独立身份、记忆、工具和社交关系,能持续自主生活、工作、学习、社交,定位为 AI Agent 的「社会基础设施」与「数字生态系统」。
访问入口:world.coze.site
Hermes Agent 是由 Nous Research(开发了 Nous-Hermes 系列模型的知名 AI 研究团队)于 2026 年 2 月底正式发布的开源 AI Agent 框架,采用 MIT 许可证,GitHub Star 数已突破 4.8 万,是近期增长最快的开源 Agent 项目之一。官方定位为 "会自我进化的 AI Agent"(The self-improving AI agent),核心设计围绕闭环学习机制展开 —— 完成任务后自动提取经验、生成可复用的 Skill 文档,并在后续任务中持续精炼这些 Skills,实现 "越用越聪明" 的效果,而非每次对话从零开始GitHub。
与传统 Agent 框架不同,Hermes Agent 的核心出发点是:Skills 应该由 Agent 自己从经验中生成,并在使用中持续精炼,而非人工维护的 prompt 模板库。
2026年3月31日,Anthropic 官方 AI 编程 CLI 工具 Claude Code 的完整源代码被意外泄露。安全研究员 Chaofan Shou (@Fried_rice) 在 X (Twitter) 上公开披露了这一发现:
"Claude code source code has been leaked via a map file in their npm registry!"
这是继 OpenAI 系统提示词泄露后,AI 行业又一重大安全事件。
Xiaomi MiMo-V2-Pro 专为现实世界中高强度的 Agent 工作场景而打造。它拥有超过 1T 的总参数量(42B 激活参数),采用创新的混合注意力架构,并支持 1M 超长上下文长度。在强大的模型基座上,我们在更为广泛的 Agent 场景中持续 Scaling 算力,进一步拓展了智能的动作空间,实现了从 Coding 到 Claw 的重要泛化。
在全球权威大模型综合智能排行榜 Artificial Analysis 上,MiMo-V2-Pro 位列全球第八,国内第二。

在 OpenClaw、Claude Code 等智能体框架中,MiMo-V2-Pro 展现出了优秀的端到端任务完成能力,能够在无人工干预的条件下完成复杂工作流编排、长程规划与精准工具调用,并持续可靠地交付最终结果。整体使用体感已超越 Claude Sonnet 4.6,逼近 Opus 4.6,但模型 API 定价仅为其 1/5,降低了前沿智能的使用门槛。
随着人工智能技术的快速发展,多模态大语言模型(MLLMs)已成为 AI 领域的核心研究方向。在这一领域中,MiniCPM-V 系列作为面壁智能与清华大学自然语言处理实验室联合推出的端侧导向多模态模型,凭借其在低参数量下实现高性能的独特优势,正在重新定义边缘设备 AI 的可能性边界。与此同时,InternVL和Qwen-VL作为分别由上海人工智能实验室和阿里云推出的主流多模态模型,也在各自的技术路线上取得了显著进展。
当前,边缘计算和隐私保护需求的增长,使得在资源受限设备上部署高性能多模态 AI 成为行业迫切需求。MiniCPM-V 系列通过创新的架构设计和优化策略,在保持 8B 参数规模的同时,实现了与大参数量模型相当甚至更优的性能表现。本研究旨在通过深入分析 MiniCPM-V 的技术架构、性能表现、部署方案以及与 InternVL、Qwen-VL 的全面对比,为多模态 AI 模型的选型和部署提供科学依据。
GGUF 是 "GPT-Generated Unified Format" 的缩写,是一种专为大语言模型 (LLM) 设计的二进制文件存储格式,由 llama.cpp 创始人 Georgi Gerganov 于 2023 年 8 月 21 日正式推出,作为 GGML 格式的继任者。
GGUF 是专门为本地推理优化的模型格式,特别是针对CPU 和低显存 GPU 环境。它将模型运行所需的所有信息打包在一个文件中,包括:
在 GGUF 出现前,AI 模型存储面临三大问题:
| 问题 | 具体表现 | GGUF 解决方案 |
|---|---|---|
| 兼容性差 | 不同框架 / 量化方法的模型无法互通 | 统一格式标准,一处下载多端运行 |
| 体积庞大 | 原始 PyTorch 模型动辄数十 GB,普通设备无法加载 | 原生支持量化,大幅减小体积 (7B 模型可从 13GB→4GB) |
| 元数据缺失 | 模型缺少架构、分词器等关键信息,需手动配置 | 完整元数据嵌入,开箱即用 |
GGUF 采用三层架构设计:
这种设计类似 "模型 = 配置 + 权重" 的打包形式,但更轻量、更专注推理。
GGUF 是量化模型的理想载体,支持多种量化方案:
| 量化类型 | 精度 | 适用场景 |
|---|---|---|
| Q2_K/Q3_K | 2-3 位 | 极致压缩,适合极低资源设备,精度损失较大 |
| Q4_0/Q4_K | 4 位 | 平衡压缩与精度, 最广泛使用的量化方案 |
| Q5_K_M | 5 位 | 高精度需求场景,文件略大但性能接近 FP16 |
| Q8_0 | 8 位 | 接近 FP16 精度,几乎无精度损失但压缩率较低 |
关键优势:每个张量可独立选择量化类型,支持混合量化 (不同层使用不同精度),最大化性能与精度平衡。
以qwen2-7b-instruct.Q4_K_M.gguf为例:
量化后缀是 GGUF 文件名的重要组成部分,它直接告诉用户模型的压缩程度和推理性能。
| 特性 | GGML (旧格式) | GGUF (新格式) |
|---|---|---|
| 元数据支持 | 有限,需额外配置文件 | 完整,直接嵌入文件 |
| 版本兼容性 | 较差,升级后旧模型常无法加载 | 稳定,支持向后兼容 |
| 扩展性 | 受限,难以适应新量化方法 | 灵活,可添加新功能不破坏兼容性 |
| 当前状态 | 已被 llama.cpp 官方弃用 | 活跃开发中,成为事实标准 |
总结:GGUF 是大模型走向大众化的关键一步,正如 MP3 让音乐普及一样,它让 "人人都能在自己电脑上跑大模型" 成为现实。
使用非常简单:
# 使用llama.cpp推理
./main -m model.Q4_K_M.gguf -p "你好,GGUF!"
# 使用Python库
from llama_cpp import Llama
llm = Llama(model_path="model.Q4_K_M.gguf")
output = llm("写一首关于GGUF的诗")
GGUF 文件已包含所有必要信息,无需额外配置即可使用。
除了GGUF格式以外,还有以下常用格式,主要区别:
| 标识 | 类型 | 全称 / 核心含义 | 核心特点 | 典型用途 |
|---|---|---|---|---|
| int4 | 量化精度 | 4 位整数(INT4)量化 | 权重从 FP16/BF16 转为 4 位整数,压缩比约 3.5–4×,精度 96%–98%,内存 / 显存占用极低 | 边缘设备、消费级 GPU、低显存场景 |
| AWQ | 量化算法 | Activation-aware Weight Quantization | 激活感知权重量化,识别关键权重通道并保护,减少 INT4 量化精度损失,接近无损 | GPU 高效推理,兼容 vLLM/CTranslate2 |
| GGUF | 文件格式 | GPT-Generated Unified Format | 替代 GGML,单文件含权重 + 元数据 + 分词器,适配 llama.cpp,支持 Q4_K_M 等量化,CPU/GPU 混合推理友好 | 本地部署、llama.cpp/Ollama 生态,单文件分发 |
| Instruct | 模型用 途 | 指令跟随微调 | 经指令数据集微调,理解并执行用户指令,对话 / 任务完成能力强 | 聊天机器人、问答、文本生成等交互场景 |
int4:极致压缩的 4 位整数量化
量化是将浮点权重转为低精度整数,int4 用 4 位存储权重,大幅减少存储与计算开销。
优点:极致压缩,适合低显存设备;缺点:长文本易掉精度,需配合 AWQ/GPTQ 等算法弥补。
常见组合:int4+AWQ(精度更稳)、int4+GPTQ(逐层误差最小化)。
AWQ:激活感知的低比特量化算法
核心是通过激活分布识别关键权重通道,按通道缩放并保护约 1% 关键权重,降低量化误差。
相比普通 int4:精度更高(接近无损)、推理更快(硬件友好),但实现较复杂,依赖专用库(AutoAWQ)。
适配:NVIDIA GPU 优先,支持 TensorRT-LLM、vLLM 等推理引擎。
GGUF:本地部署的统一模型格式
不是量化算法,而是存储量化后模型的二进制格式,单文件包含权重、元数据、分词器,支持 mmap 快速加载。
支持多种量化等级(如 Q4_K_M、Q5_K_S),适配 llama.cpp/Ollama,CPU 推理优化显著,适合无高端 GPU 的本地部署。
常见命名:Model-Instruct.Q4_K_M.gguf(指令微调 + Q4_K_M 量化 + GGUF 格式)。
Instruct:面向指令交互的微调标识
基线模型经指令数据集微调,强化对用户指令的理解与执行,减少幻觉,提升回复相关性。
与 Base(基础模型)、Chat(对话优化)并列,是用途标签,不涉及量化或格式。
GGUF 代表着 AI 模型存储与推理的重大进步,它通过统一格式、支持量化、单文件部署三大核心优势,正在成为开源大模型分发的事实标准。它是一个专为本地推理设计的 "模型压缩包",将大型语言模型变成普通人电脑也能运行的轻量级应用。
MiMo-V2-Flash 正式开源!这是一个专为极致推理效率自研的总参数 309B(激活 15B)的 MoE 模型,通过 Hybrid 注意力架构创新及多层 MTP 推理加速,在多个 Agent 测评基准上保持进入全球开源模型 Top 2;代码能力超过所有开源模型,比肩标杆闭源模型 Claude 4.5 Sonnet,但推理成本仅为其 2.5%,生成速度提升 2 倍,成功将大模型推理效率推向极致。

秉持开放精神,模型权重和推理代码均采用 MIT 协议全面开源。API 限时免费。
12月1日,字节跳动豆包团队联合中兴努比亚,发布豆包手机助手,并搭配努比亚M153工程样机面向开发者发售。这款被称为“手机自动驾驶”的产品,彻底打破了传统手机助手的边界——不仅能完成定闹钟、查天气等基础操作,更能实现点外卖、订机票、跨平台比价、自动回复微信、运行小程序游戏等复杂场景,真正做到“一句话搞定一切”。
与华为小艺、小米小爱、OPPO小布等传统助手不同,豆包手机助手无需用户手动操作APP:无需打开应用、无需点击界面、无需滑动屏幕,AI会模拟真人逻辑自动完成全流程操作,如同为每个用户配备了专属真人助理。这种“跳过APP直接解决需求”的模式,迅速引发行业震动,360创始人周鸿祎更是发布视频直言:“美团、淘宝的高管们可能要连夜开会了。”
周鸿祎的判断并非危言耸听。过去十几年,互联网大厂构建的核心商业模式,本质是“流量漏斗”:用户有购物需求,需打开淘宝/京东,刷首页推荐、看信息流广告、搜索比价、筛选产品、加入购物车,最终完成下单——每一个环节都是大厂精心设计的流量变现节点。而豆包手机助手的出现,直接绕开了这一漏斗:用户无需打开淘宝首页、无需浏览广告、无需手动比价,只需说一句“帮我买一件适合冬天的羽绒服”,AI就能自动完成全流程操作。这意味着,大厂花费十几年搭建的流量壁垒、广告变现体系,被AI直接“短路”,这才是真正让互联网大厂彻夜难眠的核心原因。
“大模型善后工程师”这个说法虽然带点调侃意味,但非常精准地抓住了当前生成式AI落地实践中的一个核心现实——大模型是强大的“初稿生成器”,但离“端到端可靠交付”仍有距离。