跳到主要内容

36 篇博文 含有标签「AI」

查看所有标签

引领物理AI与下一代算力革命

· 阅读需 13 分钟
otqsoft
Front And Rear End Engineers @ gitee

在CES 2026上,英伟达创始人兼CEO黄仁勋发表了主题为 “计算的炼金术”(The Alchemy of Computation) 的演讲。本次演讲的核心论点是:计算行业正在经历从软件到硬件的全面重构,AI将从数字世界走向物理世界,而英伟达通过其全栈技术,正成为这场新工业革命的基石引擎。

核心战略:引领双重平台变革

英伟达指出,计算行业正同时经历两场十年一遇的平台级变革

  1. 从通用计算到加速计算:传统计算范式正在被加速计算所取代。
  2. 从传统应用到生成式AI:应用范式正在被生成式AI重塑。

这场变革导致了整个技术栈的全面重构,具体表现为:从代码驱动转向模型驱动、从CPU转向GPU、从预编译转向生成式、从应用优先转向AI优先。这催生了一个价值高达10万亿美元的待现代化的计算市场。

2025年度工作总结

· 阅读需 4 分钟
otqsoft
Front And Rear End Engineers @ gitee

2025年,我聚焦AI技术应用与全栈开发能力提升,以“技术赋能业务、沉淀个人价值”为核心目标,扎实推进各项工作任务。在项目实践中积极探索AI工具融合应用,在个人技术沉淀上持续深耕,既完成了团队交付的核心任务,也实现了个人技术能力与价值输出的双重突破。现将全年工作情况总结如下:

一、核心工作成果:AI驱动业务落地

AI智能体与系统搭建成果丰硕

  • 基于Coze平台完成多款智能体及工作流搭建,包括地震小助手、设备管理小助手、Viki等。通过API调用实现智能体与实际项目的深度融合,有效简化了业务流程、提升了工作协同效率,其中设备管理小助手已在相关项目中投入使用,显著降低了设备运维的沟通成本与响应时间。
  • 运用Dify平台搭建智能客服智能体,整合VAD(语音活动检测)、ASR(自动语音识别)、TTS(语音合成)等多模型能力,成功构建全流程智能客服系统。系统实现了语音交互、问题精准识别与智能应答的闭环,为用户提供了便捷的服务体验,同时减轻了人工客服的工作负担。

AI辅助开发创新实践

  • 全年广泛运用AI工具赋能开发全流程,熟练使用多款工具提升开发效率与代码质量。基于此,自主完成一款Flutter APP的开发,并通过AI优化产品逻辑与运营策略,成功实现商业盈利,验证了AI辅助开发模式的可行性与商业价值。
  • 积极引入并订阅了多类AI辅助开发工具,涵盖代码生成、智能问答与专项优化等方向。在IDE领域,充值并熟练使用Cursor、CodeBuddy、Qoder等工具,有效提升了编码效率与质量。在大模型平台方面,接入了DeepSeek、AutoGLM、硅基流动等国内优秀模型服务,并结合豆包、MiniMax等平台,在日常开发、代码调试与方案设计中实现了AI全流程协同。

MiniCPM-V 端侧多模态模型分析

· 阅读需 20 分钟
otqsoft
Front And Rear End Engineers @ gitee

随着人工智能技术的快速发展,多模态大语言模型(MLLMs)已成为 AI 领域的核心研究方向。在这一领域中,MiniCPM-V 系列作为面壁智能与清华大学自然语言处理实验室联合推出的端侧导向多模态模型,凭借其在低参数量下实现高性能的独特优势,正在重新定义边缘设备 AI 的可能性边界。与此同时,InternVLQwen-VL作为分别由上海人工智能实验室和阿里云推出的主流多模态模型,也在各自的技术路线上取得了显著进展。

当前,边缘计算和隐私保护需求的增长,使得在资源受限设备上部署高性能多模态 AI 成为行业迫切需求。MiniCPM-V 系列通过创新的架构设计和优化策略,在保持 8B 参数规模的同时,实现了与大参数量模型相当甚至更优的性能表现。本研究旨在通过深入分析 MiniCPM-V 的技术架构、性能表现、部署方案以及与 InternVL、Qwen-VL 的全面对比,为多模态 AI 模型的选型和部署提供科学依据。

GGUF 模型格式

· 阅读需 6 分钟
otqsoft
Front And Rear End Engineers @ gitee

一、GGUF 的基本含义

GGUF 是 "GPT-Generated Unified Format" 的缩写,是一种专为大语言模型 (LLM) 设计的二进制文件存储格式,由 llama.cpp 创始人 Georgi Gerganov 于 2023 年 8 月 21 日正式推出,作为 GGML 格式的继任者。

二、GGUF 的核心作用

GGUF 是专门为本地推理优化的模型格式,特别是针对CPU 和低显存 GPU 环境。它将模型运行所需的所有信息打包在一个文件中,包括:

  • 模型权重 (量化后)
  • 架构参数 (隐藏层大小、层数等)
  • tokenizer (分词器) 信息
  • 量化方案详情

三、GGUF 解决的痛点

在 GGUF 出现前,AI 模型存储面临三大问题:

问题具体表现GGUF 解决方案
兼容性差不同框架 / 量化方法的模型无法互通统一格式标准,一处下载多端运行
体积庞大原始 PyTorch 模型动辄数十 GB,普通设备无法加载原生支持量化,大幅减小体积 (7B 模型可从 13GB→4GB)
元数据缺失模型缺少架构、分词器等关键信息,需手动配置完整元数据嵌入,开箱即用

四、GGUF 的技术特点

1. 文件结构

GGUF 采用三层架构设计:

  • Header (文件头):存储版本号、元数据大小、张量数量等基本信息
  • Metadata (元数据区):包含模型架构、tokenizer、量化类型等完整配置
  • Tensor Data (张量区):存储量化后的权重矩阵,按层组织

这种设计类似 "模型 = 配置 + 权重" 的打包形式,但更轻量、更专注推理。

2. 强大的量化支持

GGUF 是量化模型的理想载体,支持多种量化方案:

量化类型精度适用场景
Q2_K/Q3_K2-3 位极致压缩,适合极低资源设备,精度损失较大
Q4_0/Q4_K4 位平衡压缩与精度,最广泛使用的量化方案
Q5_K_M5 位高精度需求场景,文件略大但性能接近 FP16
Q8_08 位接近 FP16 精度,几乎无精度损失但压缩率较低

关键优势:每个张量可独立选择量化类型,支持混合量化 (不同层使用不同精度),最大化性能与精度平衡。

五、GGUF 命名规则解析

qwen2-7b-instruct.Q4_K_M.gguf为例:

  • qwen2-7b-instruct:模型名称 (通义千问 2,7B 参数,指令微调版)
  • Q4_K_M:量化方案 (4 位,基于 K-means 聚类,多向量)
  • .gguf:文件格式后缀

量化后缀是 GGUF 文件名的重要组成部分,它直接告诉用户模型的压缩程度和推理性能。

六、GGUF vs GGML:核心差异

特性GGML (旧格式)GGUF (新格式)
元数据支持有限,需额外配置文件完整,直接嵌入文件
版本兼容性较差,升级后旧模型常无法加载稳定,支持向后兼容
扩展性受限,难以适应新量化方法灵活,可添加新功能不破坏兼容性
当前状态已被 llama.cpp 官方弃用活跃开发中,成为事实标准

七、应用场景:为何 GGUF 如此重要?

  1. 本地 AI 部署:让普通电脑也能运行大模型,保护隐私,避免 API 费用
  2. 边缘计算:适用于手机、IoT 设备等资源受限环境
  3. 研究与实验:快速测试不同模型和量化配置,无需复杂环境搭建
  4. 模型分发:Hugging Face 等平台已支持 GGUF,一键下载即用

总结:GGUF 是大模型走向大众化的关键一步,正如 MP3 让音乐普及一样,它让 "人人都能在自己电脑上跑大模型" 成为现实。

八、如何使用 GGUF 模型?

使用非常简单:

# 使用llama.cpp推理
./main -m model.Q4_K_M.gguf -p "你好,GGUF!"

# 使用Python库
from llama_cpp import Llama
llm = Llama(model_path="model.Q4_K_M.gguf")
output = llm("写一首关于GGUF的诗")

GGUF 文件已包含所有必要信息,无需额外配置即可使用。

九、其它格式

除了GGUF格式以外,还有以下常用格式,主要区别:

标识类型全称 / 核心含义核心特点典型用途
int4量化精度4 位整数(INT4)量化权重从 FP16/BF16 转为 4 位整数,压缩比约 3.5–4×,精度 96%–98%,内存 / 显存占用极低边缘设备、消费级 GPU、低显存场景
AWQ量化算法Activation-aware Weight Quantization激活感知权重量化,识别关键权重通道并保护,减少 INT4 量化精度损失,接近无损GPU 高效推理,兼容 vLLM/CTranslate2
GGUF文件格式GPT-Generated Unified Format替代 GGML,单文件含权重 + 元数据 + 分词器,适配 llama.cpp,支持 Q4_K_M 等量化,CPU/GPU 混合推理友好本地部署、llama.cpp/Ollama 生态,单文件分发
Instruct模型用途指令跟随微调经指令数据集微调,理解并执行用户指令,对话 / 任务完成能力强聊天机器人、问答、文本生成等交互场景

int4:极致压缩的 4 位整数量化

  • 量化是将浮点权重转为低精度整数,int4 用 4 位存储权重,大幅减少存储与计算开销。

  • 优点:极致压缩,适合低显存设备;缺点:长文本易掉精度,需配合 AWQ/GPTQ 等算法弥补。

  • 常见组合:int4+AWQ(精度更稳)、int4+GPTQ(逐层误差最小化)。

AWQ:激活感知的低比特量化算法

  • 核心是通过激活分布识别关键权重通道,按通道缩放并保护约 1% 关键权重,降低量化误差。

  • 相比普通 int4:精度更高(接近无损)、推理更快(硬件友好),但实现较复杂,依赖专用库(AutoAWQ)。

  • 适配:NVIDIA GPU 优先,支持 TensorRT-LLM、vLLM 等推理引擎。

GGUF:本地部署的统一模型格式

  • 不是量化算法,而是存储量化后模型的二进制格式,单文件包含权重、元数据、分词器,支持 mmap 快速加载。

  • 支持多种量化等级(如 Q4_K_M、Q5_K_S),适配 llama.cpp/Ollama,CPU 推理优化显著,适合无高端 GPU 的本地部署。

  • 常见命名:Model-Instruct.Q4_K_M.gguf(指令微调 + Q4_K_M 量化 + GGUF 格式)。

Instruct:面向指令交互的微调标识

  • 基线模型经指令数据集微调,强化对用户指令的理解与执行,减少幻觉,提升回复相关性。

  • 与 Base(基础模型)、Chat(对话优化)并列,是用途标签,不涉及量化或格式。

十、小结

GGUF 代表着 AI 模型存储与推理的重大进步,它通过统一格式、支持量化、单文件部署三大核心优势,正在成为开源大模型分发的事实标准。它是一个专为本地推理设计的 "模型压缩包",将大型语言模型变成普通人电脑也能运行的轻量级应用。

MiMo-V2-Flash 开源

· 阅读需 3 分钟
viki
Front End Engineer @ gitee

MiMo-V2-Flash 正式开源!这是一个专为极致推理效率自研的总参数 309B(激活 15B)的 MoE 模型,通过 Hybrid 注意力架构创新及多层 MTP 推理加速,在多个 Agent 测评基准上保持进入全球开源模型 Top 2;代码能力超过所有开源模型,比肩标杆闭源模型 Claude 4.5 Sonnet,但推理成本仅为其 2.5%,生成速度提升 2 倍,成功将大模型推理效率推向极致。

图片

秉持开放精神,模型权重和推理代码均采用 MIT 协议全面开源。API 限时免费

从豆包手机到GLM的开源

· 阅读需 8 分钟
viki
Front End Engineer @ gitee

12月1日,字节跳动豆包团队联合中兴努比亚,发布豆包手机助手,并搭配努比亚M153工程样机面向开发者发售。这款被称为“手机自动驾驶”的产品,彻底打破了传统手机助手的边界——不仅能完成定闹钟、查天气等基础操作,更能实现点外卖、订机票、跨平台比价、自动回复微信、运行小程序游戏等复杂场景,真正做到“一句话搞定一切”。

与华为小艺、小米小爱、OPPO小布等传统助手不同,豆包手机助手无需用户手动操作APP:无需打开应用、无需点击界面、无需滑动屏幕,AI会模拟真人逻辑自动完成全流程操作,如同为每个用户配备了专属真人助理。这种“跳过APP直接解决需求”的模式,迅速引发行业震动,360创始人周鸿祎更是发布视频直言:“美团、淘宝的高管们可能要连夜开会了。”

周鸿祎的判断并非危言耸听。过去十几年,互联网大厂构建的核心商业模式,本质是“流量漏斗”:用户有购物需求,需打开淘宝/京东,刷首页推荐、看信息流广告、搜索比价、筛选产品、加入购物车,最终完成下单——每一个环节都是大厂精心设计的流量变现节点。而豆包手机助手的出现,直接绕开了这一漏斗:用户无需打开淘宝首页、无需浏览广告、无需手动比价,只需说一句“帮我买一件适合冬天的羽绒服”,AI就能自动完成全流程操作。这意味着,大厂花费十几年搭建的流量壁垒、广告变现体系,被AI直接“短路”,这才是真正让互联网大厂彻夜难眠的核心原因。

大模型善后工程师

· 阅读需 6 分钟
viki
Front End Engineer @ gitee

“大模型善后工程师”这个说法虽然带点调侃意味,但非常精准地抓住了当前生成式AI落地实践中的一个核心现实——大模型是强大的“初稿生成器”,但离“端到端可靠交付”仍有距离。

  • ✅ 80%:大模型在开放域、非关键路径、容错性高的任务上表现惊艳——比如:
    • 写一封普通邮件初稿
    • 生成常规SQL查询
    • 用标准框架搭一个简单网页
    • 翻译/摘要/头脑风暴类创意
  • ❌ 20%:剩下那部分往往涉及:
    • 准确性要求高(如金融计算、医疗建议、法律条款)
    • 上下文深度耦合(需精准理解业务逻辑、历史数据、用户意图)
    • 边界case处理(异常输入、歧义提示、多轮意图漂移)
    • 合规与安全(隐私脱敏、偏见过滤、版权规避)
    • 工程化集成(API封装、缓存策略、错误重试、日志追踪)

模型ONNX与pt格式的区别

· 阅读需 3 分钟
otqsoft
Front And Rear End Engineers @ gitee

ONNX(Open Neural Network Exchange)和 PT(PyTorch 模型文件)是两种不同的模型格式,主要区别体现在设计目标、兼容性、用途和特性上,具体如下:

格式定义与设计目标

  • PT 格式

    是 PyTorch 框架的原生模型格式(文件后缀通常为 .pt.pth),本质上是 PyTorch 张量和模型结构的序列化文件,紧密依赖 PyTorch 的运行时环境和 API。

    设计目标是方便 PyTorch 模型的保存、加载和断点续训,更适合 PyTorch 生态内的模型开发、调试和训练。

  • ONNX 格式

    是一种跨框架的开放格式(由微软、Facebook 等联合推出),旨在标准化神经网络模型的表示方式,实现不同深度学习框架(如 PyTorch、TensorFlow、MXNet 等)之间的模型互转和部署兼容。

    设计目标是解决 “模型格式碎片化” 问题,专注于模型的跨平台部署

兼容性

  • PT 格式

    仅能被 PyTorch 框架识别和加载,依赖 PyTorch 的版本和具体算子实现(不同 PyTorch 版本可能存在兼容性问题),无法直接在其他框架(如 TensorFlow、ONNX Runtime)中使用。

  • ONNX 格式

    与框架无关,支持多种深度学习框架导出(如 PyTorch 的 torch.onnx.export、TensorFlow 的 tf2onnx 工具),并可被多种推理引擎加载运行(如 ONNX Runtime、TensorRT、OpenVINO 等),兼容性更强。

用途场景

  • PT 格式

    主要用于模型训练阶段,例如:

    • 保存训练过程中的模型权重和结构,方便断点续训;
    • 在 PyTorch 环境下进行模型微调、评估或修改网络结构。
  • ONNX 格式

    主要用于模型部署阶段,例如:

    • 将训练好的模型(无论来自 PyTorch 还是 TensorFlow)转换为 ONNX 格式,再部署到不同硬件(CPU、GPU、移动端、嵌入式设备)或平台(Windows、Linux、Android 等);
    • 结合推理引擎(如 ONNX Runtime)进行高效推理优化(如算子融合、量化等)。

存储内容

  • PT 格式

    通常存储模型的参数权重计算图结构(PyTorch 的动态图定义),还可能包含优化器状态(用于续训)等额外信息,文件大小可能较大。

  • ONNX 格式

    存储的是静态计算图(节点、算子、输入输出张量信息)和模型权重,结构更标准化,不包含训练相关的优化器状态等信息,更适合推理。

灵活性与优化

  • PT 格式

    依赖 PyTorch 的动态图机制,加载后可灵活修改网络结构或参数,适合研发阶段的灵活调试,但推理时需要 PyTorch runtime 支持,优化手段相对受限。

  • ONNX 格式

    作为静态图格式,一旦导出后结构相对固定,但可被专用推理引擎深度优化(如 TensorRT 的 FP16/INT8 量化、层融合),通常能获得更高的推理效率,尤其在生产环境中优势明显。

总结

  • PT 是 PyTorch 原生格式,适合训练、调试和 PyTorch 生态内的开发;
  • ONNX 是跨框架开放格式,适合模型部署和跨平台推理。

实际流程中,常先在 PyTorch 中用 PT 格式保存模型,训练完成后导出为 ONNX 格式,再部署到生产环境。

什么是CUDA

· 阅读需 5 分钟
otqsoft
Front And Rear End Engineers @ gitee

CUDA(Compute Unified Device Architecture)是一个非常重要且广泛应用的并行计算平台和编程模型。

CUDA 是什么

CUDA 是由 NVIDIA 公司推出的一种通用并行计算架构。它允许软件开发者和研究人员使用 **NVIDIA 的 GPU(**图形处理器) 来进行通用目的的计算,而不仅仅是渲染图形。这种将 GPU 用于非图形计算的概念被称为 GPGPU(General-Purpose computing on Graphics Processing Units)。

简单来说,CUDA 提供了一套软硬件体系,让你能用 C/C++、Python、Fortran 等语言编写程序,直接利用 GPU 中成千上万个计算核心的强大并行处理能力,来加速解决复杂的计算问题。

Make、n8n、Dify、Coze与BISHENG平台深度对比分析报告

· 阅读需 27 分钟
otqsoft
Front And Rear End Engineers @ gitee

概述

Make

Make 定位为企业级无代码自动化解决方案,是连接多系统的可视化流程工具,致力于帮助企业自动化工作流、提高生产力,无需编写代码。其前身为 Integromat,2016 年成立,2020 年被 Celonis 收购,后更名 Make,现为云端 SaaS 平台,服务全球 170 多个国家的 20 万+企业客户。

提示

核心优势:拥有 3000+ 预置连接器,支持 Google Workspace、Slack、CRM 系统、电商平台等多应用集成,可实现跨系统数据同步与复杂工作流自动化,如电商订单处理、CRM 与 ERP 集成等场景。

平台采用直观拖拽式界面,提供模块化设计与实时数据流可视化,支持从简单流程到复杂业务模型的构建,满足大中小型企业的自动化需求。

n8n

n8n 是德国团队 2019 年开发的开源工作流自动化平台,定位“开源界的 Zapier”,以“可视化+代码双模式”为核心特性,支持 400+ 应用集成与 2000+ 社区贡献节点,GitHub Stars 达 97.6k。其技术架构基于 Node.js,采用三层微服务设计,提供拖拽式可视化编辑器与 JavaScript/Python 自定义节点能力,支持复杂分支、循环及子流程逻辑编排。应用聚焦企业级场景,如 IT 运维、供应链管理,可嵌入 LLM 节点实现“报销单-OCR-审批-记账”等流程自动化,同时支持自托管部署确保数据隐私。

提示

核心优势:兼顾无代码效率与代码灵活性,节点生态丰富(2000+ 社区节点),复杂逻辑处理能力突出,适合技术团队构建高度定制化自动化流程

Dify

Dify 定位为企业级 LLMOps 标杆平台,首创“LLMOps”概念,以“开源世界的企业 AI 中间件”为核心定位,致力于降低大模型应用开发门槛。2023 年由中国团队创立,采用蜂巢架构(BeeHive)模块化设计,GitHub 星标 37.4k+,社区响应迅速且活跃度高。

技术上融合 BaaS 与 LLMOps 理念,提供从原型设计到生产运维的全生命周期管理,核心能力包括多模型热切换(无缝集成 OpenAI、Llama 3 等百余种模型)、企业级 RAG 引擎(检索精度>95%,支持混合检索)及 Agent 协作系统(支持 ReAct、Function Calling 策略)。工作流引擎支持条件分支、循环等复杂逻辑编排,可在对话流程中插入 RAG 检索或工具调用节点。

应用场景覆盖金融风控、医疗诊断辅助等专业领域,典型案例包括智能客服、合同审查机器人及银行 LLM 网关,国内多家股份行将其用作核心 AI 中间件。部署方式灵活,支持 Docker 私有化部署(最低 2 核 4G 配置)与企业级 BaaS 服务,成本模型为开源社区版免费(需支付第三方模型 API 费用),企业版按需定价。

提示

核心优势:一体化 LLMOps 工具链(A/B 测试、灰度发布)、生产级稳定性、银行级权限管控,适合需快速将 AI 原型转化为生产级应用的技术团队。

Coze

Coze 是字节跳动于 2025 年推出的零代码 AI 应用开发平台,核心定位“新一代 AI 应用开发神器”,主打“5 分钟搭建聊天机器人”的轻量化体验,深度集成抖音、飞书等字节系生态,是个人开发者首选工具。其核心优势在于“零代码+字节生态”双驱动:模板市场提供 1200 余款预制 Bot 模板,支持可视化拖拽搭建,纯小白可快速上手;原生对接抖音评论自动回复、飞书会议纪要生成等场景,发布至字节生态平台仅需一键操作。

提示

核心能力聚焦:中文友好的插件市场(含抖音数据提取、飞书集成工具)、低成本图文生成(即梦生图模型调用仅 0.025 元/张,较直接 API 低 8 倍成本),但复杂工作流处理能力较弱。

技术架构采用模块化设计,后端基于 Go 语言,前端使用 TypeScript (React),支持通过中转平台调用 Claude、ChatGPT 等外部大模型,目标用户覆盖 AI 初学者、自媒体创作者及中小团队。

BISHENG

BISHENG 定位为企业级文档处理与多智能体协作平台,是开源 LLM DevOps 平台,以 Apache 2.0 协议开源可商用,已被大量财富 500 强企业采用。核心解决企业非结构化数据处理痛点,自研高精度文档解析引擎支持 PDF、扫描件等处理,双栏排版识别准确率超 95%,跨页表格拼接技术领先,可处理手写体与印章干扰,将非结构化数据转换为结构化数据,作为企业知识库基石。平台采用“低代码+全代码”模式,支持业务人员拖拽与开发者深度编排,提供生成式 AI 工作流、RAG、智能代理等功能,简化部署配置,支持私有化部署。

提示

核心优势:高精度文档解析(95%+双栏识别率)、跨页表格拼接、手写体处理;开源可商用,企业级系统管理与可观测性,适配复杂文档处理场景。

最后更新时间: 2026/7/31 13:40:35|访问次数: 0|豫ICP备2025159864号|