开源模型

标签「开源模型」下的文章

共 4 篇文章

TensorRT Model Connect - 开源模型部署工具,两命令转C+

TensorRT Model Connect(TRTMC)是 NVIDIA 于 2026 年 8 月 18 日以 Apache-2.0 协议在 GitHub 开源的一款模型部署工具,旨在将 Hugging Face 或本地模型检查点直接转换为原生 C++ 推理引擎。开发者仅需 `trtmc build` 和 `trtmc run` 两条命令即可完成部署,全程无需导出 ONNX 中间格式,构建产物为版本化的 .bundle 文件,运行时完全脱离 PyTorch 环境。该项目由 OpenAI Codex Agent 在人类监督下构建,代表了 AI 辅助开发部署工具的范式转变。TRTMC 提供覆盖 105 个模型系列、76 个模型家族的参考实现,包括 Qwen、Llama、Mistral、DeepSeek 等主流开源大语言模型以及 Whisper 语音模型。性能验证方面,在 GB300 快照测试中,102 个 profile 的推理性能较声明基准提升超过 5%。其技术架构将构建阶段与运行时解耦,提供统一的 C++ 任务 API(generate、transcribe、embed 等),并支持 NVIDIA 全系列 GPU(如 A100、H100、Jetson),可实现云端到边缘的全场景部署,适用于大模型推理服务、边缘 AI 推理、C++ 应用集成与模型快速评估。该工具通过版本化 .bundle 天然支持模型回滚与灰度发布,为生产环境提供了高一致性的交付单元。

阅读全文

Needle 2 发布:仅 14MB 的超轻量级基础模型,赋能端侧 AI 应用

cactus-compute 在 GitHub 开源了名为 Needle 2 的超轻量级基础模型,模型体积仅为 14MB,专门针对手机、可穿戴设备、智能家居和机器人等资源受限的小型设备优化。该模型的核心竞争力在于极致轻量化,14MB 的大小使其能轻松装入大多数嵌入式设备的闪存,甚至能在高端微控制器的 SRAM 中运行,极大降低了对存储空间和运行内存的要求。Needle 2 支持在端侧直接部署,无需依赖高带宽云端计算,为边缘计算提供了极具竞争力的基础架构。主要应用场景涵盖移动与可穿戴设备(如智能手机和智能手表)、智能家居(传感器、智能开关)以及机器人领域,为小型机器人提供本地化模型支持,以实现更快响应和更高隐私安全。Needle 2 的出现标志着端侧 AI 进入精细化阶段,为 AIoT 普及提供低门槛起点,并通过本地数据处理保障隐私,可能引发行业对模型小型化技术路径的重新关注,推动更多针对边缘计算优化的算法架构诞生。

阅读全文

Muse Glimmer 介绍:一款可在你的设备上运行的开源智能体模型

Meta AI Research 正式发布了名为 Muse Glimmer 的开源智能体模型,并将其权重在 Apache 2.0 许可下开源。Muse Glimmer 是一个拥有 300 亿参数的模型,专门为始终在线的本地智能体工作流优化,设计目标是能在搭载单个消费级 GPU 的 Mac 或 PC 上运行。该模型旨在实现本地智能体、函数调用、本地编码及 LLM 作为评估器等用例。在训练层面,Meta 采用了紧凑的架构设计,通过基于 Muse Spark 输出的逻辑蒸馏进行预训练,并在中期训练阶段引入更长上下文和带有丰富推理痕迹的数据,最后结合监督微调、在线策略蒸馏和强化学习进行后训练。在性能上,Meta 宣称 Muse Glimmer 在同尺寸模型中表现强劲,与 Gemma4-31B 和 Qwen3.6-27B 等模型相比,具备可靠的端到端任务完成、多步推理、失败恢复及多模态输入输出能力。为了在消费级硬件上实现实用的运行速度,Meta 采用了约 4-bit 的量化技术压缩权重,并引入基于 DFlash 的轻量级推测解码起草模型,能在无损质量的前提下显著提升生成速度。该模型目前在 Hugging Face 提供下载,并将通过 Ollama、LM Studio 等合作伙伴集成,支持 llama.cpp、MLX 和 ExecuTorch 等边缘框架,同时正与 AMD、Arm、Dell、Intel 和 NVIDIA 等硬件厂商合作优化全设备性能。

阅读全文

打造克制、好用的 AI 产品。

VerySmallWoods 博客首页聚合了2026年6月9日至13日的AI领域重要资讯与独立开发实践。内容涵盖智能体主动性突破:Simon Willison 观察到 Claude Fable 5 展现出“ relentlessly proactive ”的自主调试能力,通过注入诊断代码、自主创建HTTP服务、跨浏览器截图验证来修复滚动条bug,标志着有意图的多步自纠智能体行为;Google DeepMind 提出“模型 diffing ”新范式,让审计智能体主动构造 prompt 搜索模型间行为差异,推动评估方法升级。基础设施层面,Google Cloud 发布 Open Knowledge Format,以带YAML frontmatter的Markdown为AI结构化知识建立开放标准;OpenAI 收购 Ona 为 Codex 补足持久化云端执行环境,使Agent在电脑离线后仍能在企业云中持续运行。同时,Anthropic 推出企业订阅 Claude Corps 并联合 DXC 进军受监管行业;AWS 开源 Agent-EvalKit 系统化评估Agent全链路表现;Google 发布扩散架构文本生成模型 DiffusionGemma 和一行SDK启动的 Gemini Managed Agents;开源模型方面,Gemma 4 12B无编码器多模态模型可在16GB显存本地运行,GLM-5.2 在编程能力上表现顶尖。此外,博客还介绍了自研产品 AirType 语音转文字工具、Sessionly Claude Code 会话管理器,以及多门付费课程如 LangChain 智能体开发、MCP 协议实战等,体现了从AI前沿追踪到轻巧工具制作的完整独立开发实践链路。

阅读全文