DeepSeek

与「DeepSeek」相关的文章

共 6 篇文章

TensorRT Model Connect - 开源模型部署工具,两命令转C+

TensorRT Model Connect(TRTMC)是 NVIDIA 于 2026 年 8 月 18 日以 Apache-2.0 协议在 GitHub 开源的一款模型部署工具,旨在将 Hugging Face 或本地模型检查点直接转换为原生 C++ 推理引擎。开发者仅需 `trtmc build` 和 `trtmc run` 两条命令即可完成部署,全程无需导出 ONNX 中间格式,构建产物为版本化的 .bundle 文件,运行时完全脱离 PyTorch 环境。该项目由 OpenAI Codex Agent 在人类监督下构建,代表了 AI 辅助开发部署工具的范式转变。TRTMC 提供覆盖 105 个模型系列、76 个模型家族的参考实现,包括 Qwen、Llama、Mistral、DeepSeek 等主流开源大语言模型以及 Whisper 语音模型。性能验证方面,在 GB300 快照测试中,102 个 profile 的推理性能较声明基准提升超过 5%。其技术架构将构建阶段与运行时解耦,提供统一的 C++ 任务 API(generate、transcribe、embed 等),并支持 NVIDIA 全系列 GPU(如 A100、H100、Jetson),可实现云端到边缘的全场景部署,适用于大模型推理服务、边缘 AI 推理、C++ 应用集成与模型快速评估。该工具通过版本化 .bundle 天然支持模型回滚与灰度发布,为生产环境提供了高一致性的交付单元。

阅读全文

中国银河证券:FDE重构AI应用新范式 软件行业迎价值重估

中国银河证券发布研报,系统论述了前沿部署工程师(FDE)如何重构AI应用交付新范式,并推动软件行业价值重估。报告指出,FDE核心解决AI应用落地的“最后一公里”问题,本质上是将工程师前置部署到企业业务一线,通过现场探索与快速迭代将大模型等AI技术嵌入企业内部流程的新型深度交付体系,该模式最早由美国大数据公司Palantir提出,目前已被微软、OpenAI、Anthropic等大厂广泛采用。FDE兴起的产业背景包括:国产大模型如Kimi、DeepSeek持续迭代降低应用门槛,以及北京市于2026年7月出台《北京市关于加快智能体引领发展的若干措施》明确提出支持通过FDE等模式创新加速智能体应用落地。报告分析了FDE能解决的三个企业痛点:业务流程高非标化导致通用大模型无法适配、高敏感行业的数据安全与隐私壁垒、以及企业对大模型落地效果及投资回报率(ROI)的关注。最终研判认为,FDE将带来软件行业交付范式革命,推动商业模式从传统软件授权转向以ROI和使用效果为导向的全生命周期增量价值服务,使得行业know-how成为AI应用公司的护城河,部分软件公司将迎来价值体系重估并打开估值天花板。

阅读全文

企业级 AI 部署新趋势:DeepSeek 本地部署结合 Claude/GPT 的混合分发策略

2026年8月7日,一则关于企业级AI模型采购与部署策略的讨论在Linux.do开发者社区引发关注。讨论揭示了一种新兴的企业AI落地路径:混合云部署与API分发模式。某公司已完成DeepSeek模型的本地化部署供内部开发团队试用,现计划进一步引入海外高端闭源模型,正面临在Anthropic的Claude与OpenAI的ChatGPT之间的选型决策。该案例的技术焦点在于利用“sub2api”(订阅转API)技术方案,将商业订阅账号转化为团队内部可共享调用的API资源,以解决账号管理与流量分发难题,试图在合规与成本控制之间寻求平衡。该事件表明,企业AI部署正从单点工具向系统化基础设施转型。DeepSeek本地部署体现了对数据隐私和推理成本的双重考量,而Claude与GPT的对比则反映了对模型推理能力上限的追求。sub2api方案暴露了现有SaaS付费模式与企业DevOps流程间的摩擦,企业急需中间层技术将AI服务无缝集成至IDE插件和CI/CD流水线。文章预测,未来AI工具链的竞争将是模型能力、开发者生态、API稳定性及分发合规性的综合博弈,混合架构将成为中长期主流形态。

阅读全文

推理成本砍掉一半以上,OpenAI摸着DeepSeek过河

2026年7月2日,36氪旗下“字母AI”报道,OpenAI正通过系统优化方案将模型推理成本降低超过一半,这一方案主要是受DeepSeek在KV cache压缩上的经验启发。援引外媒消息称,OpenAI在内存效率方面取得重大突破,来自一个从OpenAI剥离出的团队,其核心优化方向是KV cache的改进。KV cache是模型生成时存放前文“笔记”的热数据,必须存放在高带宽存储器HBM中,是推理成本的关键。OpenAI此前在2024年10月已通过Prompt Caching机制降低延迟和输入成本,而DeepSeek早在2024年5月便在DeepSeek-V2中通过Multi-head Latent Attention(MLA)将KV cache压缩了93.3%,提升吞吐量至5.76倍。文章进一步分析了HBM与KV cache的关系,指出虽然单请求HBM需求可能下降,但总需求未必下降,因为推理成本下降后厂商会去追求更长上下文和更高并发。在硬件层面,OpenAI已推出自研AI芯片Jalapeño,并已与Cerebras签订超100亿美元推理算力协议。文章强调,OpenAI年亏损209亿美元,正通过“软件+硬件”双路径全力降低推理成本,为上市铺路。这些举措将深刻影响大模型推理架构竞争格局。

阅读全文

云端token爆发后,端侧算力起步:智能体一体机迎来六路玩家

本文深度剖析了2026年6月智能体一体机市场的最新竞争格局与产业逻辑。随着云端AI Token爆发,本地端侧算力需求正式起步,一个全新的硬件品类——智能体一体机正在成型。文章定义了该品类的核心形态:一种搭载较强本地显卡算力(通常为128GB显存),能支撑3-5人小团队或超级个体本地运行模型和智能体的桌面级主机,售价在1.8万至3.3万元区间。目前市场形成了四种技术路线:苹果Mac Mini方案、NVIDIA的DGX Spark及与联发科合作开发的RTX Spark方案、AMD锐龙AI Max+ Windows主机方案,以及低价低功耗的Intel N97网关方案。文章重点复盘了前两次AI硬件“退货潮”的教训——2025年DeepSeek一体机因有算力无应用而被闲置,2026年MacMini因用户跟风购买OpenClaw却没有具体工作需求而退货,指出当前第三波热潮的理性之处在于:经过迭代的Agent能力已达“大学生”级别,真正开始解决具体、高频、重复的实际工作任务(如律师知识检索、零部件销售报价、财务发票计税)。产业面临的核心挑战是“高不能低不就”:端侧算力场景不如云端丰富,单卡算力有限,但2.3万元以上的高价让普通用户望而却步。六路入局玩家(传统PC厂、芯片厂、AI初创、行业方案商、通用方案商、跨界者)的差异化在于软件生态,谁能提供开箱即用的智能体工作流(如企业知识库、法务财务Agent),谁就能在竞争中胜出。

阅读全文

在 Modal 上部署 GLM-5.2-FP8 (700B MoE):8x H200 无服务器架构、权衡与实战经验

智谱AI发布了GLM-5.2,一个针对长程规划、复杂软件工程和高密度推理优化的700B参数混合专家推理模型,在SWE-bench Pro和GPQA等基准上超越或媲美Claude 3.5 Sonnet和GPT-4o等闭源模型。该模型FP8检查点权重高达703.74 GiB,需要8个NVIDIA H200 GPU(每个141GB HBM3e显存)集群才能运行。本文详细介绍在Modal无服务器GPU平台上使用vLLM部署GLM-5.2-FP8的架构、成本与实战经验。量化格式选择中,FP8在8-GPU单节点上能保留99.2%的原始智能,生成速度比INT8快1.5至2倍,而INT4精度损失严重,BF16无法单节点运行。成本方面,Modal无服务器模式按需缩放至零,20分钟开发周期实际成本约12美元,相较RunPod等传统租用平台具有显著弹性优势。自托管解决了代码隐私合规、绕过API频率限制以及保持前缀缓存稳定性等诉求。部署过程中解决了typing_extensions冲突,通过prefetch并行预取将权重加载时间从12分钟压缩到1分钟,冷启动总时间降至4.5分钟,并选择enforce-eager模式避免CUDA图编译超20分钟的问题。文章还给出生成完整网页游戏的验证案例,展示了模型在单个上下文窗口中处理复杂工程逻辑的能力。

阅读全文