大模型工程实践

Articles tagged "大模型工程实践"

10 articles in total

FDE前沿部署工程师实战指南:从模型部署到AI Agent系统构建

本文是一份面向前沿部署工程师(FDE)的完整实战指南,系统拆解了 FDE 的核心内涵、技能树、项目实战和学习路径。文章指出 FDE 不是简单的“模型部署”,而是确保复杂 AI 能力(大语言模型、多模态模型、AI Agent、RAG)能够在真实生产系统中稳定、高效、可扩展且低成本地集成的全栈角色,其 40k 以上月薪是对“AI 应用最后一公里”复杂性的定价。核心技能体系覆盖 AI 基础(Transformer、Prompt 工程、RAG、Agent)、工程开发(Python、FastAPI 异步编程)、云原生(Docker、Kubernetes、Istio、Prometheus/Grafana)和系统设计。实战部分通过使用 vLLM 部署 Qwen2.5-7B-Instruct-AWQ 量化模型、构建 FastAPI 代理网关实现路由与监控、编写 Dockerfile 和 Kubernetes Deployment 文件完成容器化与编排,以及部署多智能体项目 My AI Town 来串联所有技能。文章还提供了常见故障排查清单(超时、OOM、推理慢、Agent 循环、Pod 重启)、最佳实践(IaC、配置分离、可观测性、成本优化、降级策略)及三阶段学习路径(基础巩固、核心技能、项目实战),并解析了面试考察的系统设计、故障排查和工程协作等方向,为求职者提供了从零到就业的路线图。

Read More

我对 FDE 的判断:它不是驻场写 Prompt,而是把 AI 项目变成产品

本文作者浪人李白对前线部署工程师FDE的核心职责进行了重新定义,认为FDE不是简单的驻场写Prompt,而是将模糊的AI业务问题转化为可复用产品能力的机制。文章提出了FDE需要完成的三次关键转换:第一,将模糊的业务诉求变成可验收的任务,通过任务机会卡和任务契约明确输入、输出、规则、例外和人工确认点;第二,将一次成功运行变成可持续运行的生产系统,涵盖运行状态记录、权限审计、异常处理和断点续跑等确定性保障;第三,将客户现场的经验沉淀为可复用的产品资产,分为产品层、行业资产层和配置层。作者用“两本账”衡量项目价值,即客户价值账(业务指标、持续使用、自主运行)和产品资产账(可复用模板、工具、评估集、交付周期缩短),强调FDE价值=客户业务结果×产品复用能力。文章还指出AI项目失败常见原因在于问题定义不清导致的“定义债”,并给出了判断项目是否值得投入FDE的三道门槛:值得做、能验证、可复用。最终结论是优秀FDE团队应让自己退出,使同类问题更快更稳解决,而不依赖英雄式人物。

Read More

前沿部署工程师(FDE)到底做什么?

本文由 OSpark.ai 于 2026 年 8 月 18 日发布,作者 Nick,清晰定义了前沿部署工程师(FDE)这一 AI 与软件落地核心岗位的职责定位与能力模型。文章指出,FDE 是连接 AI 实验室原型与客户一线业务的关键角色,其核心使命是深入现场,将产品、数据、系统与具体业务目标(如提升效率、增加收入、降低成本和风险)深度绑定,负责从理解业务痛点、设计接入客户数据与系统、开发配置 AI 应用、完成集成上线,到推动用户采纳培训、收集反馈并持续迭代优化的全流程。与传统软件工程师偏重构建通用系统与代码不同,FDE 面向具体客户场景,需在高度不确定的环境中定义并解决问题,对最终业务落地效果和商业价值指标直接负责,而非仅关注系统上线。文章将 FDE 形象地概括为完成“从技术可行到真正产生业务结果”最后一公里的关键执行者,所需能力涵盖软件工程、系统集成、数据处理、云与 API、AI 应用开发、产品思维及客户沟通,是典型的复合型技术交付角色。

Read More

Jetson Orin 8GB 部署 TensorRT-Edge-LLM:Qwen2.5 从安装到 OpenAI 兼容服务全流程(11 个坑血泪实录,保姆级实战)

本文记录了在Jetson Orin Nano Super DevKit 8GB(8GB统一内存)上,使用NVIDIA TensorRT-Edge-LLM v0.6.0部署阿里通义千问Qwen2.5-0.5B-Instruct的全流程,从Python工具链与C++ Runtime安装、ONNX导出(plugin模式)、TensorRT引擎构建,到用FastAPI封装成OpenAI兼容HTTP服务,并详细剖析了11个工程踩坑点。核心经验包括:必须锁定v0.6.0以匹配JetPack 6.2和TensorRT 10.3.0.30;pip安装需用--no-deps避免onnx版本冲突;导出时绝对禁用--trt_native_ops。8GB设备硬性构建上限为0.5B模型,1.5B模型因embedding表固定占445MB,在autotuner阶段因NvMap连续空闲块(lfb)不足导致OOM,通过重启整机、切换无桌面模式及MAXN功耗模式等策略成功构建。推理验证显示生成速率21.9~30.5 tok/s(平均约26.5 tok/s),TTFT约1.9s,峰值内存4.23GB(55.7%),功耗约15.2W,GPU利用率99%。文章强调构建期内存远大于推理期,同架构Orin设备间引擎可直接迁移,为边缘端AI部署提供了详实、可复现的避坑指南。

Read More

用友焕新,从企业软件到企业AI,并重磅发布”AI+X”的BIP 6

2026年8月8日,在南京举行的2026全球商业创新大会上,用友网络正式宣布从“企业软件”向“企业AI”的战略焕新。用友董事长兼CEO王文京提出,企业数智化已进入以“智能化”为重心的下半场,并发布“AI+X”核心理念下的全新产品矩阵。本次转型的旗舰产品为用友BIP 6,其从传统的“X+AI”辅助模式跃迁至“AI+X”智能体驱动模式,并一次性推出五大AI原生新品:YonWork企业AI工作台、YonData企业AI数据智能体、YonCode企业级AI Coding平台、用友BIP穿透式监管平台及YonOnto企业本体平台。BIP 6覆盖财务、人力等全业务域,构建了63个垂直领域智能体和超2.6万个服务接口。为解决大模型落地中的数据安全与价值衡量难题,用友同步发布了“数据不出域”的软硬一体企业AI盒子,并组建FDE(前沿部署工程师)团队,以业务成效为导向与佰工钢铁、复星集团等企业深度共创。此外,用友还推出AI BaaS业务运营服务,率先从财务领域外包切入,按成果收费。大会数据显示,佰工钢铁依托BIP实现吨钢成本降低82元;扬帆实业智能报价效率提升几十倍;某央企穿透式监管平台覆盖超500个主体,排查成本下降60%。用友BIP已服务6.8万家大型和中型企业,并成为国内升级替换国际厂商ERP系统的主要选择,智迁方案可将迁移周期缩短85%,数据准确率达99.9%。此次战略升级,标志着用友致力于引领千行百业从流程辅助工具时代,全面迈入以AI驱动业务增长的新纪元。

Read More

第一批做FDE的人,离高薪差远了

本文深入报道了Forward Deployed Engineer(前线部署工程师)这一新兴职业在国内的真实生存现状,反驳了培训机构“零基础年薪百万”的炒作。文章指出,尽管大模型兴起带动了企业AI落地的强烈需求,使得FDE招聘量大增(美国Indeed数据显示相关岗位从2025年4月的643个增至2026年4月的5330个,同比增长729%),但第一代FDE从业者普遍面临收入远不及预期、市场标准缺失和高强度劳动的挑战。通过采访五位背景各异的FDE从业者——包括00后全职员工冯又又、自由职业者82LSF、日薪200元的实习生哲伟、服务亿元级营收企业的创业者XIAO以及社群发起人Lawted,文章揭示了FDE的真实工作远不止写代码,更多是驻场梳理混乱的业务流程、清洗散落在微信和Excel里的数据、培训员工和建立信任。商业模式尚未定型,有人按项目收费,有人尝试订阅服务和降本抽成,但企业往往只愿为结果买单。FDE被从业者称为AGI的“补丁”或过渡性载体,其核心价值在于跨越AI产品与企业业务之间的落地鸿沟,所需的是技术、业务和沟通能力的复合叠加,目前仍处于“有生意、没行业”的早期阶段。

Read More

Forward Deployed Engineer (Inference & Post-Training) - Mandarin Speaking

本文是 Together AI 通过 Zero G Talent 发布的一份面向新加坡的招聘启事,岗位为会说普通话的前线部署工程师(Forward Deployed Engineer,FDE),专门负责推理(Inference)与后训练(Post-Training)方向。该职位不是简单的解决方案架构师替代品,而是定位于深度领域专家,需要与解决方案架构师协同工作。核心职责围绕推理引擎优化展开,涉及根据硬件配置、模型架构和负载特征选型、配置并优化主流推理引擎(如 vLLM、TensorRT-LLM、SGLang)。具体技术工作包括:调整 KV Cache、应用推测解码、确定最佳张量并行度与量化策略,以达成严苛的吞吐量和延迟指标。后训练方面,候选人需亲自执行 RL 训练任务并优化系统架构,指导客户完成 LoRA、SFT、DPO、RLHF 与 GRPO 等全流程管线搭建,助力客户从实验阶段跨入生产环境。此外,FDE 还需负责战略客户的长期技术健康度,确立客户入驻平台的基线配置以缩短价值实现时间,并代表一线经验反向驱动产品路线图的演进。申请者须具备 5 年以上技术经验,对开源大模型生态有广泛认知,具备专家级推理引擎实操和诊断能力,并拥有扎实的 Python 编码功底。文章强调 Together AI 是一家研究驱动型企业,致力于通过软硬件协同设计降低 AI 成本,其团队贡献了 FlashAttention 等知名技术。岗位要求为新加坡永久居民或公民,提供初创股权及远程灵活办公选项,发布时间为 2026 年 8 月 4 日。

Read More

腾讯混元AI Infra如何优化Hy3 Preview:一次大模型推理性能提升的技术拆解

本文详细介绍了腾讯混元AI Infra推理团队针对旗舰大模型Hy3 Preview(采用GQA+MoE混合架构,原生支持256K超长上下文)在NVIDIA Hopper卡上的推理性能优化实践。面对Hopper卡算力较低、显存紧凑等限制,团队从算子优化与融合、并行策略、多级缓存、MTP异步调度、量化与稀疏五大维度进行全栈优化。在算子优化上,提出动态调度负载均衡的Attention算子(混合长度batch加速1.59x-1.76x),双BF16重构FP32 Router GEMM(加速2.86x-3.22x),FusedMoE流水线重构(相比vLLM等加速1.2x-1.6x)。算子融合方面,实现Fused Rope+Norm+Quant+Store KV(加速约5x),Fused AllReduce+Norm+Add(加速1.68x),采样融合算子(加速2.5x-5.5x),以及Gemm+Comm通算融合(加速1.68x-1.81x)。并行策略上,采用TPSP Prefill优化(TTFT降低24.5%-29.9%)和DP+EP Decode架构(吞吐提升15.7%-44.7%)。多级缓存构建GPU-CPU-KVStore三级体系以降低重复Prefill。MTP异步调度优化消除CPU气泡,端到端提升10%-20%。量化方面,在AngelSlim框架中通过GPTQ权重重建、激活平滑、Hadamard旋转和QAT微调实现W8A8C8无损量化,吞吐提升28%+;并应用Stem稀疏注意力算法及HPC-BSA算子,在128K上下文下Prefill延迟降低3.6倍,精度持平。文章为Hopper架构下大模型推理部署提供了系统级优化范本。

Read More

Qwen3-32B本地部署实战:LoRA微调+vLLM推理+Docker交付

本文是一份针对阿里巴巴通义千问系列开源大模型 Qwen3-32B 的本地化工程部署与微调实战指南。文章围绕“LoRA 微调 + vLLM 推理 + Docker 容器化交付”这一技术路径,详细记录了从环境准备、模型下载与格式转换、Docker 镜像构建、vLLM 高性能推理服务上线、到基于 Swift 框架的 LoRA 领域微调及效果验证的完整流程。核心观点强调 Qwen3-32B 作为“甜点规模”模型,在 A100-80G 单卡上即可完成推理,双卡可实现高吞吐服务,且 MMLU、CMMLU 等评测稳居开源第一梯队。技术选型深度对比了 vLLM 与 TGI 的架构差异,指出 PagedAttention 机制使 32K 长文本推理显存占用比 TGI 低 58%,吞吐量高出 2.8 倍。在 LoRA 配置上,通过梯度分析锁定 q_proj 和 v_proj 为核心目标模块,并给出 balanced 方案(q_proj+v_proj+gate_proj+down_proj,rank=8)在显存占用 31.5GB 下实现 ROUGE-L 提升 4.1 的实测数据。文章还重点描述了 Docker 从零构建的可复现策略、应对冷启动的预热技巧、QWEN 官方 AWQ 量化加速方案,以及显存溢出、模型加载失败等血泪教训。本文面向面临模型本地化、业务定制与生产环境落地的工程师,提供了可复现、可迭代、可交付的完整工作流,具有极强的工程参考价值。

Read More

LLMOps 实战:设计、部署和管理高级聊天机器人的框架

本文是一篇系统文献综述(SLR),分析了39篇关于基于大语言模型(LLM)的聊天机器人实现的研究,旨在总结架构、框架、最佳实践和评估指标。研究探讨了六个关键问题,识别出常见的架构模式,包括客户端-服务器架构和检索增强生成(RAG),并列举了广泛使用的模型,如GPT家族、BERT、LLaMA和Mistral等开源模型。论文评估了这些模型在不同领域的表现,强调微调、提示工程和嵌入技术对准确性和领域相关性的影响。关键评估指标涵盖准确性、用户满意度、内容质量、安全性和效率。伦理方面的讨论包括数据治理、偏见缓解和公平审计,以确保负责任地部署LLM聊天机器人。最后,综述分析了性能、成本效率和可扩展性之间的权衡,为未来的LLM聊天机器人应用研发提供了一个综合框架。文章发表在IEEE Transactions on Knowledge and Data Engineering期刊上,作者为Eindhoven University of Technology的Willem Jan Van Den Heuvel,属于LLMOps领域的学术贡献。

Read More