模型部署

Articles tagged "模型部署"

38 articles in total

Tobias B.

本文是一份Tobias B.的职业履历简介,展示了他从McKinsey & Company到OpenAI的职业发展路径。Tobias B.目前担任OpenAI的Technical Deployment Lead,属于Forward Deployed Engineering(FDE)团队,常驻德国慕尼黑,于2026年2月作为慕尼黑办公室创始成员加入。他在OpenAI负责与全球企业合作,将前沿AI模型进行复杂的端到端生产环境部署,涵盖从发现、范围界定到构建、推广和采用的完整流程,并与产品和研究团队紧密合作,确保真实世界的部署反馈能推动平台演进。此前,他在McKinsey & Company任职近十年,最高担任Principal Software Engineer II和Director of Software & Cloud Engineering,领导了McKinsey内部名为Lilli的文档自动化平台,特别是专注于PowerPoint的Agentic AI解决方案,为全球超过45,000名同事提供服务,并主导了将遗留RAG系统重新架构为具备语音、画布和多智能体编排能力的全模态智能体系统的工程工作。他在McKinsey期间还服务了超过30个客户组织,涉及亚太、欧洲、中东及美国地区。他毕业于UCL计算机科学硕士专业,拥有哈佛大学研究学者经历,并多次在各类黑客马拉松中获奖。

Read More

高级前向部署工程师

Hippocratic AI 发布高级前线部署工程师(Senior Forward Deployed Engineer)招聘信息,工作地点位于加利福尼亚州门洛帕克。Hippocratic AI 是一家专注于医疗健康领域的安全大语言模型(LLM)平台公司,已累计获得4.04亿美元融资,投资方包括 Andreessen Horowitz (a16z)、General Catalyst、Kleiner Perkins、NVIDIA NVentures 等顶级风投和医疗系统。该岗位要求候选人具备5-7年软件工程经验和专家级 Python 能力,深度掌握 LangChain 和 LangSmith 等 LLM 框架,能够架构和实现复杂的人工智能系统,包括先进的检索增强生成(RAG)系统、工具调用、模型上下文协议(MCP)集成模式以及 LLM-as-judge、多轮推理等高级大模型技术。核心职责包括设计先进 AI 解决方案、确保生产环境的可靠性、前瞻性解决客户问题以及指导初级工程师。理想的候选人需具有计算机科学学士学位,拥有医疗 IT 经验(如 EHR 集成、FHIR、HL7)或开源贡献者优先。该职位隶属于产品/设计部门,为全职岗位,旨在通过构建尖端 AI 系统推动医疗健康领域的创新和运营变革。

Read More

Seongeun So

本文为资深AI技术专家Seongeun So的LinkedIn职业档案全览。Seongeun So拥有超过13年行业经验,当前担任OpenAI的AI Deployment Engineer。此前,他在Google担任AI Forward Deployed Engineer (FDE),专注于日本及亚太地区(JAPAC)的AI模型实战部署与技术落地。其职业生涯横跨全球顶尖科技巨头与本土初创公司:他曾任Amazon Web Services (AWS)解决方案架构师,为全球公共部门客户提供AI/ML上云咨询;创立的AdTech公司Remake Digital获得Kakao ventures等投资,并担任CTO开发了自动化广告设计引擎Crolo和Databrush;在NAVER Corp作为研究工程师期间,他主导了CLOVA AI音箱的对话系统研发,并开发了使用视频目标检测追踪技术的KBO本垒打识别系统;早期还在SELVAS AI Inc.从事手写字符识别(OCR)、LSTM及CNN等经典机器学习算法的研究。Seongeun So毕业于光州科学技术院(计算机科学硕士)及首尔科学技术大学(电气工程学士)。其近期在LinkedIn发布的动态显示,他对RAG系统的幻觉缺陷、开源代码债务、LLM安全护栏及AI代理的‘自主研究’(autoresearch)等前沿话题有深入洞察,展现了从底层算法研发到顶级商业落地的完整FDE能力模型。

Read More

面向工业AI的边缘计算架构:在工厂车间中生存的5种模式

KGT Solutions 基于在钢铁厂、糖精炼厂和发电站两年的边缘AI系统部署经验,提出了五种经过工厂验证的边缘计算架构模式。模式一为分层边缘与云同步架构,边缘端负责毫秒级实时推理(如轴承故障预测需秒级告警),云端每15分钟批量同步原始数据进行模型重训练和跨设施对比分析。模式二采用联邦特征存储,在边缘端将不同传感器(轴承振动25.6kHz、电机电流波形10kHz、锅炉温度每秒一次)的异构信号归一化为统一特征向量,使单一异常检测框架可跨设备类型部署。模式三实施影子部署与自动回滚机制,新模型与现有模型并行推理48小时,若误差率相对基线超过5%则自动回滚,该模式已避免三次生产事故。模式四建立三级告警体系——Watch仅仪表盘显示、Plan自动创建维护工单、Act Now通过短信和邮件通知值班主管并自动核查备件库存,成功消除告警疲劳并实现与CMMS的深度集成。模式五强调共享平台与隔离模型的架构原则,Vigibelt系统从单一传送带故障预测器演进为统一平台,集成OPC-UA、MQTT、Modbus协议数据摄取、时序特征存储、容器化模型服务和A/B测试能力,使后续用例部署周期从数月缩短至数周。文章核心观点为:在工业AI部署中,平台层投资优先于模型层,一个基础模型在稳健平台上的价值远超缺乏集成、告警和回滚能力的先进模型。

Read More

Forward Deployed Engineer (Inference & Post-Training) - Mandarin Speaking

本文是 Together AI 通过 Zero G Talent 发布的一份面向新加坡的招聘启事,岗位为会说普通话的前线部署工程师(Forward Deployed Engineer,FDE),专门负责推理(Inference)与后训练(Post-Training)方向。该职位不是简单的解决方案架构师替代品,而是定位于深度领域专家,需要与解决方案架构师协同工作。核心职责围绕推理引擎优化展开,涉及根据硬件配置、模型架构和负载特征选型、配置并优化主流推理引擎(如 vLLM、TensorRT-LLM、SGLang)。具体技术工作包括:调整 KV Cache、应用推测解码、确定最佳张量并行度与量化策略,以达成严苛的吞吐量和延迟指标。后训练方面,候选人需亲自执行 RL 训练任务并优化系统架构,指导客户完成 LoRA、SFT、DPO、RLHF 与 GRPO 等全流程管线搭建,助力客户从实验阶段跨入生产环境。此外,FDE 还需负责战略客户的长期技术健康度,确立客户入驻平台的基线配置以缩短价值实现时间,并代表一线经验反向驱动产品路线图的演进。申请者须具备 5 年以上技术经验,对开源大模型生态有广泛认知,具备专家级推理引擎实操和诊断能力,并拥有扎实的 Python 编码功底。文章强调 Together AI 是一家研究驱动型企业,致力于通过软硬件协同设计降低 AI 成本,其团队贡献了 FlashAttention 等知名技术。岗位要求为新加坡永久居民或公民,提供初创股权及远程灵活办公选项,发布时间为 2026 年 8 月 4 日。

Read More

在 JetPack 7.2 和 Jetson AGX Orin 上使用 TensorRT 部署全权重 GR00T N1.7

本文来自 Seeed Studio Wiki,是一篇详细的技术教程,指导如何在 JetPack 7.2 和 Jetson AGX Orin 边缘计算设备上,使用 TensorRT 部署全权重的 NVIDIA Isaac GR00T N1.7 机器人策略模型。与以往仅加速 DiT 组件的工作流不同,本教程实现了对 Vision Transformer (ViT)、Large Language Model (LLM)、视觉-语言自注意力、状态编码器、动作编码器、DiT 动作专家和动作解码器全部七个组件的 TensorRT 引擎构建。教程采用本地 LeRobot 数据集和本地 Qwen3-VL-2B-Instruct 主干模型,实现了完全离线的推理流水线,避免了 Hugging Face Hub 的网络依赖。经过验证,整个 TensorRT 构建过程耗时约 3 分 37 秒,最终生成七个 .engine 文件。在推理性能方面,全 TensorRT 流水线处理每个 16 步动作预测块耗时约 0.2755 秒,相当于每秒 3.63 个块。文章还提供了 PyTorch 与 TensorRT 输出的数值对比,结果显示最终动作的余弦相似度高达 0.997426,验证了模型转换的精度。此外,文章详细列出了存储与内存规划(至少需要 45-50 GB 空间)、环境配置、故障排查以及连接实体机器人前的安全警告和检查清单,是一份从模型导出到边缘推理的完整工程实践指南。

Read More

在 JetPack 7.2 上部署 TensorRT Edge-LLM

本指南来自 Seeed Studio Wiki,完整记录在 NVIDIA JetPack 7.2 上部署 TensorRT Edge-LLM v0.9.1 的流程。TensorRT Edge-LLM 是 NVIDIA 面向嵌入式 Jetson 平台的大语言模型、视觉语言模型和多模态模型推理栈,本版本于 2026 年 7 月 31 日更新,官方支持 Jetson Orin 和 Jetson Thor。部署分两阶段:首先在 x86 GPU 主机(Ubuntu 22.04/24.04、CUDA 12.x/13.x、Ampere 以上 GPU)上克隆 TensorRT Edge-LLM v0.9.1,通过 `tensorrt-edgellm-export` 将 Hugging Face 上的 Qwen3-0.6B 检查点导出为 ONNX 计算图;随后将 ONNX 目录传输至 Jetson 设备,在 JetPack 7.2 与 CUDA 13.2 工具链下,使用 CMake 以 `jetson-orin` 或 `jetson-thor` 为目标构建 C++ 运行时和示例,然后运行 `llm_build` 从 ONNX 构建 TensorRT 引擎,并通过 `llm_inference` 进行推理,输出示例显示模型成功回答“The capital of the United States is Washington, D.C.”。指南详细说明了 Jetson Orin 支持的精度仅为 FP16、INT8、INT4,不支持 FP8 等更高精度,并强调 JetPack 6.2 的引擎不可直接复用。对于 INT4 量化,推荐使用 AWQ 或 GPTQ 预量化检查点并采用外部化权重选项以降低内存压力。此外,还提供了基准测试命令、与 JetPack 6.2 的差异对比以及常见故障(如 CMake

Read More

前向部署工程师解决哪些问题?

本文系统阐述了前线部署工程师(Forward Deployed Engineer, FDE)在企业级AI与软件部署中解决的核心问题。文章指出,约95%的企业AI试点未能产生可衡量的利润影响,根源在于部署失败而非模型质量。FDE的核心价值是弥合AI演示与生产环境之间的“最后一公里”鸿沟,他们深入客户内部,直接面对遗留系统、混乱数据、定制化配置等真实环境约束。文章详细解析了FDE日常解决的九大具体问题:1.遗留系统与混乱企业数据集成;2.AI演示与生产系统的性能差距;3.每家企业的定制化需求;4.售后无人对最终结果负责的交接真空;5.持不同“成功”定义的内部利益相关方分歧;6.现场与产品团队间的缓慢反馈循环;7.技术可行但用户采用率低;8.生产规模下不可预测的成本;9.受监管行业的安全、合规与信任差距。文章还将FDE与解决方案工程师、销售工程师和客户成功工程师进行了清晰的职责界定,强调了FDE对部署成果端到端负责的独特属性,而非仅负责售前演示或售后关系。

Read More

AI部署工程师职位 - 迈阿密,佛罗里达州

Robert Half 发布了一份位于美国佛罗里达州迈阿密的 AI Deployment Engineer 招聘信息,职位性质为合同制。该岗位的核心职责是将机器学习和生成式 AI 模型从原型阶段全面推向生产环境,要求工程师负责构建和维护 MLOps 管道,以实现训练、部署与版本管理的自动化。技术上,候选人需要掌握 Docker 和 Kubernetes 进行容器化与工作负载编排,并将模型及 API 集成到应用程序和业务工作流中。同时,该职位要求优化模型性能、延迟和基础设施成本,并实施生产环境的监控、日志与告警系统。任职资格方面,要求 3 年以上 ML 工程、MLOps 或 DevOps 相关经验,具备扎实的 Python 生产部署能力,并熟悉 AWS、Azure 或 Google Cloud Platform 等主流云平台,以及 CI/CD 管道和基础设施即代码。优先资格包括部署大语言模型经验、使用 LangChain 框架、熟悉向量数据库和检索增强生成技术,以及具备 MLflow、Amazon SageMaker 或 Vertex AI 等模型服务工具的实践经验。该职位强调 AI 系统的安全与治理标准,反映了企业级 AI 落地的可靠性、可扩展性与安全性要求逐渐成为部署工程师的核心评估标准。

Read More

2026年AI工程技能地图

《The 2026 AI Engineering Skills Map》是由DataTalks.Club创始人Alexey Grigorev主讲的一次职业培训课程,定于2026年8月25日举行。课程基于对约5000个真实AI工程岗位的市场分析,直击当前雇主需求的核心:像检索增强生成(RAG)和智能体(agents)等工程化技术正成为高价值技能,而纯模型调参类需求正在退潮。Alexey Grigorev将绘制从传统模型训练到现代软件集成的角色职责地图,覆盖数据科学家、机器学习工程师、平台工程师等工作流如何重新划分。课程还会解剖一线科技公司的实际生产环境,展示AI团队如何结构化、部署和扩展系统。Alexey Grigorev本人拥有15年软件工程和12年机器学习经验,曾是OLX Group和Simplaex的资深数据科学家,Kaggle大师,在NIPS'17 Criteo Challenge中夺冠,并出版了《Machine Learning Bookcamp》等技术读物。其创建的Zoomcamp系列已培训超过10万学生。本次课程旨在帮助工程师甩掉过时学习清单,精准定位最具市场价值的AI工程能力,从而在快速演变的岗位市场中抢占先机。

Read More

OpenAI的FDE将破损的智能体转化为可交付的系统

本文是一篇基于 OpenAI 推出前沿部署工程师(FDE)模式的行业实践总结。作者指出,多数智能体(agent)项目失败不在演示阶段,而在从“看起来可行”到实际生产部署的过渡期,核心痛点是缺乏专人负责部署、监控、回退路径和用户采纳。OpenAI 为此成立部署公司,融资 40 亿美元,收购咨询公司 Tomoro,并派驻 FDE 深入客户现场,将部署与集成工作内化为产品的一部分。文章进一步对比 Anthropic 与 Blackstone 的合作,说明模型厂商正从仅提供 API 转向直接参与企业实施,行业 AI 本质上是附带软件的服务业务。作者提炼了 FDE 模式的关键价值:缩短演示与真实环境之间的差距、消除虚假信心、将部署习惯制度化。文中提供了可复用的“Agent 部署手册”模板,涵盖目标、责任人、客户工作流、就绪检查清单、故障模式、部署步骤、上线后循环和成功标准,强调将部署工件纳入代码仓库,并建立快速反馈渠道。全文传递的核心信号是:智能体项目的未来不仅依赖更好的模型,更依赖可重复的部署纪律,这一观点对创业团队和企业实施者均有直接借鉴意义。

Read More

前向部署工程师,Google Cloud,AI 专家

本文是 Valtech 公司发布的 Forward Deployed Engineer(FDE,前线部署工程师)招聘信息,工作地点为加拿大魁北克省,要求流利英语。该岗位需要深度嵌入企业客户团队,将 Google Cloud 与前沿 AI 能力转化为生产级系统,而非仅担任顾问角色。核心职责包括:与客户工程团队协作,使用 Vertex AI 和 Gemini 模型架构、编码并交付多智能体系统、MCP 服务器、RAG 管道与安全护栏;设计检索增强生成架构,优化向量数据库与嵌入以解决幻觉问题;构建连接 Google AI 产品与客户遗留系统、身份、安全边界的集成方案;使用 Google ADK 或 LangGraph 实现 ReAct、自反思、分层委派等多智能体模式;构建评估与可观测性框架,关注延迟、每次请求成本等指标;调试高流量环境下的智能体逻辑与工具选择;并在项目结束后推进向客户团队的有序交接。必备资格包括计算机相关学士学位、5年以上 Python/TypeScript 软件开发经验、在 GCP 上架构部署 AI 系统的实操经验(Vertex AI、Gemini、BigQuery、Cloud Run 等)、构建生产级 RAG 与智能体解决方案的经验、使用 Terraform 等 IaC 工具部署云资源的经验、领导技术发现会议的能力、集成企业 IT 基础设施的经验,以及最高 50% 差旅的适应能力。优先资格涵盖 AI 硕士/博士、多智能体框架(ADK/LangGraph/CrewAI)、MCP 服务器经验、LLM 原生运营指标优化、高流量生产系统排障、数据主权与安全治理架构、AI 辅助开发倡导经验及 GCP 多项专业认证。Valtech 提供远程工作、健康保险、500 加元个人账户、退休计划匹配、弹性假期等福利,强调多元包容文化。该职位清晰呈现了 FDE 角色在 AI 工程落地中

Read More