行业实践

让AI应用在现实中发挥作用所需了解的知识

核心结论:Andrew Ng在本文中系统阐述了构建和部署真实可用AI应用所需的核心技能体系,回应了AI工程化的关键挑战:如何在不可预测的AI组件之上构建可靠的软件系统。文章指出,AI应用与传统软件的本质区别在于LLM输出的不确定性,这使得开发过程成为高度迭代的“构建-检查-决策”循环,而非线性规划。核心技能分为六个维度:(1)LLM基础——理解分词、生成机制、上下文窗口、缓存命中、知识截止、推理强度、采样参数及工具调用等,以做出正确的模型选型和微调决策;(2)数据接地——超越早期RAG向量搜索,掌握向量索引、知识图谱、结构化数据语义层等多种技术,构建从文档(文本、PDF、HTML、图片)到LLM就绪输入的清洗管道;(3)智能体系统构建——涵盖从预定工作流到自主决策循环的架构光谱,涉及工具选择(MCP、CLI、沙箱执行环境)、记忆架构、长期会话上下文管理、多智能体编排及生产安全(护栏、对抗输入、数据外泄防范);(4)评估驱动开发——Andrew Ng认为这是区分AI工程师水平的最重要特质,需要结合系统轨迹分析、探索性数据分析与产品业务洞察来设计评估指标,并根据项目阶段选择确定性评估、LLM-as-a-Judge或人工评审等方法,形成驱动系统化迭代的闭环;(5)生产运维——由于不可预测性、成本和延迟的特殊性,需要建立可观测性机制跟踪性能、检测漂移、应对提示注入安全事件,并通过回归测试和CI/CD统计评估进行模型优化、蒸馏和工作流简化;(6)机器学习基础——理解监督学习和强化学习原理,掌握偏差/方差、错误分析、数据工程等核心心智框架。

核心要点
  1. AI应用与传统软件的核心差异在于输出的不可预测性,这导致开发过程高度迭代,需要工程师根据中间结果动态决策下一步方向。
  2. 评估驱动开发被视为区分AI工程师水平的最重要特质,其核心是通过系统化的评估和错误分析循环来指导开发方向。
  3. LLM的数据接地技术已从早期RAG向量搜索扩展到向量索引、知识图谱、结构化数据语义层等多种方案,工程师需根据数据表示和查询需求匹配技术。
  4. 智能体系统涵盖从预定工作流到自主决策循环的架构光谱,生产化需关注护栏、对抗输入防范、数据外泄等安全治理问题。
  5. AI应用的生产运维涉及可观测性、漂移检测、回归测试的统计评估,以及通过模型蒸馏、微调和工作流简化来优化成本和延迟。
  6. 机器学习基础中的偏差/方差、错误分析和数据工程思维仍然是驾驭不确定输出系统的核心心智框架。
面对当前AI应用落地普遍面临的“不可靠性”挑战,Andrew Ng在这篇文章中给出了系统性的解法。文章梳理了构建生产级AI应用的六项核心技能,其中“评估驱动开发”被认为是决定开发者水平的最关键特质——因为在不可预测的AI组件上构建可靠系统,靠的不是一次性设计,而是持续的评估和迭代。这篇文章没有停留在“用API做Demo”的浅层,而是深入到模型选型、数据接地、智能体架构、生产运维等真实交付场景,为正在从原型走向产品的工程师提供了一份结构化的能力地图。对于希望理解AI工程化本质的团队管理者也是一份高质量的能力评估参考。

AI应用与传统软件的核心差异在于输出的不可预测性,这导致开发过程高度迭代,需要工程师根据中间结果动态决策下一步方向。

—— 络石智能编辑部 · 编辑推荐

让AI应用在现实中发挥作用所需了解的知识

Loading the Elevenlabs Text to Speech AudioNative Player...

亲爱的朋友们,

我之前写过关于我们AI工程技能图谱的文章,其中最高级别的技能包括:(i) 构建和部署AI应用,(ii) 软件工程基础,(iii) 使用编码代理,以及 (iv) 塑造构建过程。在这封信中,我将详细阐述第一个技能。

擅长构建和部署AI应用意味着需要了解:

  • LLM基础
  • 用数据为模型提供基础
  • 构建代理系统
  • 以评估为导向的开发
  • 在生产环境中运营
  • 机器学习基础

这个技能图谱是通过分析大量职位招聘信息、结构化专家访谈和调查反馈而形成的。

AI应用与非AI软件的关键区别在于,前者的输出更不可预测。你无法预先知道LLM会输出什么,或者监督学习算法会做出什么预测。由于这种不确定性,构建AI系统比构建传统软件更具迭代性——提前规划过程更加困难。熟练的AI工程师会反复构建软件片段、检查它,并决定下一步尝试什么,采取一系列受中间结果高度影响的步骤。能够熟练地决定下一步做什么,使你能够基于不可靠的AI组件创建可靠的软件系统。这需要了解:

LLM基础。理解大型语言模型如何对输入进行分词和生成输出,可以让你了解何时可以依赖它们以及它们何时可能失败。它还能让你理解何时使用多模态模型,如何权衡上下文窗口中的内容,并推理缓存命中、知识截止日期、推理努力水平、采样参数,以及何时使用工具调用等特殊功能。理解这些基础有助于你选择合适的模型或模型组合,并在需要时应用专门技术,如微调或自托管模型。

用数据为模型提供基础。LLM需要良好的输入上下文才能产生有用的输出。使用向量搜索的RAG是早期尝试为LLM提供相关上下文的方法,但为模型提供数据基础的技术集已经显著增长。例如,你需要决定在提示中包含什么内容,与让LLM使用工具按需检索什么内容,以及哪种表示形式适合数据和搜索查询:向量索引、知识图谱,还是结构化数据(如客户记录)上的语义层。你还需要将文档(文本、PDF、HTML、图像)转换为LLM可用的输入,并设计管道以保持数据清洁和新鲜。当你了解可用于获取数据的各种技术时,你就能够更好地为LLM提供相关上下文。

构建代理系统。代理系统的范围从执行预定义LLM调用序列的工作流,到基于代理框架的系统,该框架让LLM反复决定自己的下一步行动。你需要选择架构——哪些步骤要链式连接,哪些要并行化,何时使用代码以及何时使用LLM——并设计工作流或框架,同时包含回退机制。在设计代理循环时,你还需要决定模型可以调用哪些工具(包括MCP、CLI和沙盒执行环境),使用什么记忆架构,如何在长时间会话中管理上下文,以及何时任务需要多代理编排而不是单代理架构。你还希望将有前途的原型转化为可靠、安全且安全的代理用于生产环境;这需要理解护栏、对抗性输入,以及识别和规避关键风险(如数据泄露)和治理。

代理工作流正在快速发展,你还可以从了解与你应用领域相关的前沿技术中受益,例如语音代理、计算机使用代理或生成式UI。

以评估为导向的开发。根据我的经验,区分那些擅长构建AI系统的人的最重要特质是,你是否能推动一个严格的评估/错误分析循环来驱动开发。这使你能够反复将精力集中在更有可能取得成果的方向上。我发现这是一项难以掌握的技能,因为正确的方法因项目而异,甚至根据项目阶段不同也有所不同。

构建良好的评估是一项深度技术技能。你可能会查看系统的追踪和输出,进行探索性数据分析,并将其与产品和业务洞察相结合,以决定衡量什么。你还应该了解评估的选项,例如何时使用确定性(基于代码的)评估,何时使用LLM作为评判,何时让人参与循环,以及如何评估你的评估以便不断改进它们。这些评估随后会反馈到一个迭代过程中,推动进一步开发,使进步变得系统化而非随机。

在生产环境中运营。运营AI软件与传统软件不同,原因在于其不可预测性、成本和延迟。首先,你应该知道如何构建可观测性机制,以了解系统在实际使用中的性能。你将跟踪性能、检测漂移,并快速响应模型故障和安全事件,如对抗性提示注入。建立回归测试和CI/CD需要比传统软件更多的统计评估,并且测试工作应相对于错误风险进行校准。此外,了解如何选择正确的技术组合——例如模型选择优化、蒸馏和微调,以及代理工作流简化——以优化成本和延迟也很重要,特别是当你的应用服务于许多用户时。

机器学习基础。现代LLM是使用包括监督学习和强化学习在内的机器学习技术构建的。我所认识的每一个擅长使用LLM的工程师都具备一定深度的机器学习和深度学习知识。此外,许多应用仍然需要知道如何使用机器学习——无论是别人训练的模型还是自己训练的模型。这需要了解流行的机器学习和深度学习模型及其在准确性、训练速度、推理速度等方面的权衡,并理解如何设计训练和评估这些模型所需的数据。机器学习的偏差/方差、错误分析和数据工程概念——所有这些都是在处理输出不确定的系统时的核心思维框架——仍然是在AI系统开发中做出广泛决策的关键。

要擅长构建和部署AI系统,有很多东西需要学习。这是一个具有显著技术深度的领域。但你学到的每一点都会帮助你成为更好的AI工程师,并构建更令人兴奋的应用。这些技能的强有力补充是软件工程。我将在下一封信中对此进行更多阐述。

继续构建!

Andrew

标签

相关主题

专家点评

本文由编辑团队收录整理,内容来源于公开信息,仅供参考。

常见问题

构建真实可用的AI应用需要掌握哪些核心技能?
根据Andrew Ng的梳理,构建和部署AI应用需要掌握六项核心技能:LLM基础(理解分词、生成机制及模型选型)、用数据接地模型(RAG、向量索引、知识图谱等技术)、构建智能体系统(工作流编排、工具调用、记忆架构、安全护栏)、评估驱动开发(建立系统化的评估和错误分析循环)、生产环境运维(可观测性、漂移检测、回归测试、成本延迟优化)以及机器学习基础(监督学习、强化学习、偏差/方差等核心概念)。
AI应用开发与传统软件开发最本质的区别是什么?
AI应用与传统软件的关键区别在于输出的不可预测性——你无法预先知道LLM会生成什么内容。这种不确定性使得AI系统开发是一个高度迭代的过程,而非线性规划。开发者需要反复构建、检查中间结果,再决定下一步方向。因此,决定“下一步做什么”的判断力成为AI工程师的核心能力,而建立评估驱动的错误分析循环是实现这种判断的系统化方法。
什么是评估驱动开发,为什么它被认为是AI工程最重要的技能?
评估驱动开发的核心是建立一个闭环:分析系统轨迹和输出,结合探索性数据分析与业务洞察决定测量指标,然后选择评估方法(基于代码的确定性评估、LLM-as-a-Judge或人工评审),最后将评估结果反馈到迭代开发中。Andrew Ng强调,这是区分AI工程师水平的最重要特质,因为它让开发方向的选择从“随机探索”变为“系统化推进”。

相关文章

安德鲁·吴的AI工程技能地图:10,000个职位招聘对2026年招聘和角色设计意味着什么

Andrew Ng 于 2026 年 8 月发布了 AI Engineering Skills Map,基于对 10,000 份招聘信息的分析,将 AI 工程技能组织为两层架构:4 项核心技能(包括提示工程作为大模型交互的子技能)和 6 项扩展技能。核心技能是所有 AI 工程师的通用基线,而扩展技能则定义了高级职位和实际的交付能力。该框架最具冲击力的结构性变化是将提示工程从独立职业路径重新定位为核心技能的一个组成部分,这一决定直接影响了那些被专门雇佣为“Prompt Engineer”的角色。文章为招聘经理提供了具体的应用指南,包括如何编写分层的职位描述(将核心技能设为硬性要求,根据项目阶段选择扩展技能)、设计分阶段的面试流程(初期筛选核心技能,现场评估扩展技能)以及构建职业阶梯(助理工程师掌握核心技能,高级工程师需精通架构决策与多项扩展技能)。此外,文章指出该技能图谱不仅是一套分类法,更是一种组织设计工具,迫使企业重新审视其 AI 角色设置与团队拓扑结构的合理性。作者所在的 Traversaal.ai 也在招聘前线部署工程师以解决实际生产中的 AI 问题。

阅读全文

前部署AI架构师 IRC296102

2026年8月6日,GlobalLogic发布了一则前线部署AI架构师(Forward Deployed AI Architect)招聘信息,工作地点位于美国亚特兰大、奥斯汀、纽约、西雅图等10个城市,支持远程办公,年薪范围为16万至22万美元。该职位要求15年以上软件工程、架构或解决方案经验,兼具产品端交付与客户面对面技术顾问能力。核心职责是通过GlobalLogic的VelocityAI SDLC平台,整合Claude Code、OpenAI Codex、GitHub Copilot、Cursor、LangChain、AutoGen、LlamaIndex、Semantic Kernel、MCP、RAG及向量数据库等工具,帮助客户从传统的工单与冲刺驱动交付,转向意图驱动的自动规划、编码、测试、文档与验证流水线,进而缩短交付周期、加速代码生成与评审等环节。任职者需具备AI治理、人机协同控制、可观测性与安全等生产就绪能力。GlobalLogic作为日立集团旗下公司,自2000年起专注数字工程,此招聘反映了企业对融合深度技术、客户洞察与AI加速实践的前线部署专家的强烈需求,也指示了AI原生软件工程落地的关键技能与市场薪酬水平。

阅读全文

Forward Deployed Engineer IRC299929

GlobalLogic,一家日立集团(Hitachi)旗下的数字工程公司,于2026年8月6日发布了一则名为“前线部署工程师”(Forward Deployed Engineer, IRC299929)的高级职位招聘信息。该职位名为“前线部署 AI 架构师”(Forward-Deployed AI Architect),工作地点位于印度的班加罗尔、钦奈、古尔冈、海得拉巴、那格浦尔、诺伊达和浦那。 该角色的核心目标是将人工智能深度嵌入企业客户的软件交付生命周期(SDLC),从传统的 Scrum 周期转向由意图驱动、高度自主的交付模式。候选人需要直接与客户工程团队合作,通过动手构建架构、设计智能体工作流(Agentic Workflows)和实现可量化的交付成果来证明 AI 主导的工程价值。 职位要求候选人具备 10-15 年以上的软件工程和架构经验,并且必须精通 SDLC、DevSecOps、敏捷/Scrum 框架。关键的技术要求包括对现代 AI 技术栈的实际操作能力,具体涉及 Claude Code、Cursor、Windsurf、GitHub Copilot、LangChain、AutoGen、LlamaIndex、Semantic Kernel、模型上下文协议(MCP)、检索增强生成(RAG)和向量数据库等工具与框架。此外,还需要掌握提示工程、工具调用、函数调用、多智能体编排等前沿技能。该职位提供混合办公模式。

阅读全文

前沿部署AI产品架构师 - APAC IRC300053

这是一份由数字工程公司GlobalLogic发布的面向APAC地区的招聘启事,职位名称为Forward-Deployed AI Product Architect,工作地点分布在印度的班加罗尔、钦奈、古尔冈、海得拉巴、那格浦尔、诺伊达和浦那。该角色定位于核心产品工程、AI编排和高影响力客户端部署的交叉点,要求候选人直接嵌入客户的工程团队,成为可信任的技术顾问。其核心职责是桥接GlobalLogic的AI平台能力与高度受监管的金融科技、金融服务及企业SaaS客户的工作流,要求具备15年以上软件工程经验,并至少有5年交付大规模金融或企业SaaS产品的经验。技术方面强调掌握现代AI技术栈,需要可以实际动手构建和评估自研AI Agent框架及RAG管道,熟练使用LangChain、LlamaIndex、AutoGen、Semantic Kernel、OpenAI、Claude Code、Cursor、Google Antigravity,以及Model Context Protocol(MCP)和向量数据库等工具。具体的任务场景包括:设计意图驱动的自主代理工作流用于金融信用分析或欺诈检测,构建能从SEC文件和交易账本等海量数据中检索的上下文感知RAG架构,以及通过MCP建立安全抽象层来连接遗留核心银行系统。该职位同时要求候选人能够向CTO、首席风险官等高管展示技术架构和业务成果,推动以AI加速SDLC,用自主交付循环替代传统冲刺周期,并建立符合SEC、GDPR、SOC2标准的AI治理和安全护栏。拥有前部署工程师、首席解决方案架构师或技术顾问背景的候选人将被优先考虑。

阅读全文

前向部署 AI 工程师

本文是 Keyrus 集团于 2026 年 8 月 1 日发布的一份“Forward Deployed AI Engineer”(前线部署 AI 工程师)招聘启事。Keyrus 是一家拥有 30 年历史、在泛欧交易所上市的国际咨询集团,拥有 2800 名员工,业务遍布 28 个国家,核心理念是“Architected Intelligence”(架构设计的智能)——即 AI 本身不直接变革业务,通过将智能嵌入企业核心流程、构建企业级智能操作系统的工程化设计才能创造价值。该 FDE 角色定位于高级个人贡献者,核心任务是在客户一线,将模糊的 AI 应用意图在数周内转化为生产级、可衡量业务价值的解决方案,而非仅停留于实验性模型。文章详细列出了职责流程:从与利益相关者共创、获取数据,到使用 Python、LangChain、RAG、智能体工作流等技术栈构建应用,再到部署、监控和知识转移。候选人需具备 5-10 年 AI 工程或咨询经验,掌握 LLM、模型选择、嵌入与向量搜索、多云平台及 Docker/CI/CD 等生产部署技能,同时需具备在客户现场进行速度、质量、成本与安全权衡的架构判断力。Keyrus 还强调了其专有的“Human Orchestrated Model”方法论,将人类指挥的治理和性能引导融入智能基础中。此次远程全职招聘的流程简洁,包含技术交付挑战面试,旨在寻找能够连接数据、AI 与人类决策的“智能架构师”。

阅读全文