Reinforcement Learning

与「Reinforcement Learning」相关的文章

共 2 篇文章

让AI应用在现实中发挥作用所需了解的知识

Andrew Ng在本文中系统阐述了构建和部署真实可用AI应用所需的核心技能体系,回应了AI工程化的关键挑战:如何在不可预测的AI组件之上构建可靠的软件系统。文章指出,AI应用与传统软件的本质区别在于LLM输出的不确定性,这使得开发过程成为高度迭代的“构建-检查-决策”循环,而非线性规划。核心技能分为六个维度:(1)LLM基础——理解分词、生成机制、上下文窗口、缓存命中、知识截止、推理强度、采样参数及工具调用等,以做出正确的模型选型和微调决策;(2)数据接地——超越早期RAG向量搜索,掌握向量索引、知识图谱、结构化数据语义层等多种技术,构建从文档(文本、PDF、HTML、图片)到LLM就绪输入的清洗管道;(3)智能体系统构建——涵盖从预定工作流到自主决策循环的架构光谱,涉及工具选择(MCP、CLI、沙箱执行环境)、记忆架构、长期会话上下文管理、多智能体编排及生产安全(护栏、对抗输入、数据外泄防范);(4)评估驱动开发——Andrew Ng认为这是区分AI工程师水平的最重要特质,需要结合系统轨迹分析、探索性数据分析与产品业务洞察来设计评估指标,并根据项目阶段选择确定性评估、LLM-as-a-Judge或人工评审等方法,形成驱动系统化迭代的闭环;(5)生产运维——由于不可预测性、成本和延迟的特殊性,需要建立可观测性机制跟踪性能、检测漂移、应对提示注入安全事件,并通过回归测试和CI/CD统计评估进行模型优化、蒸馏和工作流简化;(6)机器学习基础——理解监督学习和强化学习原理,掌握偏差/方差、错误分析、数据工程等核心心智框架。

阅读全文

Handshake 高级 AI 前部署工程师

本文是Handshake公司发布的“高级AI前线部署工程师”(Senior AI Forward Deployed Engineer)招聘启事。Handshake从大学生求职平台转型为AI数据服务巨头,在2025年启动Handshake AI业务,号称已成为史上增长最快的AI数据企业,年化营收约10亿美元,每月向超过3万名知识工作者支付约6,000万美元。该职位位于旧金山,采用混合办公模式,核心使命是嵌入前沿AI实验室等战略合作伙伴中,扮演应用AI研究与客户交付的桥梁角色。工程师需要将实验室模糊的后训练需求转化为具体的评估框架、标注管道和基准基础设施,并主导原型设计、实验迭代和团队指导。技术要求方面,候选人需有6年以上应用机器学习或AI研究工程经验,深度掌握强化学习后训练技术(RLHF、DPO、PPO),具备实际模型微调操作经验(LoRA、PEFT),并有ML数据管道和评估工具的使用背景。加分项包括LLM评估设计经验、已发表的研究成果、开源贡献或在高增长AI公司担任过前线部署类角色。该岗位旨在影响前沿模型的训练方式,反映了AI数据服务行业对兼具研究深度与工程交付能力的复合型人才的迫切需求。

阅读全文