LoRA

与「LoRA」相关的文章

共 5 篇文章

安德鲁·吴的AI工程技能地图:10,000个职位招聘对2026年招聘和角色设计意味着什么

Andrew Ng 于 2026 年 8 月发布了 AI Engineering Skills Map,基于对 10,000 份招聘信息的分析,将 AI 工程技能组织为两层架构:4 项核心技能(包括提示工程作为大模型交互的子技能)和 6 项扩展技能。核心技能是所有 AI 工程师的通用基线,而扩展技能则定义了高级职位和实际的交付能力。该框架最具冲击力的结构性变化是将提示工程从独立职业路径重新定位为核心技能的一个组成部分,这一决定直接影响了那些被专门雇佣为“Prompt Engineer”的角色。文章为招聘经理提供了具体的应用指南,包括如何编写分层的职位描述(将核心技能设为硬性要求,根据项目阶段选择扩展技能)、设计分阶段的面试流程(初期筛选核心技能,现场评估扩展技能)以及构建职业阶梯(助理工程师掌握核心技能,高级工程师需精通架构决策与多项扩展技能)。此外,文章指出该技能图谱不仅是一套分类法,更是一种组织设计工具,迫使企业重新审视其 AI 角色设置与团队拓扑结构的合理性。作者所在的 Traversaal.ai 也在招聘前线部署工程师以解决实际生产中的 AI 问题。

阅读全文

Zainab A.S.

本文是 Zainab A.S. 的 LinkedIn 职业档案,展示了一位 Forward Deployed AI Engineer 的完整职业发展路径。Zainab 目前在 Google 担任 FDE Gen AI Engineer,专注于将生成式 AI 从原型推向生产,使用 Vertex AI、Gemini、RAG 管道和 Agentic 框架帮助客户架构和部署 AI 解决方案。此前,她在 Extern 完成 Pfizer AI Engineer 实习,为临床供应链构建端到端 AI 文档智能系统,涉及 OCR 管道、LlamaIndex、FAISS、Chroma 向量搜索及 Gemini API 集成。她还曾在教育科技公司 Tilli 担任 Gen AI Engineer,与学区和 NGO 合作将 GenAI 原型转化为生产级功能,包括对话辅导代理和自动化评估管道。Zainab 的职业生涯始于 QA 领域,在 gWorks 和 iD Tech Camps 担任软件 QA 测试工程师,积累了自动化测试、CI/CD 和 AI 辅助工具经验,这段 QA 背景使她形成了“评估优先”的 AI 工程理念。她拥有多项认证,包括 Google Cloud Professional Cloud Architect 和 AI 工程相关证书。档案中展示了多个个人项目,如基于 LLaMA-7B 微调的合同分析 AI 系统(F1 分数达 87%)、AI 教科书 RAG Studio 以及 AI 驱动的习惯追踪应用 HabitBloom。整个档案体现了一条从传统 QA 到前沿 AI 部署工程师的转型路径,强调了评估、可观测性和生产就绪在 AI 工程中的核心地位。

阅读全文

Forward Deployed Engineer (Inference & Post-Training) - Mandarin Speaking

本文是 Together AI 通过 Zero G Talent 发布的一份面向新加坡的招聘启事,岗位为会说普通话的前线部署工程师(Forward Deployed Engineer,FDE),专门负责推理(Inference)与后训练(Post-Training)方向。该职位不是简单的解决方案架构师替代品,而是定位于深度领域专家,需要与解决方案架构师协同工作。核心职责围绕推理引擎优化展开,涉及根据硬件配置、模型架构和负载特征选型、配置并优化主流推理引擎(如 vLLM、TensorRT-LLM、SGLang)。具体技术工作包括:调整 KV Cache、应用推测解码、确定最佳张量并行度与量化策略,以达成严苛的吞吐量和延迟指标。后训练方面,候选人需亲自执行 RL 训练任务并优化系统架构,指导客户完成 LoRA、SFT、DPO、RLHF 与 GRPO 等全流程管线搭建,助力客户从实验阶段跨入生产环境。此外,FDE 还需负责战略客户的长期技术健康度,确立客户入驻平台的基线配置以缩短价值实现时间,并代表一线经验反向驱动产品路线图的演进。申请者须具备 5 年以上技术经验,对开源大模型生态有广泛认知,具备专家级推理引擎实操和诊断能力,并拥有扎实的 Python 编码功底。文章强调 Together AI 是一家研究驱动型企业,致力于通过软硬件协同设计降低 AI 成本,其团队贡献了 FlashAttention 等知名技术。岗位要求为新加坡永久居民或公民,提供初创股权及远程灵活办公选项,发布时间为 2026 年 8 月 4 日。

阅读全文

Handshake 高级 AI 前部署工程师

本文是Handshake公司发布的“高级AI前线部署工程师”(Senior AI Forward Deployed Engineer)招聘启事。Handshake从大学生求职平台转型为AI数据服务巨头,在2025年启动Handshake AI业务,号称已成为史上增长最快的AI数据企业,年化营收约10亿美元,每月向超过3万名知识工作者支付约6,000万美元。该职位位于旧金山,采用混合办公模式,核心使命是嵌入前沿AI实验室等战略合作伙伴中,扮演应用AI研究与客户交付的桥梁角色。工程师需要将实验室模糊的后训练需求转化为具体的评估框架、标注管道和基准基础设施,并主导原型设计、实验迭代和团队指导。技术要求方面,候选人需有6年以上应用机器学习或AI研究工程经验,深度掌握强化学习后训练技术(RLHF、DPO、PPO),具备实际模型微调操作经验(LoRA、PEFT),并有ML数据管道和评估工具的使用背景。加分项包括LLM评估设计经验、已发表的研究成果、开源贡献或在高增长AI公司担任过前线部署类角色。该岗位旨在影响前沿模型的训练方式,反映了AI数据服务行业对兼具研究深度与工程交付能力的复合型人才的迫切需求。

阅读全文

Qwen3-32B本地部署实战:LoRA微调+vLLM推理+Docker交付

本文是一份针对阿里巴巴通义千问系列开源大模型 Qwen3-32B 的本地化工程部署与微调实战指南。文章围绕“LoRA 微调 + vLLM 推理 + Docker 容器化交付”这一技术路径,详细记录了从环境准备、模型下载与格式转换、Docker 镜像构建、vLLM 高性能推理服务上线、到基于 Swift 框架的 LoRA 领域微调及效果验证的完整流程。核心观点强调 Qwen3-32B 作为“甜点规模”模型,在 A100-80G 单卡上即可完成推理,双卡可实现高吞吐服务,且 MMLU、CMMLU 等评测稳居开源第一梯队。技术选型深度对比了 vLLM 与 TGI 的架构差异,指出 PagedAttention 机制使 32K 长文本推理显存占用比 TGI 低 58%,吞吐量高出 2.8 倍。在 LoRA 配置上,通过梯度分析锁定 q_proj 和 v_proj 为核心目标模块,并给出 balanced 方案(q_proj+v_proj+gate_proj+down_proj,rank=8)在显存占用 31.5GB 下实现 ROUGE-L 提升 4.1 的实测数据。文章还重点描述了 Docker 从零构建的可复现策略、应对冷启动的预热技巧、QWEN 官方 AWQ 量化加速方案,以及显存溢出、模型加载失败等血泪教训。本文面向面临模型本地化、业务定制与生产环境落地的工程师,提供了可复现、可迭代、可交付的完整工作流,具有极强的工程参考价值。

阅读全文