GPU

标签「GPU」下的文章

共 2 篇文章

如何为企业应用构建AI基础设施:完整指南

本文由Hyperlink InfoSystem公司CEO兼创始人Harnil Oza撰写,系统阐述了企业级AI基础设施的构建方法。文章指出,AI应用从测试环境过渡到成产环境面临的核心挑战并非模型本身,而是基础设施的局限性。Google Cloud 2026年《AI基础设施状况报告》数据显示,83%的企业需要改进基础设施才能部署生产就绪的智能体AI。企业AI基础设施是一个涵盖计算与加速器(如GPU、TPU)、数据基础设施、网络、编排、模型服务、MLOps、安全与治理以及可观测性等组件的完整生态系统。文章详细讨论了围绕AI工作负载进行架构设计、建立可扩展计算与数据基础、规划MLOps与长期运维、以及将安全、合规(GDPR、EU AI Act、HIPAA)和治理嵌入架构的设计方法。在选择部署模型时,需根据工作负载波动性、数据敏感性及合规要求在公有云、本地部署、混合云或主权云之间权衡。建设过程遵循分阶段实施策略,依次为基础设施就绪度评估、基础构建、受控试点验证、成产扩展和持续优化。核心观点是,成功的AI基础设施设计不应堆砌所有可能的技术,而应精确匹配工作负载特性、性能需求和安全要求,是一个需要持续优化而非一次性完成的过程。

阅读全文

AI现场工程师 - GenAI基础设施

2026年7月8日,一家匿名的 GenAI 基础设施公司(Stealth)发布招聘信息,寻找 AI 前线部署工程师(AI Field Engineer)。该职位旨在帮助企业将开源大模型从沙盒探索推向生产环境,职责包括确定概念验证范围、运行负载测试、执行 SFT/DPO/RFT 等模型微调,并直接在客户基础设施中交付生产集成,而非停留在咨询层面。公司推理平台已为 Uber、DoorDash、Notion 和 Cursor 等知名企业提供生产服务,推理速度达到闭源模型的 15 倍,并发量提升 4 倍。职位要求候选人具备 3 年以上客户现场 AI/ML 工程经验,深度掌握 LLM 推理与训练,熟练使用 vLLM、SGLang 或 TensorRT-LLM 等推理引擎,精通 Python 编程及 AWS、Azure、GCP 等 GPU 云基础设施,并具备 Kubernetes 实战能力。理想候选人拥有 Palantir FDE、BCG X 或 McKinsey QuantumBlack 等前线部署或专业服务背景。薪资范围为底薪 176,000–224,000 美元,总包 220,000–280,000 美元(80/20 拆分),10 年以上经验可上浮,并提供股权激励。工作方式为美国境内远程办公,需定期出差至客户现场,并支持 H-1B 转移和 TN 签证担保,O-1 签证视情况而定。该招聘突出强调了实战交付能力,明确拒绝仅有闭源 API 经验的候选人,反映出开源模型生产部署对 FDE 角色的硬核要求。

阅读全文