GRPO

与「GRPO」相关的文章

共 2 篇文章

Physical AI迎来首个端边云统一推理运行时:北邮、北大、清华、明体科技等联合推出PhyAI

来自北京邮电大学、北京大学、清华大学、南京大学、明体科技及面壁智能的联合团队推出了 PhyAI,这是首个面向 Physical AI 的端边云统一推理运行时。针对当前具身智能在离线评测、云端强化学习 Rollout、端侧实时控制、工厂服务等四类场景中需维护四套代码、迁移成本高及效率参差不齐的问题,PhyAI 实现了单套代码的全场景无缝迁移。其核心架构包含 Model Adapter 和 Scheduler,统一管理调度、算子融合与多卡并行。在 Benchmark 评估中,PhyAI 相对官方实现产生了 1.40 倍至 4.65 倍的显著加速,例如将 MiniCPM-Robot 在 H100 上的推理延迟从 105.38ms 骤降至 22.64ms;在多机器人真机并行场景中,延迟最高降低 2.3 倍并消除了卡顿。文章提出了关键分析模型“Control-Time Roofline”,指出在算力过剩的 GPU 上,物理环境响应已成为新瓶颈,单纯降低模型推理延迟无法线性提升机器人的整体控制频率,这为具身智能算法与硬件的协同设计提供了全新的量化依据。

阅读全文

Forward Deployed Engineer (Inference & Post-Training) - Mandarin Speaking

本文是 Together AI 通过 Zero G Talent 发布的一份面向新加坡的招聘启事,岗位为会说普通话的前线部署工程师(Forward Deployed Engineer,FDE),专门负责推理(Inference)与后训练(Post-Training)方向。该职位不是简单的解决方案架构师替代品,而是定位于深度领域专家,需要与解决方案架构师协同工作。核心职责围绕推理引擎优化展开,涉及根据硬件配置、模型架构和负载特征选型、配置并优化主流推理引擎(如 vLLM、TensorRT-LLM、SGLang)。具体技术工作包括:调整 KV Cache、应用推测解码、确定最佳张量并行度与量化策略,以达成严苛的吞吐量和延迟指标。后训练方面,候选人需亲自执行 RL 训练任务并优化系统架构,指导客户完成 LoRA、SFT、DPO、RLHF 与 GRPO 等全流程管线搭建,助力客户从实验阶段跨入生产环境。此外,FDE 还需负责战略客户的长期技术健康度,确立客户入驻平台的基线配置以缩短价值实现时间,并代表一线经验反向驱动产品路线图的演进。申请者须具备 5 年以上技术经验,对开源大模型生态有广泛认知,具备专家级推理引擎实操和诊断能力,并拥有扎实的 Python 编码功底。文章强调 Together AI 是一家研究驱动型企业,致力于通过软硬件协同设计降低 AI 成本,其团队贡献了 FlashAttention 等知名技术。岗位要求为新加坡永久居民或公民,提供初创股权及远程灵活办公选项,发布时间为 2026 年 8 月 4 日。

阅读全文