C++

与「C++」相关的文章

共 5 篇文章

TensorRT Model Connect - 开源模型部署工具,两命令转C+

TensorRT Model Connect(TRTMC)是 NVIDIA 于 2026 年 8 月 18 日以 Apache-2.0 协议在 GitHub 开源的一款模型部署工具,旨在将 Hugging Face 或本地模型检查点直接转换为原生 C++ 推理引擎。开发者仅需 `trtmc build` 和 `trtmc run` 两条命令即可完成部署,全程无需导出 ONNX 中间格式,构建产物为版本化的 .bundle 文件,运行时完全脱离 PyTorch 环境。该项目由 OpenAI Codex Agent 在人类监督下构建,代表了 AI 辅助开发部署工具的范式转变。TRTMC 提供覆盖 105 个模型系列、76 个模型家族的参考实现,包括 Qwen、Llama、Mistral、DeepSeek 等主流开源大语言模型以及 Whisper 语音模型。性能验证方面,在 GB300 快照测试中,102 个 profile 的推理性能较声明基准提升超过 5%。其技术架构将构建阶段与运行时解耦,提供统一的 C++ 任务 API(generate、transcribe、embed 等),并支持 NVIDIA 全系列 GPU(如 A100、H100、Jetson),可实现云端到边缘的全场景部署,适用于大模型推理服务、边缘 AI 推理、C++ 应用集成与模型快速评估。该工具通过版本化 .bundle 天然支持模型回滚与灰度发布,为生产环境提供了高一致性的交付单元。

阅读全文

Forward Deployed Software Engineer,New Grad - Commercial

Palantir Technologies 发布面向 2026 或 2027 年应届毕业生的前线部署软件工程师(Forward Deployed Software Engineer, New Grad - Commercial)招聘信息,工作地点为韩国首尔,提供时薪 25–50 美元,属于混合办公模式。该职位要求候选人具备流利的商务韩语和英语,拥有计算机科学、电气与计算机工程、数学、软件工程、物理学或数据科学等工程学位,并熟练掌握 Python、Java、C++、TypeScript/JavaScript 等至少一门编程语言。FDE 是 Palantir 的独特岗位,要求工程师直接嵌入客户现场,解决从电网野火预测到全球供应链优化等高风险现实问题,需要 25%–50% 的差旅。新毕业生将从第一天起承担端到端项目责任,直接与客户及各级利益相关者协作,进行架构设计、数据处理、定制化应用与大型语言模型工作流构建,不局限于产品现有边界。Palantir 强调结果导向、自主驱动、拥抱模糊性和在技术与非技术混合团队中有效协作。申请者需提交 PDF 版简历和一段 3 分钟的视频作答,并承诺在收到书面录取通知后两周内做出决定。公司为数据驱动决策提供世界领先的软件平台,包括面向政府的 Gotham 和面向商业的 Foundry,通过将正确数据交付给需要的人,赋能合作伙伴开发救命药物、预测供应链中断、寻找失踪儿童等。此职位的发布体现了 Palantir 对前线部署工程这一角色的持续投入,以及其对具备跨领域技术能力、高度自主性和客户导向思维的新人工程师的特定需求。

阅读全文

在 JetPack 7.2 上部署 TensorRT Edge-LLM

本指南来自 Seeed Studio Wiki,完整记录在 NVIDIA JetPack 7.2 上部署 TensorRT Edge-LLM v0.9.1 的流程。TensorRT Edge-LLM 是 NVIDIA 面向嵌入式 Jetson 平台的大语言模型、视觉语言模型和多模态模型推理栈,本版本于 2026 年 7 月 31 日更新,官方支持 Jetson Orin 和 Jetson Thor。部署分两阶段:首先在 x86 GPU 主机(Ubuntu 22.04/24.04、CUDA 12.x/13.x、Ampere 以上 GPU)上克隆 TensorRT Edge-LLM v0.9.1,通过 `tensorrt-edgellm-export` 将 Hugging Face 上的 Qwen3-0.6B 检查点导出为 ONNX 计算图;随后将 ONNX 目录传输至 Jetson 设备,在 JetPack 7.2 与 CUDA 13.2 工具链下,使用 CMake 以 `jetson-orin` 或 `jetson-thor` 为目标构建 C++ 运行时和示例,然后运行 `llm_build` 从 ONNX 构建 TensorRT 引擎,并通过 `llm_inference` 进行推理,输出示例显示模型成功回答“The capital of the United States is Washington, D.C.”。指南详细说明了 Jetson Orin 支持的精度仅为 FP16、INT8、INT4,不支持 FP8 等更高精度,并强调 JetPack 6.2 的引擎不可直接复用。对于 INT4 量化,推荐使用 AWQ 或 GPTQ 预量化检查点并采用外部化权重选项以降低内存压力。此外,还提供了基准测试命令、与 JetPack 6.2 的差异对比以及常见故障(如 CMake

阅读全文

部署型人工智能工程师,运营部 - Zipline

Zipline 正在招聘 Forward Deployed AI Engineer, Operations 岗位,工作地点位于美国加利福尼亚州南旧金山,要求现场办公。该职位类似于 Zipline 内部的 AI 创业公司 CTO,直接向运营负责人汇报,负责为航空、物流、配送中心、维护、客户运营和商业团队构建端到端的 GenAI 工具并投入生产。Zipline 是全球最大、经验最丰富的无人机配送服务商,在四大洲运营,每 30 秒完成一次配送,已完成数百万次交付,累计安全商业自主飞行里程超过 1.4 亿英里。岗位要求具备构建 GenAI 解决方案的经验,熟悉大模型、数据处理管道和分析工具,精通 Python、TypeScript/JavaScript、Java 或 C++ 等编程语言,能与非技术同事协作,并愿意最多 50% 的时间出差。该岗位薪资范围为 112,500 至 300,000 美元,外加股权、奖金和福利。文章指出,该角色的影响力将来自被采纳、被信任和日常使用中的系统,而非演示。候选人需具备实用的工程思维,专注于交付生产级 AI 系统,而非学术基准。

阅读全文

Forward Deployed Team Lead – Career Development Office | MIT Sloan School of Management

本文是麻省理工学院斯隆管理学院(MIT Sloan School of Management)职业发展办公室发布的 C3.ai 公司“Forward Deployed Team Lead”(前线部署团队负责人)招聘启事。该职位是高级技术负责人,负责端到端地管理商业或企业客户的交付,需要将C3.ai平台从“设计”推进到“生产环境”落地。核心职责融合了技术架构设计、动手编码、产品所有权、项目管理和利益相关者沟通,要求候选人能够直接嵌入客户现场工作。具体职责包括:设计数据流、集成拓扑和部署架构;使用Python、TypeScript/JavaScript、Java、Go或C++编写生产级代码;管理部署路线图;推动系统通过测试进入生产环境;确保符合SOC 2、ISO 27001等企业安全合规标准;并将一线经验反馈回产品团队。任职资格要求计算机科学或相关领域学士/硕士,6年以上生产软件交付经验,其中至少2年技术负责人经验,并具备金融、医疗、能源等至少一个垂直行业的深厚专业知识,熟悉Snowflake、Databricks、Docker、Kubernetes、Terraform等现代技术栈和云环境(AWS、Azure、GCP)。此职位要求有在美国的工作授权,体现了AI企业在将复杂平台部署到大型客户时,对该类兼具技术深度、行业洞察和项目管理能力的复合型前端部署工程师的迫切需求。

阅读全文