九识智能
校招民企

岗位信息

招聘岗位
【27届校招】模型训练性能优化工程师
工作城市
杭州、苏州
是否笔试
未明确
招聘批次
校招
发布日期
2026-08-20

📋 岗位职责 / 任职要求

About the Role 我们正在打造自动驾驶领域的 高性能 AI Training System(高性能训练系统),持续推动大规模模型训练的效率提升。随着自动驾驶模型从传统感知网络逐步演进到 End-to-End Driving 与 VLM(视觉语言模型),训练规模、GPU 集群规模以及数据规模都在快速增长,训练效率已经成为核心竞争力之一。 我们希望找到对 GPU、CUDA、PyTorch、分布式训练 或 AI Infrastructure 感兴趣的同学,一起参与训练系统优化工作。你将直接接触真实的大规模模型训练任务,参与分析训练瓶颈、优化 GPU 利用率、提升训练吞吐,并探索包括 CUDA Kernel Fusion、Communication Optimization、Mixed Precision、Torch Compile、CUDA Graph 等前沿训练加速技术。 Responsibilities 参与自动驾驶模型训练加速与性能优化,包括: Data Pipeline Optimization(数据流水线优化)、GPU utilization optimization(GPU利用率优化)、Training throughput optimization(训练吞吐优化) 参与分布式训练系统优化,包括: Multi-GPU / Multi-node Training(多机多卡训练)、Communication Optimization(通信优化)、Overlap Communication & Computation(通信计算重叠) 参与训练框架与 Runtime 优化: PyTorch Runtime Optimization、CUDA Kernel Optimization、Memory Optimization(显存优化)、Mixed Precision Training(混合精度训练) 分析并优化模型训练瓶颈,包括: GPU compute bottleneck、Data loading bottleneck、Kernel launch overhead、Distributed synchronization overhead 参与自动化性能 Benchmark 与 Profiling 系统建设: GPU profiling、Training regression analysis、Performance benchmarking 跟踪并研究前沿训练加速技术,包括: FlashAttention、Fused Operators、Torch Compile、CUDA Graph、Triton Kernel、Distributed Training Optimization Requirements 计算机、电子工程、人工智能或相关专业本科/硕士,具备较强工程能力与学习能力。 熟悉 Python 或 C++ 编程,具备良好的代码能力。 熟悉深度学习框架之一: PyTorch、TensorFlow 或 JAX 对 GPU / 并行计算 有一定理解,包括: CUDA execution model、GPU memory hierarchy、Thread / Warp execution、GPU performance basics 熟悉深度学习训练流程: Forward / Backward propagation、Optimizer、Distributed Data Parallel(DDP)、Mixed Precision Training 具备基本性能分析能力,能够使用 profiling 工具定位性能瓶颈。 Preferred Qualifications 有以下方向经验之一: CUDA Programming、Distributed Training、GPU Kernel Optimization、AI Compiler、ML Systems 熟悉以下工具或框架之一: Nsight Systems、Nsight Compute、PyTorch Profiler、DeepSpeed、Megatron-LM、Horovod 有以下优化经验之一: CUDA Kernel Fusion、Memory Optimization、Communication Optimization、Training Throughput Optimization 熟悉自动驾驶 / 多模态模型 / 大模型训练相关技术。 有开源项目、竞赛或科研经历加分。 What You Will Gain 在这里你将有机会: 参与自动驾驶 AI Training Infrastructure(AI训练基础设施)研发 深度接触 大规模模型训练加速 与 GPU 性能优化 与经验丰富的 GPU / AI Infra 工程师共同开发核心训练系统 参与自动驾驶大模型与 VLM 的训练优化实践 快速成长于 Distributed Training、CUDA、ML Systems 与 AI Infrastructure 领域

🏢 企业简介

总部苏州

投递方式

投递入口为会员专属,登录 / 注册 后查看(注册送 15 天免费试用)

ℹ️ 信息来源

本条招聘信息由校招宝转载自 Moka 招聘系统(企业校招官网),版权归原发布方所有,校招宝仅作信息聚合与导航。
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。