九识智能
岗位信息
招聘岗位
【27届校招】模型训练性能优化工程师
工作城市
杭州、苏州
是否笔试
未明确
招聘批次
校招
发布日期
2026-08-20
📋 岗位职责 / 任职要求
About the Role
我们正在打造自动驾驶领域的 高性能 AI Training System(高性能训练系统),持续推动大规模模型训练的效率提升。随着自动驾驶模型从传统感知网络逐步演进到 End-to-End Driving 与 VLM(视觉语言模型),训练规模、GPU 集群规模以及数据规模都在快速增长,训练效率已经成为核心竞争力之一。
我们希望找到对 GPU、CUDA、PyTorch、分布式训练 或 AI Infrastructure 感兴趣的同学,一起参与训练系统优化工作。你将直接接触真实的大规模模型训练任务,参与分析训练瓶颈、优化 GPU 利用率、提升训练吞吐,并探索包括 CUDA Kernel Fusion、Communication Optimization、Mixed Precision、Torch Compile、CUDA Graph 等前沿训练加速技术。
Responsibilities
参与自动驾驶模型训练加速与性能优化,包括:
Data Pipeline Optimization(数据流水线优化)、GPU utilization optimization(GPU利用率优化)、Training throughput optimization(训练吞吐优化)
参与分布式训练系统优化,包括:
Multi-GPU / Multi-node Training(多机多卡训练)、Communication Optimization(通信优化)、Overlap Communication & Computation(通信计算重叠)
参与训练框架与 Runtime 优化:
PyTorch Runtime Optimization、CUDA Kernel Optimization、Memory Optimization(显存优化)、Mixed Precision Training(混合精度训练)
分析并优化模型训练瓶颈,包括:
GPU compute bottleneck、Data loading bottleneck、Kernel launch overhead、Distributed synchronization overhead
参与自动化性能 Benchmark 与 Profiling 系统建设:
GPU profiling、Training regression analysis、Performance benchmarking
跟踪并研究前沿训练加速技术,包括:
FlashAttention、Fused Operators、Torch Compile、CUDA Graph、Triton Kernel、Distributed Training Optimization
Requirements
计算机、电子工程、人工智能或相关专业本科/硕士,具备较强工程能力与学习能力。
熟悉 Python 或 C++ 编程,具备良好的代码能力。
熟悉深度学习框架之一:
PyTorch、TensorFlow 或 JAX
对 GPU / 并行计算 有一定理解,包括:
CUDA execution model、GPU memory hierarchy、Thread / Warp execution、GPU performance basics
熟悉深度学习训练流程:
Forward / Backward propagation、Optimizer、Distributed Data Parallel(DDP)、Mixed Precision Training
具备基本性能分析能力,能够使用 profiling 工具定位性能瓶颈。
Preferred Qualifications
有以下方向经验之一:
CUDA Programming、Distributed Training、GPU Kernel Optimization、AI Compiler、ML Systems
熟悉以下工具或框架之一:
Nsight Systems、Nsight Compute、PyTorch Profiler、DeepSpeed、Megatron-LM、Horovod
有以下优化经验之一:
CUDA Kernel Fusion、Memory Optimization、Communication Optimization、Training Throughput Optimization
熟悉自动驾驶 / 多模态模型 / 大模型训练相关技术。
有开源项目、竞赛或科研经历加分。
What You Will Gain
在这里你将有机会:
参与自动驾驶 AI Training Infrastructure(AI训练基础设施)研发
深度接触 大规模模型训练加速 与 GPU 性能优化
与经验丰富的 GPU / AI Infra 工程师共同开发核心训练系统
参与自动驾驶大模型与 VLM 的训练优化实践
快速成长于 Distributed Training、CUDA、ML Systems 与 AI Infrastructure 领域
🏢 企业简介
总部苏州
投递方式
投递入口为会员专属,登录 / 注册 后查看(注册送 15 天免费试用)ℹ️ 信息来源
本条招聘信息由校招宝转载自 Moka 招聘系统(企业校招官网),版权归原发布方所有,校招宝仅作信息聚合与导航。
该来源未提供原文链接
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。