上海创智学院
岗位信息
招聘岗位
全栈算子优化方向实习生
是否笔试
未明确
招聘批次
实习
发布日期
2026-09-12
📋 岗位职责 / 任职要求
【岗位职责】
1. 大模型核心算子库开发与优化:面向 Transformer 架构中的关键计算模块(如 Flash Attention、LayerNorm、GELU、RoPE 等),开展 CUDA、Triton 或国产芯片算子开发,实现从高层模型代码到 Kernel 级别的性能优化。
2. 高性能算子封装与框架集成:将优化后的算子封装为 PyTorch 自定义算子(C++ Extension),并集成至主流深度学习训练框架中,提升模型训练和推理效率。
3. 自动编译优化与图算融合研究:基于 TVM、MLIR、LLVM、BladeDISC 等编译优化基础设施,参与计算图分析、子图划分、算子融合策略设计以及动态 Shape 场景下的内存优化。
4. 国产 AI 芯片适配与性能优化:参与大模型算子从 CUDA 生态向国产 AI 芯片生态迁移,解决指令集差异、内存管理差异和硬件适配问题,建立模型—算子—硬件性能映射体系。
5. 性能测试与技术沉淀:开展算子性能 Benchmark、优化效果分析和实验验证,整理高性能算子代码、优化方案文档和适配指南,推动 AI 基础设施优化成果落地。
【任职要求】
1. 招募对象:本科生、硕士研究生。
2. 学历与专业背景:计算机科学与技术、软件工程、高性能计算、微电子等相关专业优先。
3. 计算机体系结构基础:了解 GPU/CPU 架构、存储层次结构、并行计算基本原理,具备底层性能分析意识。
4. 并行编程能力:熟悉 CUDA、Triton 或华为 Ascend C 等并行计算开发技术,具备 GPU Kernel 或 AI 算子开发经验者优先。
5. 编译优化能力:了解 TVM、MLIR、LLVM 等编译基础设施,具备计算图优化、算子融合或自动调优经验者优先。
6. 模型部署与优化经验:了解量化算子实现,或具备 TensorRT、CoreML 等模型部署优化经验者优先。
7. 芯片适配经验:有国产 AI 芯片开发、算子迁移或异构计算优化经验者优先。
8. 具备较强的问题分析、性能调优和工程实践能力,能够从模型、算子、编译器和硬件多个层面定位性能瓶颈,并具备良好的团队协作能力。
9. 实习安排:线上线下结合;周期3–6个月;每周投入10–20小时。
投递方式
投递入口为会员专属,登录 / 注册 后查看(注册送 15 天免费试用)ℹ️ 信息来源
本条招聘信息由校招宝转载自 飞书招聘系统(企业校招官网),版权归原发布方所有,校招宝仅作信息聚合与导航。
该来源未提供原文链接
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。