上海创智学院
实习

岗位信息

招聘岗位
智算互联方向实习生
是否笔试
未明确
招聘批次
实习
发布日期
2026-09-12

📋 岗位职责 / 任职要求

【岗位职责】 1. 集群网络拓扑与通信性能优化:参与超大规模智算集群(IB/RoCE 等)网络架构分析,利用 NCCL、MPI 等集合通信工具开展带宽、延迟测试与性能建模,定位分布式训练过程中的通信瓶颈。 2. 优化大规模模型训练通信效率:分析 All-Reduce、All-Gather、All-to-All 等通信操作在大模型训练中的性能影响,探索路由策略、拥塞控制、拓扑亲和部署等优化方案,提高集群通信效率。 3. 通信库底层调优与适配:深入研究 NVIDIA NCCL 或国产 AI 芯片通信栈(如华为 CANN、寒武纪等),针对不同模型架构(如 MoE)优化通信参数配置,提升训练性能。 4. 设计通信故障检测与自愈机制:参与智算集群通信稳定性优化,研究健康检查、故障定位、自动重路由等机制,提高大规模训练任务可靠性和有效运行时间。 5. 实验分析与工具开发:完成通信性能测试、瓶颈分析和优化验证,开发通信调优脚本、自动化测试工具及故障诊断原型,并整理技术报告。 【任职要求】 1. 招募对象:本科生、硕士研究生。 2. 学历与专业背景:计算机、通信工程、电子工程、人工智能等相关专业优先。 3. 网络与通信基础:深入理解 TCP/IP 协议栈,熟悉 RoCEv2 或 InfiniBand 架构原理,了解网络拥塞控制算法。 4. 并行通信能力:了解 MPI 编程或 NCCL 集合通信库,理解 All-Reduce、All-Gather、All-to-All 等通信原语在大模型训练中的通信量与性能模型。 5. 编程与工程能力:熟练使用 Python 或 C/C++,能够编写自动化性能测试、压测和数据采集脚本。 6. 加分经历:具备 RDMA 编程经验、DPU(数据处理器)使用经验、大规模分布式训练或 AI Infra 相关项目经验者优先。 7. 具备较强的问题分析与定位能力,能够从系统、网络、软件等多个层面分析性能瓶颈,并具有良好的团队协作能力。 8. 对大规模智算系统、AI 基础设施、分布式训练优化等方向具有持续研究兴趣,愿意深入探索模型—软件—硬件协同优化问题。 9. 实习安排:线上线下结合;周期3–6个月;每周投入10–20小时。

投递方式

投递入口为会员专属,登录 / 注册 后查看(注册送 15 天免费试用)

ℹ️ 信息来源

本条招聘信息由校招宝转载自 飞书招聘系统(企业校招官网),版权归原发布方所有,校招宝仅作信息聚合与导航。
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。