深圳虾皮信息科技有限公司
校招

岗位信息

招聘岗位
(27届 ASP)LLM-大模型后训练算法工程师-GernalReasoningCoding 方向
工作城市
上海、北京
是否笔试
未明确
招聘批次
校招
发布日期
2026-08-04

📋 岗位职责 / 任职要求

关于团队 Compass 是由 Shopee 研发的面向全球竞争的超大规模多语言模型,具备强大的跨文化理解、复杂逻辑推理与自主执行能力。依托全球新兴市场(尤其是东南亚)海量的多语言、多文化数据优势,Compass 系列模型已成功实现了从 v1 到 v3 的演进。当前我们正聚焦下一代基座大模型(Compass V4,MoE 架构)的 Post-training,目标是在数学、代码、逻辑推理、指令遵循、长文本、多语言等核心能力上全面对标并超越业界最新开源模型。 岗位描述 我们正在系统性地推进大模型的能力对齐(Alignment),覆盖 Mid-training → SFT → RL 的全链路优化:用 mid-training 补齐基座能力上限, SFT 冷启,再通过全方位的强化学习算法(PPO、GRPO、DPO等)把模型潜力锐化为稳定可靠的输出。你将参与 Reasoning(数学 / 逻辑 / 各类学科)、Coding(代码生成 / SWE Agent)、General(指令遵循 / 多轮 / 长文本 / 多语言)中一个或多个方向的算法与数据建设,推动自训模型在关键 benchmark 上追平至超越目标模型。 岗位职责 • 参与 Mid-training / SFT / RL 全链路 post-training 方法的研究与落地,掌握并灵活运用全方位的强化学习算法,包括 PPO、GRPO、DPO 等,在真实训练环境中做能力对齐。 • 参与各阶段的联合优化:mid-training 的数据配比与基座能力抬升、SFT 的教师选型与配方、RL 的奖励设计与策略优化,理解并权衡三个阶段在能力天花板(pass@k)与稳定输出(pass@1)上的分工。 • 研究在合并多个能力域(数学 / 代码 / 逻辑 / 指令遵循 / 长文本等)时如何减少相互掉点,探索达到帕累托最优的合并算法。 • 探究 post-training 的 scaling 规律与能力边界提升,例如如何做更久 / 更稳定的 RL(延长有效训练步数、缓解熵坍缩与奖励饱和)、细粒度 / 过程级反馈(fine-grained / process reward),以及类 AlphaZero 的自我探索(self-play / self-exploration),持续抬升基础模型的能力上限。 • 设计并实现奖励信号与自动评测器(如代码判题、数学答案校验、指令约束校验、Agent 任务成功率),保证 reward 正确性锚定在模型之外、不产生自我强化误差。 • 参与高质量训练数据构建:数据合成与蒸馏、去重去污染、质量打分、失败样本挖掘、偏好数据构建,以及按「有效监督 token / 考点分布 / 失败机制」的定向配比策略。 • 打通并优化 mid-training / SFT / RL 的训推链路(如 verl / SGLang / vLLM / Megatron),定位并修复训推不一致、熵坍缩、显存与吞吐瓶颈等工程问题。 • 跟踪 LLM post-training、RL for LLM、reasoning models、Agentic RL、agent evaluation 等方向的前沿论文与开源框架,并快速复现或落地。 岗位要求 • 计算机、人工智能、机器学习、数学等相关专业硕士或博士。 • 熟悉机器学习与深度学习基础,了解大模型 post-training 的基本流程。 • 对SFT、强化学习有基础理解,熟悉 PPO、GRPO、reward modeling、policy optimization、credit assignment 等概念者优先。 • 熟练使用 Python,熟悉 PyTorch;具备良好的工程实现和实验分析能力。 • 对 LLM 的推理能力、代码智能体、指令遵循、多轮对话、RAG、长文本或多语言中的一个或多个方向有兴趣或实践经验。 • 能独立阅读英文论文,具备较强的问题拆解、实验设计和结果分析能力。 加分项 • 有 LLM post-training、SFT、RLHF、RLAIF、DPO、PPO、GRPO、RLVR 等实践经验。 • 熟悉 verl、TRL、Ray、vLLM、SGLang、Megatron、DeepSpeed 等训练 / 推理框架。 • 有数据合成与蒸馏、reward design、自动判题、trajectory analysis、sandbox execution、Docker / 容器环境经验。 • 在 NeurIPS、ICLR、ICML、ACL、EMNLP、AAAI 等会议发表过相关论文,或有高质量开源项目。 • 有算法竞赛、Kaggle、ACM/ICPC、系统工程或复杂工程项目经验。 你将获得 • 深入参与前沿 LLM Mid-training / SFT / RL 全链路 post-training 方向的研究与落地,直接对标业界最新开源模型。 • 接触真实的大规模训练与推理环境、可验证奖励体系、诊断驱动的数据引擎和完整的实验流程。 • 与算法、工程、产品团队协作,将研究结果转化为下一代基座模型的核心能力。 • 产出论文、技术报告、开源项目或核心业务成果。

🏢 企业简介

成立2017 年总部深圳

投递方式

投递入口为会员专属,登录 / 注册 后查看(注册送 15 天免费试用)

🎯 AI校招画像 (来源:百度AI搜索+DeepSeek)

🏢 公司文化与工作氛围
公司同事大多很年轻,工作氛围好,团队中不乏清北大佬、BAT大佬和留学生。上班不打卡,弹性工作制,拒绝加班文化,周末双休,上下级关系相对平等。公司有导师一对一帮带机制,前6个月为新员工提供指导。日常有last day活动(每个月最后一周的周五举办,提供蛋糕、披萨、KFC、奶茶、小吃等),整体氛围轻松活跃。
⏰ 加班情况与工作强度
- 上班时间:上午10:00~12:00,下午2:00~7:00,弹性工作制,正常1075(即10点上班、19点下班),无加班文化 - 大部分同事7点准时下班,很多人7:30下班 - 周末双休,很少加班 - 加班免费晚餐,9点后打车报销 - 大促期间值班可以调休1天 - 公司设有健身房并有大型健身房优惠券,员工有较多私人时间
💰 薪资待遇与年终奖
- 薪资对标BAT等大厂,base范围25k~80k之间 - 年终奖3-4个月 - 每年调薪一次,幅度12%~24%之间 - 绩效等级分为B/A/S,对应固定调薪幅度分别为12%、18%、24% - 优秀者可申请股票,绩效好的可以半价换股票 - 管理岗位绩效好的每年增发股票 - 薪资涨幅一般根据年包涨幅30%~100%(看面评表现)
🎁 福利体系
- 六险一金(含高额商业保险),看病报销100% - 年度免费体检 - 15天带薪年假(入职即有,与工作年限不挂钩) - 14天带薪病假,另有婚假、陪产假、亲子共享病假等 - 通讯补贴 - 大厦食堂,解决一日三餐 - 加班免费晚餐+9点打车报销 - 不限量零食水果咖啡饮料(含各式牛奶、酸奶、果汁、可乐、茶、咖啡、冰激凌等),冰箱每天更新 - 生日/周年/节日/生育各种礼物 - 入职即配苹果MacBook Pro笔记本电脑、键盘、超大显示器、两万元工学椅 - 培训提升给补贴 - 免费健身房,每周可领游泳票 - 高额内推奖金 - 办公地址离地铁近(深大站出来5分钟)
📋 校招流程经验
校招流程为:网申/内推 → 笔试 → 2-3轮专业面试 → HR沟通 → Offer 各届校招时间线参考: - 2025届:网申时间2024年8月12日-11月30日 - 2023届(西安电子科技大学信息):简历投递时间7月18日至10月14日12:00 - 每位同学可投递2个志愿,优先按照第一志愿推进流程 - 面试为2-3轮专业面试+HR面试 - 笔试在网申之后进行
🚀 投递建议与避坑指南
- 每位同学可投递2个志愿,建议将最匹配的岗位作为第一志愿 - 笔试需要认真准备,笔试通过后进入2-3轮专业面试 - 专业面试表现(面评)直接影响定薪,面评好可获得更高的初始薪资涨幅(30%~100%年包涨幅) - 入职后配备全套苹果设备,无需担心办公硬件 - 网申可通过Shopee虾皮招聘微信公众号或校招官网投递,也可通过内推渠道
👥 员工口碑与离职率评价
员工口碑整体较好,分享的福利待遇包括:周末双休、拒绝加班文化、上班不打卡、大部分同事7点准时下班;同事大多很年轻、工作氛围超好;工作生活balance。薪资对标BAT等大厂,年终奖3-4个月,每年调薪12%~24%,绩效好的可申请股票。15天带薪年假+14天带薪病假,工作与生活平衡较好。正常7点吃饭、很多人7:30下班,如果想留下学习自我提升,9点后可免费打车回家。
📈 热门岗位方向与招聘趋势
2025届校招岗位包括:后端开发工程师、前端开发工程师、测试工程师、大数据开发工程师、iOS开发工程师、SRE(运维)工程师、安全工程师、算法工程师、技术产品经理(TPM)、Android开发工程师、项目经理(PJM)、人力资源专员、产品体验设计师、产品经理。此外设有AI Star Program顶尖技术人才招募项目(2027届)。工作地点为深圳、北京、上海。显示公司规模1000-9999人,持续招聘社会人才和校招人才,未提供明确的扩招或缩招信息。

ℹ️ 信息来源

本条招聘信息由校招宝转载自 Moka 招聘系统(企业校招官网),版权归原发布方所有,校招宝仅作信息聚合与导航。
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。