阿里巴巴集团
2027届民企

岗位信息

招聘岗位
算法工程师-RL数据
工作城市
北京、杭州
毕业届别
2027
学历要求
博士
是否笔试
未明确
招聘批次
2027届
发布日期
2026-08-19

📋 岗位职责 / 任职要求

职位类别:技术类 业务集团:阿里巴巴控股集团 职位描述:你将深度参与强化学习后训练数据产线的构建,通过迭代数据来优化基模的各种能力。 1.结合训练需求和模型能力分析,确定 RL 数据的覆盖范围与优先级;从多种渠道的海量数据里筛选挖掘样本并构建出清晰、可执行的问题描述。 2.针对 Coding 及 Work 等场景,以人机协作的方式设计并构建Agent的运行环境,以及可量化的 Verifier 或多维度打分 Rubric。需要保证环境和Judge的正确性、完整性、鲁棒性,且持续迭代以应对 Reward Hacking等各类挑战,确保评估信号与训练目标对齐。 3.端到端搭建批量化的数据生产与验证 Pipeline,涵盖任务生成、轨迹采样、自动校验和质量过滤,保障进入训练的数据可信、可追溯。 4.与领域专家和算法/训练等团队紧密配合,将模型效果反馈转化为数据策略调整(任务难度、Reward 信号、标注规范等)。 职位要求:1.计算机、数学、统计学等相关专业硕士/博士优先,优秀本科生不受限制。有顶会论文(ACL/EMNLP/ICLR/NeurIPS/ICML等)/高影响项目/开源贡献者加分。 2.具备Data-centric AI意识,精通后训练所需高质量数据挖掘与构造,具备合成数据(Synthetic Data)与动作轨迹(Trajectory)构建实践经验者优先。 3.能理解 Reward Modeling 基本原理及 Reward 信号设计对 RL 训练(PPO/GRPO/DAPO 等)的影响,有 RL/Post-Training 研究或机器学习Applied Scientist 相关经历者优先, 4.熟练使用 Python,熟悉主流的harness/agent框架,能独立完成数据处理脚本、自动化 Pipeline 和 QA 校验工具的开发 5.沟通与文档能力:优秀的书面表达能力,能产出清晰的 Rubric 规范、技术方案和问题定义文档;善于跨团队协作,能将算法侧的模型反馈准确翻译为数据策略调整。 6.有大规模机器学习任务调优经验者优先,有某个领域任务深度经验者优先(数学物理,ACM,kernel研发,高并发/HFT,软件工程,research,science等) 对LLM,AGI/ASI感兴趣,践行AI Native工作范式者优先

🏢 企业简介

成立1999 年性质世界500强股票代码09988总部杭州上市已上市
📍 主要办公地点
杭州北京上海广州深圳成都南京

投递方式

投递入口为会员专属,登录 / 注册 后查看(注册送 15 天免费试用)
🎁 内推码1RL8SV8 / P01KByLNQX9o0v0NWRqPByUTYT0L / 2T51KE6F填写可提高简历优先级(不保证录用)

🎯 该企业笔试专题

🎯 阿里巴巴笔试140 题去刷题 ›
📚 更多企业笔试真题:进入考试频道 ›

🎯 AI校招画像 (来源:DeepSeek AI搜索)

💰 薪资待遇与年终奖
2027届校招已启动,技术岗需笔试+2-3轮业务面+HR面,非技术岗15薪左右,实习250-500元/天。

ℹ️ 信息来源

本条招聘信息由校招宝转载自 阿里巴巴校招官网,版权归原发布方所有,校招宝仅作信息聚合与导航。
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。