阿里巴巴集团
岗位信息
招聘岗位
面向Auto Research的强化学习算法与数据合成体系研究-阿里星
工作城市
北京、杭州
毕业届别
2027
学历要求
博士
是否笔试
未明确
招聘批次
2027届
发布日期
2026-08-04
📋 岗位职责 / 任职要求
职位类别:技术类
业务集团:阿里巴巴控股集团
职位描述:作为 Auto Research RL 算法研究与数据合成方向的算法研究员,你将参与或负责以下工作:
1.研究 Auto Research Agent 的核心训练方法,围绕理工类科研领域(如生物化学材料物理等)自动化科研智能体的自主决策、规划、工具调用、代码执行与实验验证能力,开展系统性算法研究;
2.设计并构建 Agentic 数据合成体系,研究大规模 Agent 轨迹数据的高效生成、清洗、筛选、增强与配比策略,构建高质量后训练数据管线;
3.探索稳定高效的 Agentic RL 训练方案,应用并改进 PPO、DPO、GRPO 等强化学习算法,优化长程任务中的奖励设计、训练稳定性、探索效率与泛化能力;
4.提升模型在代码、真实科研流程、实验场景中的任务成功率,针对代码生成、实验执行、错误修复、结果分析、论文写作等任务,构建训练与评测闭环,持续提升模型鲁棒性;
5.推动学术成果产出与开源建设,将研究成果整理为高水平论文,投稿至国际顶级会议;根据项目情况推动算法、数据或模型开源,提升团队技术影响力。
职位要求:1.计算机科学、人工智能、信息科学、数学、统计学、自动化或相关STEM专业以及交叉学科背景(如计算生物学、计算神经科学、计算化学)的应届博士毕业生,或即将获得博士学位的优秀候选人;
2.在领域内高水平学术期刊会议上发表论文并经过同行评议;或研究内容形成专利成果;
3.具备扎实的编程能力,熟练使用 Python,熟悉 PyTorch 或类似深度学习框架,能够独立完成算法实现、实验设计与结果分析;
4.深入理解以下至少一个方向:大语言模型 / 多模态大模型、强化学习 / 强化学习后训练、Agent 系统 / 工具调用 / 自主决策、代码智能体 / 自动化科研 / 自动化推理等。熟悉主流强化学习或偏好优化算法,包括但不限于:PPO、DPO、GRPO等;如为自然科学专业,需具备扎实的编程基础,并对AI for Science有强烈兴趣和深入的见解;
5.能够独立推进科研项目,具备较强的理论知识背景、问题定义能力、实验设计能力、论文阅读与复现能力,能够针对复杂问题提出创新性解决方案;
6.具有强自驱力、学习能力、创新意识和沟通协作能力,能够适应快速变化的 AI 研究方向、适应跨学科合作的工作环境,并具备一定抗压能力。
🏢 企业简介
成立1999 年性质世界500强股票代码09988总部杭州上市已上市
📍 主要办公地点
投递方式
投递入口为会员专属,登录 / 注册 后查看(注册送 15 天免费试用)🎁 内推码:
1RL8SV8 / P01KByLNQX9o0v0NWRqPByUTYT0L / 2T51KE6F填写可提高简历优先级(不保证录用)🎯 AI校招画像 (来源:DeepSeek AI搜索)
💰 薪资待遇与年终奖
2027届校招已启动,技术岗需笔试+2-3轮业务面+HR面,非技术岗15薪左右,实习250-500元/天。
ℹ️ 信息来源
本条招聘信息由校招宝转载自 阿里巴巴校招官网,版权归原发布方所有,校招宝仅作信息聚合与导航。
该来源未提供原文链接
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。