阿里巴巴集团
岗位信息
招聘岗位
算法工程师-Agent在线强化学习(T-Star Lab)
工作城市
杭州
毕业届别
2027
学历要求
博士
是否笔试
未明确
招聘批次
2027届
发布日期
2026-07-30
📋 岗位职责 / 任职要求
职位类别:技术类
业务集团:淘天集团
职位描述:T-Star计划是阿里巴巴淘天集团顶尖人才招聘和培养项目,继承“阿里星〞的使命与愿景,面向全球招募顶尖技术人才。首次开设实习生专项招聘,面向2026年11月及以后毕业的校优秀技术同学。期待你们在淘天,通过极具挑战的前沿课题与亿级规模的海量数据、应用场景,探索和实践最前沿的Al技术,在有价值的业务场景落地技术成果。
1. 理论研究:负责本体约束的在线强化学习框架建模,并进行理论证明、自进化的收敛性分析
2. 算法开发:设计并实现本体增强的安全在线RL算法族、LLM-RL协同决策算法、跨大促Meta-RL与经验固化算法
3. 场景落地:在双11/618等真实大促中验证系统效果;与SRE/研发团队协作确保决策可信赖;量化评估业务价值
职位要求:● 计算机科学、人工智能、运筹学、自动化等相关方向博士
● 扎实的强化学习理论功底,精通主流RL算法(Policy Gradient/PPO/GRPO及其变体),有实际实现与调优经验
● 熟练Python + PyTorch,具备生产级代码交付能力
● 在ICML/NeurIPS/ICLR/AAAI/ACL/WWW等顶会有一作或共同一作论文发表,或有等价的突出研究成果
● 第一性原理思维: 能从问题本质出发设计方案,而非套用现有方法
● 理论与实践并重: 既能推公式证定理,也能写出高质量生产代码
● 大促体感: 对""安全红线""有敬畏心,理解生产环境不允许trial-and-error
● 跨域学习能力: 愿意深入理解业务/运维/研发领域知识,而非将其视为黑箱
● 长期主义: 认同""自进化""的愿景,愿意用3年时间构建有壁垒的系统
加分项:
● 包括安全强化学习、在线学习、元学习、多智能体,了解本体工程、神经符号推理,有LLM与决策系统结合的研究经验,了解大规模分布式系统、AIOps、SRE相关背景知识,有扎实的数学功底,包括优化理论、概率论、随机过程功底扎实,能独立完成定理证明
🏢 企业简介
成立1999 年性质世界500强股票代码09988总部杭州上市已上市
📍 主要办公地点
投递方式
投递入口为会员专属,登录 / 注册 后查看(注册送 15 天免费试用)🎁 内推码:
1RL8SV8 / P01KByLNQX9o0v0NWRqPByUTYT0L / 2T51KE6F填写可提高简历优先级(不保证录用)🎯 AI校招画像 (来源:DeepSeek AI搜索)
💰 薪资待遇与年终奖
2027届校招已启动,技术岗需笔试+2-3轮业务面+HR面,非技术岗15薪左右,实习250-500元/天。
ℹ️ 信息来源
本条招聘信息由校招宝转载自 阿里巴巴校招官网,版权归原发布方所有,校招宝仅作信息聚合与导航。
该来源未提供原文链接
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。