面壁智能
实习

岗位信息

招聘岗位
强化学习自进化实习生
工作城市
北京
是否笔试
未明确
招聘批次
实习
发布日期
2026-09-09

📋 岗位职责 / 任职要求

【岗位职责】 我们正在探索 AI4AI、自进化智能体与长程 Agentic Learning 等前沿方向。你将参与组内核心强化学习项目,与我们一起训练能够持续探索、自我改进并解决复杂任务的智能体。 工作内容 1. 参与强化学习算法的设计、实现、实验与迭代 2. 搭建和优化 RL 训练基础设施,提高训练效率、稳定性与可扩展性 3. 参与 Agentic Coding、长程 Agent 及自进化系统的训练 4. 分析训练轨迹、奖励信号和数据分布,定位模型能力瓶颈 5. 设计和组织高质量训练数据与评测体系 6. 跟进并复现强化学习、Agent、自进化与具身智能领域的最新工作 【任职要求】 1. 计算机、人工智能、自动化、数学等相关专业在读 2. 具备扎实的强化学习基础,理解常见算法及其训练机制 3. 算法能力强,能够快速理解论文并将想法落地为实验 4. 工程能力强,熟练使用 Python 和 PyTorch,具备良好的代码质量意识 5. 能独立完成实验设计、训练调试、结果分析与问题定位 6. 对 Agent、自进化、AI4AI 或具身智能方向有浓厚兴趣 7. 学习能力强,愿意面对开放性问题和高不确定性的研究任务 加分项 1. 在强化学习、Agent、AI4AI、自进化或具身智能方向发表过相关论文 2. 有大规模 RL 训练、分布式训练或 RL Infra 建设经验 3. 有 LLM Post-training、RLHF、Agentic RL 或 SWE-bench 相关经验 4. 具备良好的“数据品位”:能够敏锐观察数据、轨迹和训练现象,并据此设计数据配比、采样策略与实验 5. 有优秀的开源项目、竞赛成绩或可展示的研究成果 我们希望你 不一定同时精通算法与基础设施,但至少在其中一个方向有突出能力,并愿意深入真实、复杂的强化学习训练问题。 这里不仅是复现已有方法,你将有机会直接参与前沿方向探索,并对训练方案、数据设计、算法选择和系统实现产生实际影响。

🏢 企业简介

总部北京

投递方式

投递入口为会员专属,登录 / 注册 后查看(注册送 15 天免费试用)

ℹ️ 信息来源

本条招聘信息由校招宝转载自 飞书招聘系统(企业校招官网),版权归原发布方所有,校招宝仅作信息聚合与导航。
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。