面壁智能
岗位信息
招聘岗位
强化学习算法实习生(LLM Agent 方向)
工作城市
上海
学历要求
硕士
是否笔试
未明确
招聘批次
实习
发布日期
2026-09-22
📋 岗位职责 / 任职要求
【岗位职责】
1、面向 agentic 任务(多轮工具调用、代码修复 / SWE、网页搜索与信息检索、长程任务规划等)开展 LLM 的RL 后训练研究;
2、研究并改进面向多轮、长 horizon、稀疏奖励场景的 RL 算法(GRPO / PPO 及其变体),包括优势估计与 credit assignment、off-policy 修正、探索与熵控制、训练稳定性等问题;
3、参与 agent 任务的训练数据与评测设计:构造训练任务,设计可验证的奖励信号,分析 rollout 轨迹质量;
4、独立设计并执行实验:数据构造与筛选、消融实验、训练曲线与 rollout 轨迹分析,定位 reward hacking、训练崩溃等问题并给出改进方案,撰写技术报告;有机会产出论文或开源成果;
5、跟踪 agent RL 前沿工作并快速复现,在内部训练框架中落地验证。
【任职要求】
1、硕士及以上学历在读,计算机、人工智能、数学等相关专业;能持续实习 6 个月优先;
2、扎实的机器学习基础,熟悉 Transformer 架构,熟悉强化学习基本理论(策略梯度、PPO、GRPO 等),理解 LLM 后训练(SFT / RLHF / RLVR / OPD)的流程;
3、良好的 coding 能力与良好的实验素养:熟练使用 Python 和 PyTorch,能从训练指标和 rollout 样本中发现问题并得出可信结论;
4、自驱力强,能独立推进研究课题;
5、优秀的沟通与协作能力:能清晰地表达实验思路、结论和遇到的问题,与团队成员高效协作。
加分项
1、有 LLM RL 训练(RLHF / RLVR / agent RL)的实际经验;
2、有强化学习理论研究背景(策略优化、探索、credit assignment、off-policy 学习等),或相关实习;
3、在 NeurIPS / ICML / ICLR / ACL 等会议发表过相关论文,或有高质量开源项目;
4、ACM-ICPC / Kaggle 等竞赛获奖经历。
🏢 企业简介
总部北京
面壁智能是国内领先的大模型人工智能企业,专注于基础模型与高效训练推理技术的研发,在中文大模型领域具备突出的技术积累与行业影响力。公司总部位于北京,围绕智能体、端侧大模型等前沿方向持续布局,推动AI技术在多元场景中的落地应用。作为处于快速成长期的技术驱动型公司,面壁智能汇聚了来自顶尖高校与科研机构的研发力量,构建了开放的工程与研究氛围。在北京的在招岗位覆盖算法研究、工程开发等核心方向,为应届生提供参与前沿大模型项目、贴近产业一线的实践机会,技术路径清晰、发展前景广阔,适合具备探索精神与工程能力的毕业生加入。
投递方式
投递入口需登录后查看,登录 / 注册 即可使用ℹ️ 信息来源
本条招聘信息由校招宝转载自 飞书招聘系统(企业校招官网),版权归原发布方所有,校招宝仅作信息聚合与导航。
该来源未提供原文链接
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。