世纪华通
岗位信息
招聘岗位
大模型后训练算法实习生(可转正)
是否笔试
未明确
招聘批次
实习
发布日期
2026-09-18
📋 岗位职责 / 任职要求
工作地点:上海
招聘类型:可转正实习
实习周期:长期
【项目介绍】
我们正在建设一套面向卡牌策略对抗场景的 AI 对战系统。项目涉及不完全信息推理、长序列决策、多角色协作与对抗、策略泛化等问题。
你将与项目负责人及算法团队共同参与模型训练、数据构建和评测体系建设,推动大模型从“能够理解局面”进一步发展为“能够稳定做出高质量策略决策”。
【岗位职责】
参与策略决策模型的后训练和效果优化,包括 SFT、偏好优化、强化学习等方向;
基于脱敏交互日志、专家策略和模拟对局,构建状态—动作数据、偏好数据及训练样本;
参与训练数据的清洗、筛选、难例挖掘、质量评估和数据配比实验;
设计或优化奖励信号,提升模型在局面判断、长期规划、风险控制和协作对抗等方面的能力;
参与 Self-play、离线回放和批量对抗实验,分析模型失败案例并持续迭代;
参与模型评测体系建设,关注胜率、决策合法率、策略稳定性、泛化能力和策略多样性等指标;
与 Agent、服务端及测试团队协作,推动模型能力接入完整的 AI 对战链路。
【任职要求】
计算机、人工智能、自动化、数学等相关专业在校生;
熟悉 Python,能够使用 PyTorch 等深度学习框架完成训练和实验;
实际参与过至少一个大模型训练或后训练项目,了解 SFT、DPO、PPO、GRPO 等一种或多种方法;
能够清晰说明项目中的数据来源、训练目标、实验设计、评测方法以及本人承担的工作;
对强化学习、序列决策或策略学习有基本理解;
具备良好的实验习惯,能够进行指标分析、失败案例归因和训练结果复现;
对复杂策略问题有兴趣,具备较强的学习能力和问题拆解能力。
【加分项】
有 Self-play、强化学习或多智能体训练经验;
有卡牌、棋类、博弈或其他游戏 AI 项目经验;
做过奖励模型、过程奖励、偏好数据构建或合成数据生成;
熟悉分布式训练、推理加速或训练框架;
有论文复现、算法竞赛、开源项目或技术博客等可展示成果;
对不完全信息博弈、对手建模或策略搜索有一定理解。
【你将获得】
参与真实策略对抗 AI 系统从训练到落地的完整过程;
接触数据构建、后训练、Self-play 和评测闭环,而不只是单一模型调参;
与项目负责人直接协作,对技术方案和模型迭代产生实际影响;
获得可量化、可复盘的模型训练和策略优化经验。
【投递建议】
请在简历中重点说明相关项目的:
项目目标、模型规模、训练方法、数据规模、评测指标、最终效果以及本人具体贡献。
🏢 企业简介
总部上海
世纪华通作为国内领先的民营游戏企业,总部位于上海,长期深耕游戏研发与运营领域,业务覆盖自主研发、发行及全球化运营,在A股游戏板块中具有显著的行业影响力。公司专注于精品化、长线化游戏产品打造,持续布局前沿技术研发与数字内容创新,在互动娱乐、元宇宙等方向积极拓展。以上海为核心研发与运营基地,团队汇聚大量资深从业者与青年人才,为应届生提供贴近产业一线的技术实践与项目锻炼机会。依托稳健的业务基本盘与清晰的全球化发展前景,世纪华通持续为游戏行业输送创新动能,也为校招人才打开了从校园到产业的成长通道
投递方式
投递入口需登录后查看,登录 / 注册 即可使用ℹ️ 信息来源
本条招聘信息由校招宝转载自 Moka 招聘系统(企业校招官网),版权归原发布方所有,校招宝仅作信息聚合与导航。
该来源未提供原文链接
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。