世纪华通

校招民企

岗位信息

招聘岗位
大模型后训练算法实习生(可转正)
是否笔试
未明确
招聘批次
校招

📋 岗位职责 / 任职要求

工作地点:上海 招聘类型:可转正实习 实习周期:长期 【项目介绍】 我们正在建设一套面向卡牌策略对抗场景的 AI 对战系统。项目涉及不完全信息推理、长序列决策、多角色协作与对抗、策略泛化等问题。 你将与项目负责人及算法团队共同参与模型训练、数据构建和评测体系建设,推动大模型从“能够理解局面”进一步发展为“能够稳定做出高质量策略决策”。 【岗位职责】 参与策略决策模型的后训练和效果优化,包括 SFT、偏好优化、强化学习等方向; 基于脱敏交互日志、专家策略和模拟对局,构建状态—动作数据、偏好数据及训练样本; 参与训练数据的清洗、筛选、难例挖掘、质量评估和数据配比实验; 设计或优化奖励信号,提升模型在局面判断、长期规划、风险控制和协作对抗等方面的能力; 参与 Self-play、离线回放和批量对抗实验,分析模型失败案例并持续迭代; 参与模型评测体系建设,关注胜率、决策合法率、策略稳定性、泛化能力和策略多样性等指标; 与 Agent、服务端及测试团队协作,推动模型能力接入完整的 AI 对战链路。 【任职要求】 计算机、人工智能、自动化、数学等相关专业在校生; 熟悉 Python,能够使用 PyTorch 等深度学习框架完成训练和实验; 实际参与过至少一个大模型训练或后训练项目,了解 SFT、DPO、PPO、GRPO 等一种或多种方法; 能够清晰说明项目中的数据来源、训练目标、实验设计、评测方法以及本人承担的工作; 对强化学习、序列决策或策略学习有基本理解; 具备良好的实验习惯,能够进行指标分析、失败案例归因和训练结果复现; 对复杂策略问题有兴趣,具备较强的学习能力和问题拆解能力。 【加分项】 有 Self-play、强化学习或多智能体训练经验; 有卡牌、棋类、博弈或其他游戏 AI 项目经验; 做过奖励模型、过程奖励、偏好数据构建或合成数据生成; 熟悉分布式训练、推理加速或训练框架; 有论文复现、算法竞赛、开源项目或技术博客等可展示成果; 对不完全信息博弈、对手建模或策略搜索有一定理解。 【你将获得】 参与真实策略对抗 AI 系统从训练到落地的完整过程; 接触数据构建、后训练、Self-play 和评测闭环,而不只是单一模型调参; 与项目负责人直接协作,对技术方案和模型迭代产生实际影响; 获得可量化、可复盘的模型训练和策略优化经验。 【投递建议】 请在简历中重点说明相关项目的: 项目目标、模型规模、训练方法、数据规模、评测指标、最终效果以及本人具体贡献。

🏢 企业简介

总部上海

世纪华通作为国内领先的民营游戏企业,总部位于上海,长期深耕游戏研发与运营领域,业务覆盖自主研发、发行及全球化运营,在A股游戏板块中具有显著的行业影响力。公司专注于精品化、长线化游戏产品打造,持续布局前沿技术研发与数字内容创新,在互动娱乐、元宇宙等方向积极拓展。以上海为核心研发与运营基地,团队汇聚大量资深从业者与青年人才,为应届生提供贴近产业一线的技术实践与项目锻炼机会。依托稳健的业务基本盘与清晰的全球化发展前景,世纪华通持续为游戏行业输送创新动能,也为校招人才打开了从校园到产业的成长通道

投递方式

投递入口需登录后查看,登录 / 注册 即可使用

ℹ️ 信息来源

本条招聘信息由校招宝转载自 Moka 招聘系统(企业校招官网),版权归原发布方所有,校招宝仅作信息聚合与导航。
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。