蚂蚁集团
校招民企技术类

岗位信息

招聘岗位
【蚂蚁星】多模态理解与生成评测算法研究-27届
工作城市
北京、杭州
学历要求
硕士
是否笔试
未明确
招聘批次
校招
发布日期
2026-08-26

📋 岗位职责 / 任职要求

我们聚焦实时多模态交互、数字人、虚拟环境、音视频生成等前沿 AI 场景,建设面向下一代多模态模型的评测算法与 Benchmark 体系。随着模型从“文本问答”走向 实时音视频理解、全双工语音交互、数字人生成、虚拟行为生成与多模态环境交互,传统静态评测已无法准确刻画模型能力。我们希望构建一套覆盖“理解 → 交互 → 生成 → 反馈”的多模态评估体系,帮助模型和产品持续发现能力边界、定位失败原因,并推动算法优化和产品体验提升。 重点研究方向: 1. 实时多模态理解评测: * 面向 audio-video-text 原生多模态模型,评估模型在连续音视频流中的理解能力; * 研究 streaming understanding、micro-turn understanding、audio-visual grounding、多轮上下文保持等能力评估方法; 2. 实时交互能力评测: * 评估模型在 full-duplex interaction、streaming speech-to-speech、turn-taking、barge-in、interrupt handling 等场景下的交互质量; * 设计首响延迟、首音频延迟、抢话率、漏听率、打断成功率、会话连续性等指标体系; 3. 多模态生成评测: * 面向 digital human、virtual avatar、talking head、full-body avatar、virtual environment、embodied behavior generation 等方向,评估生成内容的自然性、一致性和可控性; * 重点研究 lip-sync、audio-motion alignment、co-speech gesture、identity consistency、emotion/prosody consistency、temporal consistency 等评测方法; 4. 交互式生成评测: * 研究用户实时输入下,数字人、虚拟角色或虚拟环境是否能持续、稳定、可控地响应; * 评估用户中途打断、修改意图、切换任务、改变情绪或环境状态时,生成系统的响应质量; 5. 自动化 Judge 与评测可信度: * 探索 VLM Judge、Audio Judge、Multimodal Judge、LLM-as-Judge 在多模态评测中的应用; * 研究人评一致性、Judge 校准、Rubric 设计、评测偏差控制和评测结果可信度分析; 6. 多模态 Benchmark 建设: * 构建面向实时音视频交互、数字人、虚拟环境和多模态生成的高质量 Benchmark; * 解决静态测试集覆盖不足、主观体验难量化、真实用户场景不足、评测结果与产品体感不一致等问题。 岗位职责: 1. 设计面向实时多模态理解、交互和生成能力的评测指标体系与 Benchmark; 2. 构建音视频流式评测任务、数字人/虚拟环境交互任务、多模态生成任务等数据集; 3. 研发自动化评测方法,结合规则评分、模型裁判、人评校准和统计分析提升评测效率与可信度; 4. 分析多模态模型在理解、交互、生成、时序一致性、音画同步、行为自然性等方面的失败原因; 5. 跟踪 GPT-realtime、Gemini Live、SeedRealtime、Sora、Seedance、数字人、虚拟角色、世界模型等方向的前沿进展,并转化为内部评测方法; 6. 推动研究成果在真实业务中落地,产出评测基准、技术报告、专利、论文或开源项目。 职位要求 1. 计算机科学、人工智能、机器学习、语音、多模态、计算机视觉、图形学等相关专业硕士及以上学历,博士或具备同等研究能力者优先; 2. 熟练使用 Python,熟悉 PyTorch 或其他深度学习框架,能够独立完成算法实验、评测原型和数据分析; 3. 熟悉以下一个或多个方向:Multimodal LLM / Omni-modal Model、Vision-Language Model、Speech LM / Audio LM、Streaming ASR / Streaming TTS、Audio-Visual Understanding、Digital Human / Virtual Avatar、Talking Head / Full-body Avatar、Motion Generation / 3D Facial Animation、Neural Rendering / 3D Gaussian Splatting、Video Diffusion / Diffusion Transformer; 4. 具备较强的实验设计和问题抽象能力,能够把“自然不自然”“像不像真人”“交互顺不顺”这类主观体验转化为可验证的评测指标; 5. 对多模态前沿技术有持续兴趣,能够快速阅读论文、复现方法,并结合业务场景形成可落地方案; 6. 具备良好的工程能力和沟通能力,能够与算法、产品、工程团队协作推动评测体系落地。 加分项: 1. 在 ICLR、NeurIPS、ICML、ACL、EMNLP、CVPR、ICCV、ECCV、SIGGRAPH、AAAI 等会议发表过高质量论文; 2. 有多模态大模型、语音大模型、数字人、视频生成、3D 生成、虚拟环境或世界模型相关项目经验; 3. 参与过 Benchmark、评测框架、数据集、开源项目或算法竞赛; 4. 有 VLM-as-Judge、LLM-as-Judge、Audio Judge、人评一致性校准等评测经验; 5. 熟悉 WebRTC、流媒体、实时推理、音视频处理、Unity、Unreal、WebGL、Three.js 等实时交互技术; 6. 有数字人、虚拟陪伴、实时语音助手、AI 视频生成、交互式 AIGC 产品体验或研究经验。 意向单
📍 主要办公地点
浙江杭州北京上海广东深圳四川成都

投递方式

投递入口为会员专属,登录 / 注册 后查看(注册送 15 天免费试用)
🎁 内推码1RL8SV8 / P01KByLNQX9o0v0NWRqPByUTYT0L / 2T51KE6F填写可提高简历优先级(不保证录用)

🎯 该企业笔试专题

🎯 蚂蚁笔试100 题去刷题 ›
📚 更多企业笔试真题:进入考试频道 ›

🎯 AI校招画像 (来源:DeepSeek AI搜索)

🏢 公司文化与工作氛围
技术驱动、工程师文化浓厚,强调ownership与端到端闭环,团队年轻、扁平,鼓励用技术解决真实业务问题,大模型、Agent等前沿方向投入大、成长快。
⏰ 加班情况与工作强度
互联网大厂节奏,项目迭代快、上线压力较大,存在阶段性加班与oncall;不同事业群差异明显,基础技术与大模型核心团队强度偏高。
💰 薪资待遇与年终奖
技术岗薪酬处于行业第一梯队,算法工程师岗位月薪多集中在30-50k区间,研发岗普遍13-16薪结构;实习生日薪约400-450元,具体总包按岗位、学历与面试评级(白菜/SP/SSP)浮动。
🎁 福利体系
五险一金按高标准缴纳,补充商业保险、年终奖与股票/期权激励、餐补、免费班车或交通补贴、带薪年假、定期体检、健身房、租房补贴等,杭州总部配套完善。
📋 校招流程经验
网申或内推—在线笔试/测评(每周四、日任选,单场约2小时,多为AI Coding)—技术面试1-2轮(项目深挖+算法编码)—HR面—录用意向书—offer;同批次仅1次投递、最多2个意向、投递后不可修改。
🚀 投递建议与避坑指南
技术岗务必提前刷算法与AI Coding题、准备有深度的项目并能讲清技术细节;大模型、Agent、区块链、安全是扩招重点,相关论文、竞赛或开源经历加分;投递前谨慎选择2个意向方向,建议优先内推并关注每周四/日的笔试时段。
👥 员工口碑与离职率评价
员工普遍认可技术氛围与成长速度、平台与薪酬竞争力,认为能接触亿级用户系统与前沿大模型技术;同时反馈节奏快、压力大、绩效竞争激烈,适合技术自驱、追求快速成长的人。
📈 热门岗位方向与招聘趋势
2027届校招技术岗占比约80%,其中超八成与AI相关,大模型预训练、Agent应用工程、AI Coding Harness、区块链与安全方向明显扩招,杭州为主、京沪蓉深均有岗位,是当前AI校招需求最旺盛的大厂之一。

ℹ️ 信息来源

本条招聘信息由校招宝转载自 蚂蚁集团校招官网,版权归原发布方所有,校招宝仅作信息聚合与导航。
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。