蚂蚁集团
岗位信息
招聘岗位
【蚂蚁星】多模态理解与生成评测算法研究-27届
工作城市
北京、杭州
学历要求
硕士
是否笔试
未明确
招聘批次
校招
发布日期
2026-08-26
📋 岗位职责 / 任职要求
我们聚焦实时多模态交互、数字人、虚拟环境、音视频生成等前沿 AI 场景,建设面向下一代多模态模型的评测算法与 Benchmark 体系。随着模型从“文本问答”走向 实时音视频理解、全双工语音交互、数字人生成、虚拟行为生成与多模态环境交互,传统静态评测已无法准确刻画模型能力。我们希望构建一套覆盖“理解 → 交互 → 生成 → 反馈”的多模态评估体系,帮助模型和产品持续发现能力边界、定位失败原因,并推动算法优化和产品体验提升。
重点研究方向:
1. 实时多模态理解评测:
* 面向 audio-video-text 原生多模态模型,评估模型在连续音视频流中的理解能力;
* 研究 streaming understanding、micro-turn understanding、audio-visual grounding、多轮上下文保持等能力评估方法;
2. 实时交互能力评测:
* 评估模型在 full-duplex interaction、streaming speech-to-speech、turn-taking、barge-in、interrupt handling 等场景下的交互质量;
* 设计首响延迟、首音频延迟、抢话率、漏听率、打断成功率、会话连续性等指标体系;
3. 多模态生成评测:
* 面向 digital human、virtual avatar、talking head、full-body avatar、virtual environment、embodied behavior generation 等方向,评估生成内容的自然性、一致性和可控性;
* 重点研究 lip-sync、audio-motion alignment、co-speech gesture、identity consistency、emotion/prosody consistency、temporal consistency 等评测方法;
4. 交互式生成评测:
* 研究用户实时输入下,数字人、虚拟角色或虚拟环境是否能持续、稳定、可控地响应;
* 评估用户中途打断、修改意图、切换任务、改变情绪或环境状态时,生成系统的响应质量;
5. 自动化 Judge 与评测可信度:
* 探索 VLM Judge、Audio Judge、Multimodal Judge、LLM-as-Judge 在多模态评测中的应用;
* 研究人评一致性、Judge 校准、Rubric 设计、评测偏差控制和评测结果可信度分析;
6. 多模态 Benchmark 建设:
* 构建面向实时音视频交互、数字人、虚拟环境和多模态生成的高质量 Benchmark;
* 解决静态测试集覆盖不足、主观体验难量化、真实用户场景不足、评测结果与产品体感不一致等问题。
岗位职责:
1. 设计面向实时多模态理解、交互和生成能力的评测指标体系与 Benchmark;
2. 构建音视频流式评测任务、数字人/虚拟环境交互任务、多模态生成任务等数据集;
3. 研发自动化评测方法,结合规则评分、模型裁判、人评校准和统计分析提升评测效率与可信度;
4. 分析多模态模型在理解、交互、生成、时序一致性、音画同步、行为自然性等方面的失败原因;
5. 跟踪 GPT-realtime、Gemini Live、SeedRealtime、Sora、Seedance、数字人、虚拟角色、世界模型等方向的前沿进展,并转化为内部评测方法;
6. 推动研究成果在真实业务中落地,产出评测基准、技术报告、专利、论文或开源项目。
职位要求
1. 计算机科学、人工智能、机器学习、语音、多模态、计算机视觉、图形学等相关专业硕士及以上学历,博士或具备同等研究能力者优先;
2. 熟练使用 Python,熟悉 PyTorch 或其他深度学习框架,能够独立完成算法实验、评测原型和数据分析;
3. 熟悉以下一个或多个方向:Multimodal LLM / Omni-modal Model、Vision-Language Model、Speech LM / Audio LM、Streaming ASR / Streaming TTS、Audio-Visual Understanding、Digital Human / Virtual Avatar、Talking Head / Full-body Avatar、Motion Generation / 3D Facial Animation、Neural Rendering / 3D Gaussian Splatting、Video Diffusion / Diffusion Transformer;
4. 具备较强的实验设计和问题抽象能力,能够把“自然不自然”“像不像真人”“交互顺不顺”这类主观体验转化为可验证的评测指标;
5. 对多模态前沿技术有持续兴趣,能够快速阅读论文、复现方法,并结合业务场景形成可落地方案;
6. 具备良好的工程能力和沟通能力,能够与算法、产品、工程团队协作推动评测体系落地。
加分项:
1. 在 ICLR、NeurIPS、ICML、ACL、EMNLP、CVPR、ICCV、ECCV、SIGGRAPH、AAAI 等会议发表过高质量论文;
2. 有多模态大模型、语音大模型、数字人、视频生成、3D 生成、虚拟环境或世界模型相关项目经验;
3. 参与过 Benchmark、评测框架、数据集、开源项目或算法竞赛;
4. 有 VLM-as-Judge、LLM-as-Judge、Audio Judge、人评一致性校准等评测经验;
5. 熟悉 WebRTC、流媒体、实时推理、音视频处理、Unity、Unreal、WebGL、Three.js 等实时交互技术;
6. 有数字人、虚拟陪伴、实时语音助手、AI 视频生成、交互式 AIGC 产品体验或研究经验。
意向单
📍 主要办公地点
投递方式
投递入口为会员专属,登录 / 注册 后查看(注册送 15 天免费试用)🎁 内推码:
1RL8SV8 / P01KByLNQX9o0v0NWRqPByUTYT0L / 2T51KE6F填写可提高简历优先级(不保证录用)🎯 AI校招画像 (来源:DeepSeek AI搜索)
🏢 公司文化与工作氛围
技术驱动、工程师文化浓厚,强调ownership与端到端闭环,团队年轻、扁平,鼓励用技术解决真实业务问题,大模型、Agent等前沿方向投入大、成长快。
⏰ 加班情况与工作强度
互联网大厂节奏,项目迭代快、上线压力较大,存在阶段性加班与oncall;不同事业群差异明显,基础技术与大模型核心团队强度偏高。
💰 薪资待遇与年终奖
技术岗薪酬处于行业第一梯队,算法工程师岗位月薪多集中在30-50k区间,研发岗普遍13-16薪结构;实习生日薪约400-450元,具体总包按岗位、学历与面试评级(白菜/SP/SSP)浮动。
🎁 福利体系
五险一金按高标准缴纳,补充商业保险、年终奖与股票/期权激励、餐补、免费班车或交通补贴、带薪年假、定期体检、健身房、租房补贴等,杭州总部配套完善。
📋 校招流程经验
网申或内推—在线笔试/测评(每周四、日任选,单场约2小时,多为AI Coding)—技术面试1-2轮(项目深挖+算法编码)—HR面—录用意向书—offer;同批次仅1次投递、最多2个意向、投递后不可修改。
🚀 投递建议与避坑指南
技术岗务必提前刷算法与AI Coding题、准备有深度的项目并能讲清技术细节;大模型、Agent、区块链、安全是扩招重点,相关论文、竞赛或开源经历加分;投递前谨慎选择2个意向方向,建议优先内推并关注每周四/日的笔试时段。
👥 员工口碑与离职率评价
员工普遍认可技术氛围与成长速度、平台与薪酬竞争力,认为能接触亿级用户系统与前沿大模型技术;同时反馈节奏快、压力大、绩效竞争激烈,适合技术自驱、追求快速成长的人。
📈 热门岗位方向与招聘趋势
2027届校招技术岗占比约80%,其中超八成与AI相关,大模型预训练、Agent应用工程、AI Coding Harness、区块链与安全方向明显扩招,杭州为主、京沪蓉深均有岗位,是当前AI校招需求最旺盛的大厂之一。
ℹ️ 信息来源
本条招聘信息由校招宝转载自 蚂蚁集团校招官网,版权归原发布方所有,校招宝仅作信息聚合与导航。
该来源未提供原文链接
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。