面壁智能
岗位信息
招聘岗位
多模态推理infra实习生
工作城市
北京
是否笔试
未明确
招聘批次
2027届
发布日期
2026-09-29
📋 岗位职责 / 任职要求
【岗位职责】
关于我们
我们是一支专注于端侧多模态大模型推理的团队,致力于让大模型在手机、PC 等设备上实现实时的多模态交互。团队维护自研的开源推理引擎,并持续参与开源社区建设。
职位描述
1、负责推理引擎的核心设计与开发,包括计算图优化、算子与 Kernel 实现、内存与 KV Cache 管理、多流调度;
2、负责实时流式推理链路的设计与优化,覆盖多模态流式编码、多流同步、多模块并行流水线,以及语音链路的 TTS 与声码器,持续优化首包延迟与实时率;
3、负责端侧推理的落地与加速,包括主流 GPU / NPU 后端适配、模型格式转换与量化压缩、内存与显存优化;
4、参与开源项目建设与社区协作,并与训练团队配合打通训练到推理的全链路,跟踪并落地前沿推理优化技术。
【任职要求】
1、熟悉大模型架构与推理原理,理解计算图、算子、内存布局、KV Cache 等底层细节;
2、熟悉 C++ 和 Python,有扎实的工程基础与良好的代码能力;
3、有主流推理框架 / 引擎的源码级二次开发经验,如 vLLM、SGLang、TensorRT-LLM、llama.cpp 等;端侧推理引擎经验优先;
4、至少熟悉一种 GPU / 加速后端编程:CUDA、Metal、CANN / HIP / SYCL 等。
加分项
1、有全模态 / 多模态大模型推理优化或引擎开发经验;
2、有流式 / 低延迟系统经验(多线程异步流水线、并发与调度、性能剖析),或有语音链路经验(TTS、声码器、流式语音合成、voice cloning);
3、有端侧 / 移动端部署与优化经验(iOS / Android、交叉编译、GPU / NPU 适配),或有大模型推理性能优化经验(量化、内存优化、并行与调度);
4、有知名开源项目的核心贡献或 maintainer 经历。
🏢 企业简介
总部北京
面壁智能是国内领先的大模型人工智能企业,专注于基础模型与高效训练推理技术的研发,在中文大模型领域具备突出的技术积累与行业影响力。公司总部位于北京,围绕智能体、端侧大模型等前沿方向持续布局,推动AI技术在多元场景中的落地应用。作为处于快速成长期的技术驱动型公司,面壁智能汇聚了来自顶尖高校与科研机构的研发力量,构建了开放的工程与研究氛围。在北京的在招岗位覆盖算法研究、工程开发等核心方向,为应届生提供参与前沿大模型项目、贴近产业一线的实践机会,技术路径清晰、发展前景广阔,适合具备探索精神与工程能力的毕业生加入。
投递方式
投递入口需登录后查看,登录 / 注册 即可使用ℹ️ 信息来源
本条招聘信息由校招宝转载自 飞书招聘系统(企业校招官网),版权归原发布方所有,校招宝仅作信息聚合与导航。
该来源未提供原文链接
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。