上海创智学院
岗位信息
招聘岗位
基于 LLM 的数据标注与标准化实习生
是否笔试
未明确
招聘批次
实习
发布日期
2026-09-13
📋 岗位职责 / 任职要求
【岗位职责】
1. 设计并维护化学数据标注规范,针对化学反应、催化体系、谱学表征和实验数据等不同类型信息,制定结构化数据 schema、标注规则和 Few-shot 标注示例,保证多来源数据的一致性与可用性。
2. 搭建 LLM 辅助的数据标注与信息抽取流程,利用 GPT、Claude、Qwen 等大语言模型对科研文献、实验记录和计算结果进行自动化解析,抽取反应物、产物、实验条件、催化性能等关键化学信息。
3. 编写数据处理脚本,实现大规模文献和实验数据的批量解析、结果整理与格式转换,提升化学数据构建效率。
4. 建立 LLM 输出质量控制体系,包括规则校验、模型辅助检测和人工复核流程,分析信息抽取准确率和错误类型,持续优化 Prompt、标注规范和校验策略。
5. 协助构建原子级催化剂数据集,对抽取结果进行清洗、去重、标准化处理,并整合至“组分—结构—谱学—活性”多维化学数据库体系。
6. 参与数据集建设、实验流程优化和项目组讨论,定期汇报阶段性工作进展,根据项目需求承担新的数据整理与智能化标注任务。
【任职要求】
1. 招募对象:本科生、硕士研究生。
2. 化学、化工、材料、计算机、人工智能、数据科学、信息管理等相关专业背景优先;化学背景不是必需,但需具备学习化学数据规范和科研知识的兴趣。
3. 具备 Python 编程能力,熟悉 pandas 等数据处理工具,能够完成数据清洗、格式转换和批量处理任务。
4. 了解大语言模型基本使用方法,具备以下经验者优先:使用 GPT、Claude、Qwen 等大模型 API;Prompt Engineering;LLM 信息抽取或自动化工作流搭建。
5. 能够阅读英文科研论文和技术文档,理解化学领域文献中的数据结构和实验信息。
6. 具备以下经历者优先:数据处理、数据库建设或知识图谱项目;爬虫、文本挖掘、自然语言处理(NLP)相关项目;AI 工具辅助科研或自动化数据处理经验。
7. 本科生要求:具备基础编程能力和较强学习能力;不要求已有正式科研经历,更关注数据规范意识、责任心和对 AI+化学交叉方向的兴趣。
8. 硕士研究生要求:具备一定数据分析、机器学习或科研项目经验;能够参与数据流程设计、质量分析和方法优化工作。
9. 工作认真细致,对数据质量敏感,能够接受大量重复性但规则明确的数据标注、校验和复核任务。
10. 对 AI for Science、大模型应用、化学数据智能化和科学基础模型方向具有持续兴趣,能够稳定投入科研时间。
11. 实习安排:线上线下结合;周期3–6个月;每周投入10–20小时。
投递方式
投递入口为会员专属,登录 / 注册 后查看(注册送 15 天免费试用)ℹ️ 信息来源
本条招聘信息由校招宝转载自 飞书招聘系统(企业校招官网),版权归原发布方所有,校招宝仅作信息聚合与导航。
该来源未提供原文链接
招聘信息以官方原文为准,投递前请核实截止日期与要求。如涉侵权或信息有误,请邮件联系 kknee@qq.com,我们将在 24 小时内处理。