我们正在开发一个面向生物医药研发的 AI4Science 平台,致力于通过大模型与智能 Agent 技术,提升科研数据的处理效率与分析能力。
在平台建设过程中,需要大量高质量的公开生物医学数据(如 GEO 等公共数据库数据)作为基础支撑,用于信息提取,分析对比及能力验证。当前仍存在较大的数据缺口,亟需系统化的数据整理与质控工作,以支撑平台能力的持续迭代。
【岗位职责】
>核心工作
1. 参与公开生物医药数据库(如 GEO)数据的清洗与整理工作
2. 支持生物医药数据的处理与质量控制
3. 高质量、大样本数据集筛选
4. 元数据提取与标准化
5. 样本信息审阅与一致性校验
6. 协助构建结构化数据集,用于信息提取、对比与评估
>进阶 / 扩展工作(视能力与时间)
1. 探索 LLM + 人工协同的数据清洗和质控流程(如 Prompt 设计、自动化校验)
2. 参与不同数据集之间的对比分析与数据质量评估
3. 协助优化数据组织方式,支持 AI 模型更高效使用
【任职要求】
>必须条件
1. 在读硕士及以上,生物信息学 / 计算生物学 / 生物统计等相关专业
2. 有 GEO、TCGA、DepMap、GTEx 等公共数据库 RNA-seq 数据处理经验
3. 熟悉生信数据结构(expression matrix、metadata 等)及基本分析流程
4. 有数据清洗、数据质控或数据整理经验
>加分项(Good to Have)
1. 有 LLM / AI Agent 在数据处理或自动化流程中的使用经验
2. 有较大规模数据处理或数据工程经验(Python / R / SQL 等)
3. 有医药相关数据处理经验,例如:
- 小分子,临床数据处理
- DMPK / ADMET 数据分析
- 化合物数据或数据库使用经验(GOSTAR、PubChem、ChEMBL 等)
- 有组学数据库使用经验,如蛋白质组学数据库(PRIDE 等)