《生物信息学》是一门面向生物育种、农学、种子科学与工程及植物生产类相关专业学生开设的交叉性专业课程。随着高通量测序、基因组学和多组学技术的快速发展,生命科学研究正在从传统实验观察进入数据密集型研究阶段。如何获取、管理、分析和解释海量生物学数据,已经成为现代生命科学和作物育种研究的重要基础。本课程围绕“生物数据从哪里来、如何存储、如何分析、如何解释、如何服务农业科学问题”这一主线,系统介绍生物信息学的基本概念、常用数据库、核心算法、分析流程和典型应用,帮助学生掌握利用数据分析方法解决生物学问题的基本能力。
一、课程定位与学习目标
本课程既是一门生物学与信息科学交叉的基础课程,也是一门面向作物遗传改良和功能基因组研究的应用课程。课程面向具有遗传学、分子生物学和基础计算机知识背景的学生,重点培养学生理解生物信息学基本原理、熟悉常用数据资源和分析工具、能够围绕作物目标基因开展初步数据分析与结果解释的能力。通过课程学习,学生将能够完成序列检索、同源搜索、序列比对、功能域分析、系统发生树构建、基因功能注释和组学结果初步解读,为后续学习多组学分析、智能育种和生物大数据分析奠定基础。
二、课程主要内容
1. 生物信息学基础与生物数据类型:课程首先介绍生物信息学的基本概念、发展历史和学科特点,帮助学生理解生物信息学产生的科学背景及其在现代生命科学中的作用。课程还将讲解核苷酸序列、蛋白质序列与结构、基因组、转录组、表观组、表型组和微生物组等主要生物信息类型,使学生了解不同数据的来源、格式、特点及应用场景。
2. 高通量测序技术与数据产生:课程介绍第一代、第二代和第三代测序技术的发展脉络,重点讲解 Illumina、PacBio SMRT 和 Oxford Nanopore 等代表性测序技术的基本原理、数据特点和适用范围。同时,课程结合 FASTA、FASTQ、GFF、GTF、VCF 等常见数据格式,介绍测序质量评估、测序深度、Q30、读长、接头污染和数据预处理等基础内容。
3. 分子数据库与公共数据资源:公共数据库是开展生物信息学分析的重要基础。课程将介绍核苷酸序列数据库、蛋白质序列数据库、蛋白质结构数据库、结构域数据库和功能注释数据库等资源,帮助学生熟悉 NCBI、DDBJ、EMBL、UniProt、PDB、Pfam、InterPro、GO、KEGG 及国家生物信息中心等常用数据库。学生将学习数据检索、序列下载、格式识别和注释信息解读,并形成规范使用公共数据资源的意识。
4. 序列比对、同源搜索与功能域分析:序列分析是生物信息学的基础内容。课程将介绍序列一致性、相似性、同源性、计分矩阵、空位罚分、全局比对、局部比对和 BLAST 搜索等内容,使学生理解如何通过序列比较推测同源关系和潜在功能。在多序列联配与功能域分析部分,课程将讲解多序列比对工具、保守位点识别、功能域检索、蛋白质基序分析、HMM 模型和 HMMER 搜索等内容。
5. 系统发生树构建与分子进化分析:系统发生树是分析物种、基因和蛋白质演化关系的重要工具。课程将介绍分子进化基础、有根树与无根树、基因树与物种树、枝长、Bootstrap 支持率和分子钟等概念,并讲解邻接法、最大简约法、最大似然法和贝叶斯法等常用构树方法。学生将学习从同源序列出发,经过多序列比对、模型选择、系统树构建和可靠性评价,完成系统发生树的构建与解释。
6. 基因组拼接、基因预测与功能注释:在基因组分析部分,课程介绍全基因组测序拼接的基本思路,包括基因组调查、k-mer 分析、Contig、Scaffold、N50、OLC 算法、德布鲁因图算法和染色体水平组装等内容。随后,课程讲解基因组注释分析,包括重复序列识别、蛋白编码基因预测、非编码 RNA 鉴定、GO 和 KEGG 注释、结构域分析、同源基因聚类、共线性分析和基因家族分析等,使学生理解从基因组序列到基因功能解释的基本流程。
7. 蛋白质功能分析与结构预测:课程介绍蛋白质序列、结构和功能之间的关系,讲解蛋白质序列测定、结构域数据库、蛋白质基序、蛋白质互作、蛋白质结构层次和三维结构预测等内容。课程还将介绍 CASP、AlphaFold 等蛋白质结构预测相关内容,使学生了解人工智能技术在蛋白质结构预测和功能研究中的应用。
8. 转录组、调控网络与多组学分析:课课程介绍 RNA-seq 数据质量控制、转录组组装、表达定量、差异表达分析、聚类分析、GO 和 KEGG 富集分析、可变剪接、共表达网络和转录调控网络分析等内容。在此基础上,课程拓展介绍重测序与 GWAS、表观遗传、多组学整合和微生物组学,包括 SNP 检测、群体结构、PCA、连锁不平衡、QTL、曼哈顿图、DNA 甲基化、组蛋白修饰、泛基因组、代谢组、蛋白质组、表型组、单细胞组学、三维基因组、16S rRNA 测序和宏基因组等内容。
9. 计算机基础、统计方法与人工智能:课程还介绍必要的计算机基础、统计与算法基础以及人工智能相关内容,包括 Linux 操作系统、命令行操作、常用编程语言、Conda 环境管理、统计检验、P-value、FDR、多重检验校正、机器学习、深度学习、神经网络和 Transformer 等基础知识,帮助学生理解生物信息学工具和分析流程背后的基本思想。
三、教学特色与培养成效
本课程采用线上线下结合、理论实践结合和案例任务结合的教学方式。线上教学侧重基础知识讲解和自主学习,线下教学围绕关键知识点开展案例分析、数据库操作、软件实践、文献阅读、小组讨论和课程实践。课程强调问题导向,鼓励学生从作物目标基因或具体农业问题出发,完成序列获取、同源搜索、多序列比对、结构域分析、系统发生树构建、功能推测和结果解释。
课程紧密结合农学、生物育种和植物生产类专业需求,将数据库资源、序列分析、组学分析和人工智能方法融入作物功能基因研究、驯化基因分析、抗病基因识别、基因组注释和分子育种等真实情境中。课程不仅训练学生使用工具,更强调理解分析结果背后的生物学意义。通过课程学习,学生将提升数据获取、整理、分析和解释能力,形成数据素养、科学思维、创新意识和团队协作能力,并增强服务农业强国建设、种业振兴和生命科学发展的责任感。