资讯动态

基因组学考试复习:从N50到变异检测的计算考点全攻略

发布时间:2026/9/19 15:04:00 来源:尧图企业网站定制
简介面向中科大研究生《基因组学》期末备考的复习资料覆盖2020年及2019年考题与重点必考内容适合生命科学、生物信息学方向学生系统梳理考点。资源包内含1个PDF文件共1.92MB虽体量紧凑但浓缩了名词解释、选择题、填空题与问答题的答题要点。预览显示名词解释部分给出了基因组学、宏基因组、人类基因组计划、OLC组装算法、N50、克隆文库、基因组注释、WGCNA、Phred-Phrap-Consed、FPKM、无尺度网络、Sanger测序等核心概念的规范作答选择题部分附有详细解析例如人类基因组GC含量为41%、转座子来源的分散重复序列约占45%、Ion Torrent检测H信号等。此外还包含CpG岛判断标准、N50质量比较、454组装软件Newbler等易考细节能帮助读者快速识别高频考点、掌握答题语言。目前已有1077人学习下载是一份针对性强、可直接用于考前冲刺的复习资料。1. 期末冲刺前先搞懂基因组学到底在考什么“2021年秋季学期《基因组学》2020年考题、重点必考内容、复习题.pdf”——这门课的名字叫《基因组学》可翻遍整本教材你会发现它骨子里是门计算科学。无论是基因家族鉴定、比较基因组分析还是变异检测、转录组组装最终的落脚点几乎都在“怎么处理数据、怎么解读结果”上。换句话说考卷上那道看似在问“什么是基因组组装”的题改卷老师真正想看的是你知不知道 N50、覆盖度和 scaffold 之间是什么关系。这份复习资料之所以在每年秋季都会被反复下载不是因为知识点有多难而是因为它的知识跨度太大从分子生物学基础一路延伸到 Linux 命令行和统计学检验复习时最容易出现“背了忘、忘了背”的死循环。本文不打算帮你背一遍书而是把基因组学考试里那些反复出现的计算与分析考点拆成可复现的复习路径——你只需要把下面这套方法在本地跑一遍就能在考前把“会背”变成“会做”。2. 从中心法则到全基因组测序核心原理背后的计算逻辑2.1 遗传信息流的量化为什么测序深度不是越大越好基因组学的第一层考点几乎都围绕“中心法则”展开。但考试很少直接让你默写 DNA→RNA→蛋白质而是会给你一段数据某样本的测序深度是 30×基因组大小约 3 Gb问实际测序数据量是多少或者问这个深度下检测杂合 SNP 的可靠性如何。这类题的核心是理解“覆盖度”与“深度”的区别——覆盖度是基因组上至少被读到一次的位点比例深度则是每个位点平均被测了几次。电泳图不会直接告诉你答案但公式可以总数据量 基因组大小 × 平均深度。一个 3 Gb 的基因组做 30× 测序需要至少 90 Gb 的有效数据。另一个高频考点是“为什么测序深度不是越高越好”。从计算角度看深度越高数据量越大比对时间越长而变异检测的准确率并不会线性提升——当深度超过 50× 时PCR 重复和比对错误会引入新的假阳性。所以考试里如果出现“给定深度计算最小数据量”或“比较高深度与低深度在 SNP calling 上的差异”本质上是在考你对“冗余度”的理解。复习时建议把推导公式写在笔记最上方它能帮你串起基因组大小估算、测序成本、变异检测可靠性这三个看似无关的考点。2.1.1 一个可以手算的深度推导题假设一个细菌基因组大小为 5 Mb你手上有 1 Gb 的 clean data问平均深度是多少并判断这个深度做 SNP calling 是否够用。答案是 1,000 Mb ÷ 5 Mb 200×显然过高——不仅是浪费而且高深度下测序仪的系统误差会被放大。但如果是人类 exome约 30 Mb 靶向区域1 Gb 数据深度约为 33×这刚好在胚系 SNP 检测的推荐区间。这一问一答之间就把“深度”这个抽象概念落到了具体的计算上。2.2 参考基因组与比对一场从索引到比对的考试基因组学考题里有一类必出题型给出一段序列让你说明它与参考基因组比对的流程。这背后是两件事——构建索引和序列比对。以 BWA 软件为例bwa index拿到参考基因组 FASTA 后会生成 5 个以.amb、.ann、.bwt、.pac、.sa结尾的索引文件。考试若问“这些文件的用途”标准答案要写到“bwt 是 Burrows-Wheeler 变换后的前缀树pac 是打包的参考序列sa 是后缀数组”而不是笼统地说“用来加速比对”。# 建立索引以人类参考基因组 GRCh38 为例 bwa index -a bwtsw GRCh38.fa # 比对单端 reads输出 SAM 文件 bwa mem -t 8 -M GRCh38.fa sample_R1.fastq.gz sample.sam-t 8表示用 8 个线程并行计算-M参数会把 splitting 的 reads 标记为 supplementary alignment这是下游 Picard 工具做 mark duplicate 时的常规要求。比对完成后你会得到一个充满 CIGAR 字符串的 SAM 文件——如果考试考“CIGAR 里 5M2D3I 是什么意思”答案就是“5 个碱基匹配、2 个碱基缺失、3 个碱基插入”。这类题没有技巧只能靠反复手写换算来加深记忆我在复习时把常见 CIGAR 组合抄在卡片上考前快速过一遍比对着课件空背效率高得多。2.2.1 SAM/BAM 格式中必须记住的 flag 值SAM flag 是考题里的“钉子户”经常给你一串数字让你反推比对情况。下面这张表是复习时必须印在脑子里的flag 值含义1paired read双端测序的一条2all properly aligned完美比对4read unmapped未比对上去8mate unmapped伴侣序列未比对16reverse complement反向互补链32mate reverse complement伴侣在反向链64first in pair双端的第一条128second in pair双端的第二条考试常出“flag 147 代表什么”这类题。把 147 拆开128 16 2 1也就是第二对末端、反向互补链、正确比对、双端中的一条。遇到这类题不要死背——你只需要把常见 flag 的二进制规律记住然后做加法拆解就能得分。3. 必考计算型考点从 BLAST 到变异检测的答题套路3.1 BLAST 比对结果里真正决定分数的是 E-value 和 Identity基因组学的复习题里BLAST 几乎是章章有、年年考。但考的不是“什么是 BLAST”而是给你一张结果表格让你判断哪条序列是同源基因哪条是随机匹配。这里有两个参数是答题的命门E-value 和 Identity。E-value 表示“这条匹配结果是随机出现的概率”越接近 0 越可靠Identity 表示比对区域里完全一致的碱基比例。考试常挖的坑是某条序列 Identity 高达 95%但 E-value 是 0.04——这在严格意义上仍然不可信因为 E-value 已经把比对长度和数据库大小都计算进去了而 Identity 只是一个朴素百分比。# 用命令行 BLAST 做本地比对并输出表格格式 blastn -query query.fa -db ref_db -outfmt 6 qseqid sseqid pident length mismatch gapopen qstart qend sstart send evalue bitscore -evalue 1e-5 -out blast_result.txt-outfmt 6是最常用的表格格式它把比对结果压缩成一行一行方便你导入 Excel 或 R 做筛选。-evalue 1e-5是严格的阈值比这个数大的匹配直接丢弃。考试如果问“为什么不能用 Identity 90% 作为唯一筛选条件”你就写因为短序列即使完全匹配也可能是随机产生的只有 E-value 同时衡量了序列长度和数据库大小才能有效排除假阳性。复习基因组学的计算考点需要准备一批最基础的工具列表NCBI BLAST 本地版或在线版都能用但要会看输出表格BWA 和 SAMtools 处理比对samtools view、samtools sort是最常考的两条命令GATK 做变异检测时要记住 HaplotypeCaller 的名字和基本参数IGV 是可视化工具考卷偶尔会给一张 IGV 截图让你找 SNP这些工具的英文名和用途属于送分题拿不到就很亏。每个工具背后都背一个“最常考的参数”比如samtools sort -o output.bam input.bam考的就是你知不知道要输出到新文件而不是覆盖原文件。3.1.1 E-value 和 Bit score 的换算关系如果你复习时间充裕建议顺便把 E-value 和 Bit score 的关系看一遍。Bit score 是原始比对分数做了 log 变换后的值不随数据库大小变化适合跨库比较E-value 则是 Bit score 换算成“期望出现次数”的结果数据库越大、E-value 越大。考试题常这样出同一个 query 在两个不同大小的数据库里 BLASTbit score 相同E-value 却不同——问原因。答案就是“数据库大小会影响 E-value 计算但 bit score 不会”。3.2 变异检测全流程从 FASTQ 到 VCF 的每一步都在考什么变异检测variant calling是基因组学考试里综合性最强的题目因为它覆盖测序、比对、去重、碱基质量校正、变异识别五个步骤。考题常给你一段命令行让你指出其中哪一步用错了工具——这就是在考你对 GATK best practice 流程的熟悉程度。# 第一步比对后排序 bwa mem -t 8 GRCh38.fa sample_R1.fastq.gz sample_R2.fastq.gz | \ samtools sort -o sample.sorted.bam # 第二步标记 PCR 重复 gatk MarkDuplicates -I sample.sorted.bam -O sample.markdup.bam -M metrics.txt # 第三步碱基质量重校正BQSR gatk BaseRecalibrator -R GRCh38.fa -I sample.markdup.bam --known-sites dbsnp.vcf -O recal.table gatk ApplyBQSR -R GRCh38.fa -I sample.markdup.bam --bqsr-recal-file recal.table -O sample.recal.bam # 第四步变异检测 gatk HaplotypeCaller -R GRCh38.fa -I sample.recal.bam -O sample.vcf每一步都对应一个考点samtools sort是把比对结果按坐标排序否则后续去重和变异检测会出问题MarkDuplicates是去除 PCR 扩增产生的重复 reads这些重复不是生物学变异不剔除就会造成假阳性BaseRecalibrator是校正碱基质量值它利用已知的 dbSNP 位点来评估系统误差——考试会问“为什么需要已知位点”因为系统误差的估计必须有一个“标准答案”作参照HaplotypeCaller通过局部组装来识别变异这是 GATK 区别于老式 samtools mpileup 的关键点——后者只做逐位点检测对插入缺失很容易判断错误。变异检测的结果文件是 VCF 格式。考试常问你“VCF 主要包含哪些字段”标准答案是 CHROM、POS、ID、REF、ALT、QUAL、FILTER、INFO 八个核心列再加样本基因型列。如果考卷给了你一段 VCF让你判断某个位点的基因型是杂合还是纯合你要看 GT 字段0/1是杂合1/1是纯合。FILTER 字段里出现LowQual说明该位点质量不过关分析时要过滤掉。3.3 转录组与差异表达分析count 数背后有多少统计陷阱除了 DNA 层面的变异检测转录组分析也是复习题的重要组成部分。差异表达分析的基本流程是比对到参考基因组 → 基因定量 → 构建表达矩阵 → 做差异检验。考题喜欢在“定量工具的选择”上挖坑有的题目会给你三种工具——HTSeq-count、featureCounts 和 Cufflinks——让你说明它们的区别。标准答案是HTSeq-count 和 featureCounts 是“基于已知基因注释的计数工具”适合做基因水平的差异表达Cufflinks 是“基于转录本组装的定量工具”不依赖完整注释适合发现新转录本但稳定性和可重复性稍差。# featureCounts 定量按基因计数 featureCounts -a annotation.gtf -o counts.txt -T 4 -t exon -g gene_id sample.bam-t exon指定只统计 exon 区域的 reads-g gene_id指定按基因 ID 汇总-T 4用 4 个线程并行——这些参数在考试里往往换着方式考比如“如果要按转录本统计-g参数应该改成什么”答案就是transcript_id。差异表达做出来后你拿到一个表格里面有 log2FoldChange 和 padj 两列。复习时要记住筛选标准|log2FoldChange| 1且padj 0.05。padj是多重假设检验校正后的 p 值如果没有校正直接拿原始 p 值筛几千个基因里会有大量假阳性。考题常拿“为什么用 padj 而不是 p 值”来区分你是真懂还是只会跑流程。4. 考题里最常见的 4 种题型的拆解思路与答题模板4.1 概念辨析题对比术语时先找“维度”再写答案基因组学复习题里的概念对比题比如“比较基因组学与功能基因组学的区别”“转录组与基因组测序的区别”很多人失分是因为只写“一个研究序列、一个研究表达”——这太笼统。我推荐的答法是把对比拆成三个固定维度研究对象DNA 还是 RNA、核心技术全基因组测序还是 RNA-seq、输出结果变异列表还是表达矩阵。以“基因组测序 vs 转录组测序”为例按这个模板写就是维度基因组测序转录组测序研究对象全部 DNA 序列特定条件下表达的 RNA文库构建需要打断成小片段加接头需要去除 rRNA、逆转录成 cDNA分析重点SNP、InDel、CNV、结构变异差异表达基因、可变剪接、新转录本典型工具GATK、BWAHISAT2、featureCounts、DESeq2表格最大的优势是帮你在考场上把“记忆模糊”变成“逻辑推导”——哪怕忘记某个细节也能从其他维度反推结论。考试时遇到没背过的对比就用这个方法现编结构至少能拿到一半以上的分数。4.2 流程设计题给材料让你写分析方案记住“每步一问”流程设计题一般长这样给你一个细菌的二代测序数据让你设计从质控到注释的完整分析流程。这种题不需要你写具体代码但要把步骤写清楚。我的答题模板是五步固定套路质控与过滤FastQC看质量Trimmomatic去接头和低质量碱基组装用SPAdes做基因组组装然后评估 N50 和 contig 数量基因预测用Prodigal预测编码基因功能注释用 eggNOG-mapper 或 KEGG 数据库做功能注释比较分析如果要和近缘物种比较可做平均核苷酸一致性ANI分析。每一步后面还要留一句话说明“为什么”——比如“先质控再组装因为低质量碱基会导致 contig 断裂N50 显著下降”。考卷给分时通常会看步骤顺序是否合理而不是你是否用了最新工具。写流程时不需要炫技用最经典的工具反而最稳妥。4.3 结果解读题VCF 和 BLAST 结果长什么样你必须见过结果解读题是拿分关键因为它不需要死记只要你看过真实输出文件就能做对。复习时要打开一个真的 VCF 文件看一遍记住几类字段长什么样QUAL 值为.表示该位点没有质量值GT 为./.表示该位点没有判定出基因型DP 字段表示该位点的测序深度。这些细节考题几乎百发百中因为只看过课件截图而没跑过实际数据的考生肯定答不上来。# 提取 VCF 中 QUAL 30 的位点 awk -F \t $6 30 sample.vcf | wc -l这条命令把 VCF 第 6 列QUAL大于 30 的位点行数统计出来。考试如果给你一段 VCF让你说出有多少个高质量 SNP你只需要会看列位置就行。同理BLAST 结果里如果出现一堆 sstart 大于 send 的情况说明那些序列比对到了参考序列的反向互补链上这属于正常现象不是比对出错——这也是常考的一个细节。4.4 计算题N50、覆盖度、基因长度三步就能全拿下计算题是最好拿分但也是最容易被扣分的部分关键是步骤写清楚别跳步。N50 的定义是把所有 contig 从长到短排序当累计长度达到总长度一半时的那条 contig 的长度就是 N50。考试不会让你手算一堆 contig但会给你三条 contig 的长度让你判断 N50 是多少——这时别慌按定义一步一步来contig 长度8 kb、5 kb、3 kb、2 kb 总长度 18 kb一半是 9 kb 从最长开始累加8 98 5 13 9 所以 N50 是 5 kb覆盖度计算也同理上过手就不怕覆盖度 总测序碱基数 ÷ 基因组大小。考卷偶尔会加一步“如果要达到 30× 覆盖度需要多少数据”那就是把公式翻过来用数据量 基因组大小 × 30。计算题唯一的丢分原因是单位不统一——题目给的是 Mb你却用 Gb 去算结果差出三个数量级。复习时把单位换算写在试卷旁边1 Gb 1,000 Mb 1,000,000 kb。5. 高频复习工具用命令行把考点变成肌肉记忆5.1 SAMtools 的 5 个高频子命令复习资料里背不清的东西这里一次理清samtools是基因组学分析里出现频率最高的工具之一几乎任何一道涉及比对结果的考题都绕不开它。复习它时不要面面俱到抓住五个最高频的子命令就能把大部分分数握在手里view转换格式兼过滤、sort排序、index建索引、flagstat统计比对信息、depth计算位点深度。# 把 SAM 转成 BAM 并过滤掉未比对的 reads samtools view -b -F 4 sample.sam sample.bam # 排序并建立索引 samtools sort -o sample.sorted.bam sample.bam samtools index sample.sorted.bam # 统计比对率 samtools flagstat sample.sorted.bam # 计算 1 号染色体第 1000 位的测序深度 samtools depth -r chr1:1000-1000 sample.sorted.bam-F 4表示过滤掉 flag 值为 4 的 reads也就是未比对上的 reads。flagstat输出的第一行是总 reads 数第三行是比对上的 reads 数两者相除就是比对率——这个数字在考题里常被用来判断测序数据质量比对率低于 90% 通常说明数据或参考基因组选择有问题。depth命令在复习时看似冷门但考试常考“某个位点的深度是多少”你只需要记住这个命令就够了。5.2 用 BCFtools 快速验证 VCF 中的变异数量变异检测部分的复习除了 GATK 还要认识bcftools。它和 GATK 的关系是GATK 负责“找变异”bcftools 负责“管变异”——过滤、合并、统计都是它的事。考题里有一个高频问法给你一个 VCF让你统计其中 SNP 和 InDel 各有多少个用 bcftools 两行搞定# 统计 SNP 数量只保留 biallelic SNP bcftools view -v snps -m2 -M2 sample.vcf | grep -c -v ^# # 统计 InDel 数量 bcftools view -v indels -m2 -M2 sample.vcf | grep -c -v ^#-v snps指定只输出 SNP 类型的变异-v indel输出插入缺失。-m2 -M2表示只保留双等位基因位点避免多等位基因的干扰。这两条命令能直接对应试卷中“从 VCF 中统计变异类型数量”的题型——不需要理解复杂的 VCF 解析逻辑会敲命令就能拿分。5.3 考前 48 小时的最终复习路径从命令到概念的闭环如果离考试只剩两天我的复习顺序是先把上面所有命令在命令行逐条跑一遍看看真实输出长什么样然后对着输出结果反推概念——看到 BAM 文件里的一行时问自己“FLAG 是 99 代表什么意思”看到 VCF 里 DP 字段时想着“这个位点的深度在计算时有哪些坑”。这样从输出反推概念比从头再背一遍课件高效得多因为你在主动检索记忆而不是被动阅读。最后一步回到这份 PDF 的名称本身重点必考内容、考题、复习题其实是三位一体的。考题验证概念复习题巩固工具重点必考内容串联知识框架。把三者对应起来复习效率远高于刷完十套题也不看错在哪。考前每天花 20 分钟跑一遍samtools flagstat和bcftools view让手指记得住命令考场上自然写得出答案。本文还有配套的精品资源点击获取

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价