病原体基因溯源数据中心,给您提供权威的行业数据
分类
bioinfo
试剂盒
不适用
样本类型
SARS-CoV-2 一致性基因组 FASTA 文件
预计时间
~5 min(100 条基因组)
bioinfo

Pangolin谱系分型:SARS-CoV-2基因组流行病学的动态命名与自动分配

方法定义:Pangolin 把查询基因组比对到早期参考序列后,用 UShER 全树放置或 pangoLEARN 随机森林自动归入 Pango 谱系,Scorpio 再按突变星座校核 VOC/VOI。适用于 SARS-CoV-2 一致性基因组的批量谱系分型,是全球变异株监测与暴发溯源报告的标准命名工具。

一、原理

变异株一个接一个冒出来,溯源报告里总不能写「和 BA.2 有点像」。Pangolin(Phylogenetic Assignment of Named Global Outbreak Lineages)解决的就是这件事:把任意一条 SARS-CoV-2 基因组自动归入 Pango 谱系,让全球流行病学数据能对齐、能比较。BA.5、XBB.1.5 这类命名,已经成了新冠基因组监测的事实标准。

核心逻辑分两层。查询序列先用 minimap2 比对到早期参考基因组,非编码区用 N 掩蔽,得到统一坐标的对齐。然后交给推断引擎判定最近谱系:默认走 UShER 全树放置,也可以选 pangoLEARN 随机森林的 fast 模式。Scorpio 再按「变异星座」校核 VOC/VOI 相关谱系,防止特征突变被漏判。和 Nextclade 的差异一句话:Nextclade 给进化支和突变注释,Pangolin 给 Pango 谱系命名,日常监测两个都跑。这套流程在新冠病毒变异株监测与暴发溯源案例中的应用,本站后续会挂内链展开讲。

二、操作步骤

1. 装环境、拉最新数据

用 conda 建个干净环境。装完别急着跑,先执行 --update-data 把 pangolin-data(谱系树、星座定义)同步到最新。分型结果跟数据版本强绑定,老数据分不出新谱系。

conda create -n pangolin -c conda-forge -c bioconda pangolin
conda activate pangolin
pangolin --update-data

2. 准备输入 FASTA

输入是一致性基因组,多条序列拼进一个 FASTA 文件即可。默认 QC 门槛:长度不低于 25000 bp,N 占比不超过 30%。太短太脏的序列会被拒绝分型。

3. 跑分型

默认走 UShER(accurate)模式,几百条以内的批次直接跑。大批量筛查可以先切 fast 模式过一遍。

pangolin sample.fasta -o lineage_output -t 8

要提速时:

pangolin sample.fasta --analysis-mode fast -o lineage_output -t 8

4. 读报告、查冲突

结果在 lineage_report.csv。重点看 lineage、conflict、ambiguity_score、scorpio_call 几列。conflict 非零,或者 scorpio_call 和 lineage 打架,说明这条序列特征突变不全,回头查拼接质量。

5. 存档数据版本

谱系命名是动态的,同一批数据半年后重跑,结果可能变。报告里的 version 列和 pangolin-data 版本号一起存进溯源档案,保证可复现。没别的。

三、参数选择建议

参数推荐值说明
--analysis-modeusher默认。全树放置最准,正式报告用这个
--analysis-modefastpangoLEARN 随机森林,大批量初筛提速
--max-ambig0.3N 占比超 30% 直接拒绝分型
--min-length25000短于 25000 bp 不尝试分配谱系
-t8线程数,按机器核数调整
--update-data每批前执行同步最新谱系树与星座定义

四、FAQ

1. Pangolin 和 Nextclade 怎么选?

不用选,两个都跑。报谱系用 Pangolin 的 Pango 命名,是全球监测报告的标准口径;看进化支、突变注释和序列 QC 用 Nextclade。两者命名体系不同,不冲突。

2. 为什么 Pangolin 4 默认 UShER 而不是 pangoLEARN?

pangoLEARN 的随机森林要定期重新训练,新谱系发布后跟不上节奏。UShER 把序列直接放到最新 pangolin-data 的突变注释树上,新定义的谱系当天就能分。2024 年 Virus Evolution 有专门对比,placement 方法整体占优。

3. 短序列或高 N 占比的样本,该硬跑 Pangolin 还是改用 S 基因片段分型方案?

改用 S 基因片段方案。min-length 25000、max-ambig 0.3 的门槛摆着,硬跑只会被放到最近共同祖先上,谱系结果有误导性。S 基因片段走 spike 分型流程更合适,能补全基因组当然更好。

参考文献

  1. O'Toole Á, Scher E, Underwood A, et al. Assignment of epidemiological lineages in an emerging pandemic using the pangolin tool. Virus Evolution. 2021;7(2):veab064. DOI: 10.1093/ve/veab064
  2. Rambaut A, Holmes EC, O'Toole Á, et al. A dynamic nomenclature proposal for SARS-CoV-2 lineages to assist genomic epidemiology. Nature Microbiology. 2020;5(11):1403-1407. DOI: 10.1038/s41564-020-0770-5
  3. O'Toole Á, Pybus OG, Abram ME, Kelly EJ, Rambaut A. Pango lineage designation and assignment using SARS-CoV-2 spike gene nucleotide sequences. BMC Genomics. 2022;23(1):121. DOI: 10.1186/s12864-022-08358-2
  4. de Bernardi Schneider A, Su M, Hinrichs AS, et al. SARS-CoV-2 lineage assignments using phylogenetic placement/UShER are superior to pangoLEARN machine-learning method. Virus Evolution. 2024;10(1):vead085. DOI: 10.1093/ve/vead085