一、原理
变异株一个接一个冒出来,溯源报告里总不能写「和 BA.2 有点像」。Pangolin(Phylogenetic Assignment of Named Global Outbreak Lineages)解决的就是这件事:把任意一条 SARS-CoV-2 基因组自动归入 Pango 谱系,让全球流行病学数据能对齐、能比较。BA.5、XBB.1.5 这类命名,已经成了新冠基因组监测的事实标准。
核心逻辑分两层。查询序列先用 minimap2 比对到早期参考基因组,非编码区用 N 掩蔽,得到统一坐标的对齐。然后交给推断引擎判定最近谱系:默认走 UShER 全树放置,也可以选 pangoLEARN 随机森林的 fast 模式。Scorpio 再按「变异星座」校核 VOC/VOI 相关谱系,防止特征突变被漏判。和 Nextclade 的差异一句话:Nextclade 给进化支和突变注释,Pangolin 给 Pango 谱系命名,日常监测两个都跑。这套流程在新冠病毒变异株监测与暴发溯源案例中的应用,本站后续会挂内链展开讲。
二、操作步骤
1. 装环境、拉最新数据
用 conda 建个干净环境。装完别急着跑,先执行 --update-data 把 pangolin-data(谱系树、星座定义)同步到最新。分型结果跟数据版本强绑定,老数据分不出新谱系。
conda create -n pangolin -c conda-forge -c bioconda pangolin
conda activate pangolin
pangolin --update-data2. 准备输入 FASTA
输入是一致性基因组,多条序列拼进一个 FASTA 文件即可。默认 QC 门槛:长度不低于 25000 bp,N 占比不超过 30%。太短太脏的序列会被拒绝分型。
3. 跑分型
默认走 UShER(accurate)模式,几百条以内的批次直接跑。大批量筛查可以先切 fast 模式过一遍。
pangolin sample.fasta -o lineage_output -t 8要提速时:
pangolin sample.fasta --analysis-mode fast -o lineage_output -t 84. 读报告、查冲突
结果在 lineage_report.csv。重点看 lineage、conflict、ambiguity_score、scorpio_call 几列。conflict 非零,或者 scorpio_call 和 lineage 打架,说明这条序列特征突变不全,回头查拼接质量。
5. 存档数据版本
谱系命名是动态的,同一批数据半年后重跑,结果可能变。报告里的 version 列和 pangolin-data 版本号一起存进溯源档案,保证可复现。没别的。
三、参数选择建议
| 参数 | 推荐值 | 说明 |
|---|---|---|
| --analysis-mode | usher | 默认。全树放置最准,正式报告用这个 |
| --analysis-mode | fast | pangoLEARN 随机森林,大批量初筛提速 |
| --max-ambig | 0.3 | N 占比超 30% 直接拒绝分型 |
| --min-length | 25000 | 短于 25000 bp 不尝试分配谱系 |
| -t | 8 | 线程数,按机器核数调整 |
| --update-data | 每批前执行 | 同步最新谱系树与星座定义 |
四、FAQ
1. Pangolin 和 Nextclade 怎么选?
不用选,两个都跑。报谱系用 Pangolin 的 Pango 命名,是全球监测报告的标准口径;看进化支、突变注释和序列 QC 用 Nextclade。两者命名体系不同,不冲突。
2. 为什么 Pangolin 4 默认 UShER 而不是 pangoLEARN?
pangoLEARN 的随机森林要定期重新训练,新谱系发布后跟不上节奏。UShER 把序列直接放到最新 pangolin-data 的突变注释树上,新定义的谱系当天就能分。2024 年 Virus Evolution 有专门对比,placement 方法整体占优。
3. 短序列或高 N 占比的样本,该硬跑 Pangolin 还是改用 S 基因片段分型方案?
改用 S 基因片段方案。min-length 25000、max-ambig 0.3 的门槛摆着,硬跑只会被放到最近共同祖先上,谱系结果有误导性。S 基因片段走 spike 分型流程更合适,能补全基因组当然更好。
参考文献
- O'Toole Á, Scher E, Underwood A, et al. Assignment of epidemiological lineages in an emerging pandemic using the pangolin tool. Virus Evolution. 2021;7(2):veab064. DOI: 10.1093/ve/veab064
- Rambaut A, Holmes EC, O'Toole Á, et al. A dynamic nomenclature proposal for SARS-CoV-2 lineages to assist genomic epidemiology. Nature Microbiology. 2020;5(11):1403-1407. DOI: 10.1038/s41564-020-0770-5
- O'Toole Á, Pybus OG, Abram ME, Kelly EJ, Rambaut A. Pango lineage designation and assignment using SARS-CoV-2 spike gene nucleotide sequences. BMC Genomics. 2022;23(1):121. DOI: 10.1186/s12864-022-08358-2
- de Bernardi Schneider A, Su M, Hinrichs AS, et al. SARS-CoV-2 lineage assignments using phylogenetic placement/UShER are superior to pangoLEARN machine-learning method. Virus Evolution. 2024;10(1):vead085. DOI: 10.1093/ve/vead085
