原理
病毒蛋白编码基因在宿主免疫、抗病毒药物和跨种传播三重压力下发生适应性进化。鉴定哪些氨基酸位点受到了正选择(dN/dS > 1)还是净化选择(dN/dS < 1),是理解病毒溯源中关键分子事件的前提。
HyPhy 在一个统一的系统发育框架下,用密码子置换模型比较非同义替换率(dN)和同义替换率(dS)。比值 ω 是衡量选择压力的核心指标。和传统 PAML 只提供有限 M 系列模型不同,HyPhy 内嵌了一整套方法矩阵:基因水平的 BUSTED、分支水平的 aBSREL、位点水平的 FUBAR/FEL(普遍选择)和 MEME(间歇选择)。这些方法共享同一套比对和树文件,输出结构化 JSON,一条命令跑到底。在 SARS-CoV-2 刺突蛋白受体结合域适应性进化与流感 HA 抗原漂移溯源案例中有广泛应用。
步骤
1. 密码子比对与系统发育树准备
输入文件是两条:密码子多序列比对(FASTA 或 NEXUS 格式)和对应的系统发育树(Newick 格式)。比对前务必检查序列不含内部终止密码子,也不存在移码。MAFFT 没有密码子感知(codon-aware)比对模式——直接对核苷酸做比对会破坏密码子读码框。标准做法是先将核苷酸序列翻译为氨基酸,用 MAFFT 做氨基酸比对,再用 pal2nal 把氨基酸比对回译为密码子比对。也可以用 TranslatorX(在线整合翻译+比对+回译流程)、MACSE(原生密码子感知,可处理移码)或 PRANK(含密码子模型)。建树用 IQ-TREE 的最大似然法。比对和树的序列名必须严格一致。
# 先翻译为氨基酸,再比对,最后回译(pal2nal 方案)
seqkit translate input_nt.fasta > input_aa.fasta
mafft --auto input_aa.fasta > aligned_aa.fasta
pal2nal.pl aligned_aa.fasta input_nt.fasta -output fasta > aligned_codon.fasta
# 建树
iqtree2 -s aligned_codon.fasta -m MFP -bb 1000 -nt AUTO2. 基因与分支水平扫描
先用 BUSTED 判断整个基因是否存在正选择信号——它不指定特定分支,做全树扫描。再用 aBSREL 找出哪些具体分支(谱系)经历了适应性进化。aBSREL 对每个分支自动做模型选择,看是否需要引入 ω > 1 的速率类别。
hyphy busted --alignment aligned_codon.fasta --tree aligned_codon.fasta.treefile --srv Yes --output busted.json
hyphy absrel --alignment aligned_codon.fasta --tree aligned_codon.fasta.treefile --output absrel.json3. 位点水平精细定位
基因和分支有信号后,定位到具体氨基酸位点。FUBAR 用贝叶斯 MCMC 在预置 ω 网格上快速逼近后验概率,适合大对齐(500 条序列以上)。MEME 检测只在部分分支上发生的间歇选择——病毒跨种传播和免疫逃逸中很常见。FEL 用似然比检验给出每个位点的显著性 P 值和 dN/dS 置信区间。
hyphy fubar --alignment aligned_codon.fasta --tree aligned_codon.fasta.treefile --output fubar.json
hyphy meme --alignment aligned_codon.fasta --tree aligned_codon.fasta.treefile --output meme.json
hyphy fel --alignment aligned_codon.fasta --tree aligned_codon.fasta.treefile --output fel.json4. 结果筛选与生物学解读
解析各 JSON 输出文件。FUBAR 取后验概率 ≥ 0.9 的位点,FEL 和 MEME 取 P ≤ 0.1 的位点。将候选位点映射到蛋白三维结构或已知功能域上,判断其生物学意义。阳性位点取三种方法的并集,交叉验证。
参数选择建议
| 参数 | 推荐值 | 说明 |
|---|---|---|
| --alignment | FASTA / NEXUS / phylip | 密码子比对,不含终止密码子和移码 |
| --tree | Newick 格式 | 与比对序列一一对应的系统发育树 |
| --branches | Internal / Leaves / All | aBSREL 与 MEME 中指定待检分支子集 |
| --srv | Yes / No(默认 Yes) | BUSTED 是否纳入同义速率变异 |
| --starting-points | 5~10 | 似然优化起始点数,越多越稳定但越慢 |
| 位点显著性阈值 | P ≤ 0.1(FEL/MEME) | 位点水平方法推荐宽松阈值 |
| 后验概率阈值 | ≥ 0.9(FUBAR) | 贝叶斯方法高置信截断 |
FAQ
FUBAR 和 FEL 怎么选?
序列超过 500 条优先 FUBAR,速度比 FEL 快几十倍。小数据集两者均可,FUBAR 对弱选择信号更灵敏。需要 dN/dS 置信区间就加跑 FEL。没把握就两个都跑,取并集。
MEME 和 FUBAR 的结果不一致时信哪个?
不矛盾。FUBAR 检测全树持续作用的普遍选择,MEME 检测仅影响部分分支的间歇选择。一个位点只被 MEME 命中,说明它只在特定谱系里经历了正选择。阳性位点取并集。
为什么用 HyPhy 而不是 PAML 的 codeml?
方法矩阵更全。PAML 的 M7/M8 侧重回答基因是否存在正选择位点(M8+BEB 同样可以定位具体正选择位点),HyPhy 还能回答「哪个分支发生了选择」「选择是持续性还是间歇性」。另外 HyPhy 输出 JSON,命令行一行跑完,不用手写 ctl 文件。
参考文献
- Kosakovsky Pond SL, Frost SDW, Muse SV. HyPhy: hypothesis testing using phylogenies. Bioinformatics. 2005;21(5):676-679. DOI: 10.1093/bioinformatics/bti079
- Murrell B, Wertheim JO, Moola S, Weighill T, Scheffler K, Kosakovsky Pond SL. Detecting individual sites subject to episodic diversifying selection. PLoS Genetics. 2012;8(7):e1002764. DOI: 10.1371/journal.pgen.1002764
- Murrell B, Moola S, Mabona A, Weighill T, Sheward D, Kosakovsky Pond SL, Scheffler K. FUBAR: A fast, unconstrained Bayesian approximation for inferring selection. Molecular Biology and Evolution. 2013;30(5):1196-1205. DOI: 10.1093/molbev/mst030
- Spielman SJ, Weaver S, Shank SD, Magalis BR, Li M, Kosakovsky Pond SL. Evolution of viral genomes: interplay between selection, recombination, and other forces. Methods in Molecular Biology. 2019;1910:427-468. DOI: 10.1007/978-1-4939-9074-0_14
