病原体基因溯源数据中心,给您提供权威的行业数据
分类
样本采集
试剂盒
不适用
样本类型
废水浓缩液提取的混合病毒RNA(靶向扩增子测序数据)
预计时间
~5-10 min(仅计算,不含采样、建库和测序时间)
样本采集

Freyja废水变异株解卷积——基于等位基因频率的群体变异监测

方法定义:

Freyja通过废水测序的等位基因频率数据,利用变异株特征突变矩阵进行非负最小二乘回归,解卷积出各Pango谱系的相对丰度。在临床测序数据萎缩的背景下,为群体层面的变异株流行趋势监测提供了低成本兜底方案。

原理

废水基因组监测的基本思路不复杂:感染者排出含有病毒核酸的粪便和呼吸道分泌物,这些核酸进入下水道后混合在一起,形成一份"全社区"的病毒池。传统的废水测序只能告诉你"这里面有多少SARS-CoV-2 RNA":但分不清这些病毒来自哪些变异株、各占多大比例。Freyja要解决的就是这个"解卷积"问题。

Freyja的工作逻辑建立在"变异株条形码"的概念上。每一支变异株都携带一组特征性的突变组合:比如BA.2.86的Spike有R346T和F456L,XFG则多了V445R和N487D。Freyja先从测序数据里提取每个突变位点的等位基因频率(即在所有reads中该突变出现的比例),然后拿这些频率去匹配一个预先建好的"变异株-突变"矩阵,用非负最小二乘回归反推出每种变异株的相对丰度。这个过程的数学核心是一个简单的线性混合模型:废水信号 = Σ(变异株i的丰度 × 变异株i的突变谱)。因为有几十个变异株要同时求解,而突变位点可能有几百个,这是个典型的高维反问题:正则化和误差加权是算法的关键细节。

在BA.3.2和XFG等新变异株的早期监测中,Freyja类工具的价值尤其突出:临床检测的序列数量在下降,很多人不再去测PCR了,但废水是不会"骗人"的。美国CDC在2026年初正是通过废水Freyja分析,在29个州的260个废水样本中提前锁定了BA.3.2的踪迹,比临床病例报告早了数周。

步骤

1. 废水样本采集与浓缩(现场,1-2 h)

在污水处理厂进水口或社区管网节点采集500 mL-1 L的24小时复合废水样本。样本经0.22 μm滤膜过滤去除大颗粒杂质后,用PEG沉淀法或超滤离心法浓缩至2-5 mL。浓缩倍数通常为100-200×,以确保病毒核酸浓度达到测序检出限(≥10 copies/μL)。

2. 核酸提取与测序文库构建(实验室,3-4 h)

浓缩液经Trizol或磁珠法提取总RNA。因废水样本含大量PCR抑制剂(腐殖酸、多糖等),提取后须用Qubit和Bioanalyzer双重质控。文库构建推荐使用SARS-CoV-2靶向扩增子方案(如ARTIC v5.3.2引物池),而非宏基因组鸟枪法:因为废水中的宿主和环境DNA占比极高,靶向富集能大幅提高病毒reads比例。

3. 测序与数据预处理(1-2天,含测序运行时间)

Illumina MiSeq或NextSeq平台,2×150 bp双端测序,每个样本建议产出0.5-1 M reads。下机数据用FastQC质控、Trimmomatic去接头和低质量碱基、BWA-MEM比对到Wuhan-Hu-1参考基因组,最后用iVar生成每个位点的等位基因频率表(pileup文件)。

4. Freyja解卷积分析(5-10 min)

将iVar输出的等位基因频率文件导入Freyja。Freyja内置的突变-变异株矩阵(barcode library)会定期从GISAID和UShER树更新,覆盖数千个Pango谱系的特征突变。运行demix命令,输出每个样本中各变异株的相对丰度(从0到1,总和为1)。

# Freyja 解卷积命令
freyja demix   --barcode freyja_barcodes.csv   --depth 100   variant_counts.tsv   output_demixed.tsv

5. 可视化与趋势解读(5-10 min)

输出结果用Freyja自带的plot功能或自定义脚本(Python matplotlib / R ggplot2)生成堆叠面积图和变异株丰度时间序列。重点关注:① 新变异株首次检出的时间点,② 增长速率(用线性回归估算doubling time),③ 哪些变异株在互相"挤压"彼此的空间:这往往是新老变异株竞争替代的早期信号。

参数选择建议

参数推荐值说明
测序深度≥100× 基因组覆盖度废水为混合样本,深度不足会导致低频变异株被噪声淹没
突变频率下限0.01 (1%)低于此阈值的突变视为测序噪声,不参与解卷积
barcode库更新频率每周新变异株出现后,barcode矩阵需及时更新才能被Freyja识别
非负最小二乘容差1e-6收敛阈值,过松导致丰度估计不稳定
采样频率每周1-2次废水信号有滞后性,高频采样可捕捉到变异株替代的转折点

FAQ

Freyja和临床测序监测怎么选?

不是二选一,是互补。临床监测告诉你"谁在感染什么":病例层面的精准信息。废水Freyja告诉你"整个城市在流行什么":群体层面的全景。当临床测序量下滑时(比如很多国家在2025年后大幅缩减了COVID测序预算),废水就成了最可靠的"兜底"数据源。缺点是Freyja无法告诉你感染者的人口学特征和临床结局。

废水检测能不能替代个体PCR诊断?

不能,定位不一样。PCR是"你是不是"的问题:个体诊断。废水Freyja是"我们社区里有什么"的问题:群体趋势。用废水取代PCR,就像用天气预报取代体温计:前者预测趋势,后者判断事实。

为什么Freyja有时会检出"不存在"的变异株?

因为解卷积本质上是数学反演,存在非唯一性。如果两个变异株的突变谱高度相似:比如JN.1和KP.3在大部分位点共享相同的突变:Freyja可能在它们之间"错误分配"丰度。另外,重组事件(如XFG = LF.7 × LP.8.1.2)会进一步模糊谱系边界。解决办法是定期更新barcode库、提高测序深度,并与临床测序数据交叉验证。

参考文献

  1. Karthikeyan S, Levy JI, De Hoff P, et al. Wastewater sequencing reveals early cryptic SARS-CoV-2 variant transmission. Nature. 2022;609:101-108. DOI: 10.1038/s41586-022-05049-6
  2. Freyja: Depth-weighted demixing of SARS-CoV-2 lineages from wastewater sequencing data. GitHub. andersen-lab/Freyja