代谢组学数据中缺失值的处理方法
发布日期:2020-10-15 浏览次数:7467
在代谢组学以及基于MS的蛋白组学研究中,时常会遇到数据中有缺失值的情况,即数据稀疏性问题,如下图所示:
缺失原因比较多,比如:
1.信号强度低,机器检测不到;
2.离子抑制或仪器性能不稳定引起的检测错误;
3.提峰算法所限,不能从背景中提取低强度信号;
4.解卷积时无法将重叠峰全部解析;
5.样品本身就没有该物质等等。
但是无论是哪种原因,含有缺失值的数据一般是无法直接用于接下来的数据分析的。解决方法也比较直接,或是将含有缺失值的数据直接删除,或是把缺失数据以某种方式进行模拟填补,这样才能进行接下来的统计分析等相关内容。
一.缺失值的删除
在代谢组学分析中不建议随意删除数据,包括缺失值,因为缺失不代表无意义,甚至缺失值中也会蕴含重要信息。一般会根据缺失数量制定删除的标准。
缺失值删除的标准也不是固定的,常用的有20%和50%两个标准,即在所有样品中或者比对组样品中,若某一物质缺失数量大于样本数量的20%或50%时就把该物质进行删除,不参与接下来的数据分析。如果研究中样品数量足够多或是对于分析要求比较严格,采用20%标准,不过现阶段的代谢组学研究多数没有达到上述条件,所以50%标准也是比较常用的。
二.缺失值的填补
目前为止,缺失值的填补也有很多方法,常用的比如使用最小值、最小值的1/2、平均值、中位数以及KNN算法和BPCA算法等等。有研究表明缺失值填补方法的选择对于接下来的单变量统计分析和多元统计分析的结果和解释有实质性的影响。下来就跟随小编一起了解一下不同方法的适用范围、特点以及对于后续分析的影响。
1. 小预定义值(S)/最小值(M)/最小值的1/2(HM)
这三种方法分别是使用一个小的预定义值(如0.01)或该物质峰未缺失的数据最小值或未缺失最小值的1/2填补缺失值,这些方法不依赖于已有数据集结构。
如果真的是样品中没有该物质或是信号强度低导致数据缺失,那么采用该方法的结果会比较接近于数据本来面目。但是数据缺失若是其他原因,缺失值本来是大数值,或者缺失值较多,则该方法不适用。
2. 平均值M与中位数MED
即用该物质峰所有样本的非缺失值的平均值或者中位数填补缺失值。
这两种方法默认了所有样本的物质峰强度相似,可以人为地减小方差,但只有在缺失的数据是真正的未探测到而非低强度信号时最适用。如果样本中数据分布不均匀,存在差别较大极端值,或是缺失物质本身是低信号强度数值,则该方法不适用。
3. KNN(K-Nearest Neighbor)
加权K最近邻算法,本方法基于欧氏距离确定了在所有样品中强度分布最相似的K个代谢物,这些代谢物与缺失物质的峰相比具有相似的检测信号强度,然后将缺失值替换为最相似的K个峰值中对应的非缺失值的加权平均值。
4.BPCA(Bayesian PCA missing value estimation)
贝叶斯PCA缺失值估计,基于主成分回归、贝叶斯估计和期望最大化重复算法的三阶算法。BPCA方法使用数据集的全局结构,将所有的代谢物都考虑进去,最终得到估算值。
5. MI(Multivariate Imputation by Chained Equations)
链式方程多元回归算法,是一种多变量插补的方法,其中每个变量使用回归模型进行估计,条件是所有其他变量在所有缺失数据的变量中迭代循环,该方法也考虑了数据集的全局结构。
其他缺失值模拟方法还有PPCA(probabilistic PCA)、SVD(Singular Value Decomposition)等等。
有研究从单变量统计分析、多元统计分析、归一化均方根误差(NRMSE)、ROC评估等多方面具体比较了常用的缺失值填补方法,综合所有结果表明,对于代谢组学数据而言,基于机器学习的KNN算法最优,其次是平均值M与中位数MED填补方法,小预定义值(S)和最小值的1/2(HM)方法应用范围较窄,需谨慎使用。
集思慧远Genepioneer
集思慧远可为您提供完整的生物学服务链,真正实现全面组学分析、生理指标及分子实验一条龙,让您免去来回送样、检测、整合数据的繁琐步骤,从售前到售后提供最精准、全面、高效、便捷的科研技术服务。

