获取独家产品信息,尽享促销优惠!立即订阅,不容错过
* 限···时··优惠
摘要:古基因组分析的标准做法是将映射的短读数据转换为伪单倍体序列,通常是从映射读堆栈中随机选择一个高质量的核苷酸。这可以控制由于差异测序覆盖率而导致的偏差,但不能控制差异率和测序错误类型,这些错误在从古代样本获得的数据集中通常很大且多变。这些错误可能会扭曲系统发育和种群聚类分析,并误导使用 D 统计量的混合测试。我们介绍了一种生成伪单倍体序列的方法 Consensify,它可以控制由差异测序覆盖率导致的偏差,同时大大降低错误率。错误校正直接来自数据本身,无需额外的基因组资源或简化假设(例如同时采样)。对于系统发育和种群聚类分析,我们发现与基于单读采样的方法相比,Consensify 受人工制品的影响较小。对于 D 统计量,Consensify 对假阳性的抵抗力更强,并且与其他常用方法相比,不同实验室协议导致的偏差似乎影响较小。尽管 Consensify 是针对古基因组数据开发的,但它适用于任何低到中等覆盖率的短读数据集。我们预测,Consensify 将成为未来古基因组研究的有用工具。