摘要 - 计算pangenomics是一种新兴领域,使用图形结构封闭多个基因组研究遗传变异。可视化Pangenome图对于理解基因组多样性至关重要。然而,由于图布局过程的高计算需求,处理大图可能具有挑战性。在这项工作中,我们对最先进的pangenome图布局算法进行了彻底的性能特征 - 揭示了显着的数据级并行性,这使GPU成为计算加速度的有前途的选项。但是,不规则的数据访问和算法的内存性质具有重大障碍。为了克服这些挑战,我们开发了一种实施三个关键优化的解决方案:对缓存友好的数据布局,合并的随机状态和经纱合并。另外,我们提出了一个定量度量标准,用于可扩展对Pangenome布局质量的评估。对24个人类全染色体pangenomes进行了评估,我们的基于GPU的解决方案在没有布局的质量损失的情况下,在the-Art MultineReaded CPU基线上实现了57.3倍的速度,从而将执行时间从数小时减少到数分钟。索引术语 - Pangenomics,生物信息学,图形布局,GPU加速度
人类基因组项目是一个巨大的成就,为人类物种的遗传学和基因组学探索了无数的基础。多年来,人类基因组参考序列仍然不完整,并且缺乏人类遗传多样性的代表。最近,已经出现了两个重大进展来解决这些缺点:完全无间隙的人类基因组序列,例如由端粒到telomere群结的结合所开发的,以及高质量的pangenomes,例如由人类Pangenome Pangenome参考联盟中的dna序列组成和基因组合的依赖性,例如,由人类Pangenome PangeNome参考核心组成的核心和基因组合的核心,历史上难以顺序的区域,包括着丝粒,端粒和分段重复。同时,Pangenomes捕获了全世界种群中广泛的遗传多样性。共同发展了基因组学研究的新时代,增强了基因组分析的准确性,铺平了精确医学的道路,并有助于更深入地了解人类生物学。
人类基因组的测序是一个具有里程碑意义的成就,它彻底改变了我们对人类生物学的理解,从而深刻了解了特征和疾病的遗传基础以及人类进化史(53,55,86)。在人类基因组参考序列的可用性之前,人类遗传学领域在很大程度上依赖于家庭的谱系分析,细胞遗传学技术和低分辨率的遗传测定,以研究遗传疾病的原因(70)。这些早期方法有助于为统计方法奠定基础,例如关联测试,培养遗传咨询的概念,并为更复杂的分子遗传研究铺平了道路。然而,缺乏人类基因组参考序列限制了洞察力的深度和广度,尤其是对于受众多基因座基因组影响的复杂性状。从2001年的历史出版物开始(86),人类的基因组参考序列已发挥了多种作用。最重要的是作为控制人类发展,生理学和病理学许多方面的基因和调节序列的全面目录。通过诸如DNA元素百科全书(Eckode)(46)和路线图表观基因组学(124)项目等倡议增强,参考序列也使人们更深入地了解了调节元件的复杂网络,这些元件的复杂网络跨越了基因表达,塑造细胞功能和生物体跨健康和疾病状态的基因表达。在线Mendelian在MAN(OMIM)数据库中的继承证明了这一进展,该数据库现在分类了近7,000个疾病和特征的遗传基础(9)。通过促进基于家庭的联系分析和关联研究,参考序列指数级加速了突变,基因和途径的发现和表征,这些突变,基因和途径介导了各种特征和疾病中的变化。也已经确定了许多常见的遗传危险因素;截至2023年10月,全国人类基因组研究研究所 - 欧洲生物毒素格式化研究所全体基因组协会研究(GWASS)(96)包含> 500,000个关联,> 500,000个关联,> 6,500个已发表的研究。人类基因组参考序列的另一个变革性方面是其在遗传变异的鉴定和分析中的作用,这推动了人口基因和比较基因组学领域(19,80)。在最基本的级别上,参考序列充当一个分析资源和坐标系,可以精确地映射DNA序列变化。关于人群内部和人群之间遗传多样性的结果信息已提高了对进化过程的更深入的了解,例如历史迁移,人口规模的变化以及对新环境的遗传适应性。随着我们的前进,人类的基因组参考序列将在人类遗传学的不断发展的叙事中仍然是一个基石。但是,使用最广泛的参考序列
。cc-by-nc-nd 4.0国际许可证(未获得同行评审证书)获得的是作者/资助者,他已授予Biorxiv授予Biorxiv的许可,以永久显示预印本。这是该版本的版权所有,该版本于2024年4月2日发布。 https://doi.org/10.1101/2024.03.14.585029 doi:Biorxiv Preprint
Pangenome参考文献通过存储一组代表性的单倍型及其对齐方式来解决参考基因组的偏见,通常是作为图形。由变体呼叫者确定的备用等位基因可用于构造pangenome图,但是长阅读测序的进步导致广泛可用的高质量的分阶段组件。直接从组件中构造pangenome图,而不是变体调用,它利用该图在不同尺度上表示变化的能力。在这里,我们介绍了直接从全基因组比对创建pangenomes的Mimigraph-Cactus pangenome管道,并证明了其从人类Pangenome参考联盟中扩展到90个人类单倍型的能力。该方法构建包含所有形式的遗传变异的图形,同时允许使用当前的映射和基因分型工具。我们衡量用于分析的参考基因组的质量和完整性的效果,并表明,使用端粒到三聚体联盟的CHM13参考可以提高我们方法的准确性。我们还展示了果蝇的构造Melanogaster Pangenome。
摘要:在过去十年中,由于基因组测序技术、组装算法和计算基因组学的进步,豆科植物基因组学研究发生了范式转变,这些进步使得构建主要豆科作物的高质量参考基因组组装成为可能。这些进步无疑促进了对许多豆科作物农艺重要性状背后的新遗传变异的鉴定。此外,这些强大的测序技术使我们能够使用“泛基因组分析”研究多个个体和物种水平的整个基因组的结构变异。本综述更新了构建各种豆科作物泛基因组组装的进展,并讨论了这些泛基因组的前景以及如何利用这些信息通过分子育种来改善各种具有经济重要性的性状,以增加豆科植物的遗传增益并应对日益严重的全球粮食危机。
摘要:泛基因组旨在代表一个物种或一组物种中存在的完整基因组多样性,捕捉个体之间的基因组结构差异。这种基因组信息与表型数据相结合,可用于识别与非生物胁迫耐受性、抗病性和其他理想性状有关的基因和等位基因。泛基因组中新结构变体的表征可以支持基因组编辑方法,例如成簇的规律间隔短回文重复序列和 CRISPR 相关蛋白 Cas (CRISPR-Cas),以更高的效率提供有关基因序列和变体特异性基因中新靶位的功能信息。本综述讨论了泛基因组在基因组编辑和作物改良中的应用,重点介绍了泛基因组准确识别植物基因组 CRISPR-Cas 编辑靶基因的潜力,同时避免了不利的脱靶效应。我们考虑了使用泛基因组参考资料应用 CRISPR-Cas 编辑的局限性以及克服这些局限性的潜在解决方案。
