版权所有©2021 Arbabyazd等。这是根据Creative Commons Attribution 4.0国际许可条款分发的开放访问文章,只要将原始工作正确归因于任何媒介,它允许在任何媒介中进行无限制的使用,分发和复制。
合成数据与人工智能医疗设备的创新、评估和监管 Puja Myles,公共卫生硕士、博士;Johan Ordish,文学硕士;Richard Branson,理学硕士、文学硕士 摘要 合成数据是模仿真实数据的属性和关系的人工数据。它有望促进数据访问、验证和基准测试,解决缺失数据和欠采样、样本增强以及在临床试验中创建对照组的问题。英国药品和保健产品管理局 (MHRA) 正在利用其目前对高保真合成数据开发的研究,制定其对经过合成数据训练的人工智能医疗设备的监管立场,并将合成数据作为人工智能医疗设备验证和基准测试的工具。 关键词 人工智能作为医疗设备 (AIaMD)、数据隐私、健康数据、合成数据、验证、监管 简介 人工智能 (AI) 在医疗和社会保健领域的应用预计将会兴起,这意味着人工智能作为医疗设备 (AIaMD) 将成为医疗设备中越来越突出的子类别。 1 因此,医疗器械法规是否适合人工智能变得越来越重要,制造商是否了解并遵守其义务也变得越来越重要,其中最主要的是证明其 AIaMD 具有良好的效益风险比。2 强大的数据集是展示 AIaMD 性能的核心,通常是此类设备开发的主要障碍。3 医疗器械监管机构有责任确保制造商拥有履行这些义务所需的工具,并提供更广泛的支持以鼓励此类创新设备的开发。合成数据集的开发很可能成为这样一种辅助工具。本文概述了 MHRA 在研究和开发合成数据方面的努力,并考虑在更广泛的改革背景下使用合成数据,以确保医疗器械法规适用于人工智能。合成数据概况 近年来,人们对合成数据的兴趣日益浓厚,原因有很多,包括在数据治理法规更加严格的世界中可能易于获取、保护患者隐私、在机器学习算法背景下的基准测试和验证能力,以及解决真实数据局限性的能力,如数据缺失、欠采样和样本量小。4 更重要的是,尽管合成数据的潜在应用已经讨论了多年,但直到最近,合成数据生成方法的进步才能够产生高质量的合成数据。5 定义合成数据 从概念上讲,合成数据是模仿真实数据的属性和关系的人工数据。合成数据的质量取决于生成合成数据的方法。合成数据的质量通常用其“效用”或“保真度”来描述。“能够捕捉各种数据字段之间复杂的相互关系以及真实数据的统计特性的合成数据集可称为“高实用性”或“高保真度”合成数据集。在患者医疗保健数据方面,高保真度合成数据集将能够捕捉复杂的临床关系,并且在临床上与真实患者数据难以区分。高效用合成数据的生成往往需要大量资源,并且根据需要合成数据的应用,使用低效用或中等效用合成数据可能是可以接受的。
公司背景:AI Arrive 是一家人工智能公司,其愿景是创建 AI 产品,以加速研究并增强我们对人类疾病的了解。CloseBy 是一个健康生活平台,它汇总不同的社区数据,以帮助个人在搬迁到特定区域时做出明智的决定。我们的使命很简单,就是使数据孤岛民主化,并呈现一个整体的画面,帮助个人做出更明智的决定。团队规模:4-5 名学生地点:远程,客户/团队会议将使用 Zoom 举行。项目摘要:AI Arrive 希望使用开源数据集(例如人口普查、空气质量开放数据、CDC 社会脆弱性指数、Zillow 住房和租金价格以及 python news-fetch)开发一个健康生活平台。目标是构建 ETL 提取系统和聚合开源社区数据和新闻文章的数据模型。另一个目标是使用 d3.js 和/或其他可视化工具开发视觉效果以在地图上显示数据。所有知识产权将归 AI Arrive 所有。关键技能/技术:开发 ETL 管道、使用数据库和使用 d3.js 进行可视化的背景将有助于完成这个项目。团队可以向客户寻求指导。学生福利:
了解神经系统的功能需要绘制其由功能,解剖或基因表达定义的其组成细胞的空间分布。最近,组织制备和显微镜的发展使整个啮齿动物大脑都可以成像细胞弹出。但是,手动映射这些神经元很容易出现偏见,并且通常不切实际地消耗。在这里,我们提出了一种使用stan-dard台式计算机硬件的鼠标全脑显微镜图像中完全自动化的3D检测神经元somata的开放源算法。我们通过绘制大脑范围的位置来证明方法的应用和力量,这些位置的大脑种群用逆行跨突触性VI-RAL感染表达的细胞质泛流蛋白标记。
在计算机科学中,教科书谈到了“垃圾进,垃圾出”(GIGO)的概念;即低质量的输入数据会产生不可靠的输出或“垃圾”。当我们处理高度复杂的数据模式(例如 X 光片和计算机断层扫描)时,GIGO 就变得更加紧迫。任何深度网络的性能都直接取决于它学习的数据集的质量。可靠数据集的一个例子是像 Cancer Imaging Archive [ 1 ] 这样拥有大量专家工作成果的知名存储库 [ 2 ]。遵守 DICOM 标准并确保图像正确链接到支持元数据对于构建精心策划的数据集至关重要。最近几周,我们观察到一种趋势,即匆忙使用不当数据来训练 COVID-19 深度网络。AI 爱好者似乎不耐烦地创建自己的医学图像数据集,而没有寻求临床合作者来指导他们。这些数据集更像是通过手动收集可公开访问的图像(例如在线期刊和非同行评审档案中的预印本)而形成的“玩具集”。大多数时候,没有临床或医学能力的人工智能研究人员会创建自己的实验性“玩具”数据集,以进行初步调查并建立算法挑战框架。需要明确的是,从医学成像角度来看,“玩具数据集”并不是因为非常小且不符合 DICOM 标准而成为玩具,更重要的是因为它是由工程师和计算机科学家创建的,而不是由医生和医学/临床专家创建的。此类 COVID-19 图像数据集已在互联网上出现,
从多模式MRI中进行的脑组织分割是许多神经影像分析管道的关键基础。已建立的组织分割方法并未开发出来应对由病理学(例如白质病变或肿瘤)引起的大型解剖变化,并且在这些情况下通常会失败。同时,随着深神经网络(DNN)的出现,脑损伤的分割显着成熟。然而,现有的方法很少允许对正常组织和脑病变的联合分割。当前,注释的数据集通常仅处理一个特定任务,并且依赖任务特定的成像协议,包括任务特定的成像模式集,因此目前妨碍了针对此类联合任务的DNN。在这项工作中,我们提出了一种新的方法,可以从聚合的任务特异性异型模式结构域构建关节组织和病变分割模型。从关节问题的各种公式开始,我们展示了如何通过经验分解和优化预期的风险。我们利用了处理跨数据集的异质成像方式的风险上限。为了应对潜在的域转移,我们基于数据增强,对抗性学习和伪健康的生成进行了整合并测试了三种常规技术。对于每个单独的任务,我们的联合方法与任务特定的和完全监督的模型相比具有比较性能。对两种不同类型的脑损伤进行评估,该框架将进行评估:白质病变和神经胶质瘤。在后一种情况下,缺乏用于定量评估目的的联合基础真相,我们提出并使用一种新型的临床上相关的定性评估方法。
非人类人道主义:当人工智能的善举变成坏事时 Mirca Madianou 伦敦大学金史密斯学院 2018 年,有超过 1.68 亿人需要人道主义援助,同时有超过 6900 万人成为难民,人道主义部门面临着重大挑战。人工智能 (AI) 应用可以成为人道主义危机的潜在解决方案的提议受到了热烈欢迎。这是“人工智能用于社会公益”大趋势的一部分,也是“数字人道主义”更广泛发展的一部分,“数字人道主义”指的是公共和私营部门为应对人道主义紧急情况而使用数字创新和数据。聊天机器人、声称可以预测未来流行病或人口流动的预测分析和建模以及依赖于采用机器学习算法的先进神经网络的生物识别技术,都是在援助行动中越来越受欢迎的例子。本文建立了一个跨学科框架,将殖民和非殖民理论、人道主义和发展的批判性探究、批判性算法研究以及对人工智能的社会技术理解结合在一起。人道主义在这里被理解为一种复杂的现象:不仅仅是通常定义的“减少痛苦的必要性”(Calhoun,2008),而且是一种行业、一种话语和一种源于 19 世纪和 20 世纪殖民主义的历史现象(Fassin,2012;Lester & Dussart,2014)。人工智能同样是一个多面现象:不仅仅是基于先进计算和机器学习算法的技术创新,而且是一个行业以及关于技术的特定话语。人工智能只能与数据和算法一起理解——这三者是不可分割的,因为人工智能依赖于机器学习算法,而机器学习算法是特定数据集的产物。鉴于“大数据”本质上是不完整的,且具有本体论和认识论的局限性(Crawford & Finn,2014),人工智能应用会重现并可能放大大型数据集中发现的现有偏见(Benjamin,2019;Eubanks,2018;Noble,2018 等)。
RNA编辑是一种广泛的转录后机制,能够通过插入/缺失或基本替换来修改成绩单。它在哺乳动物中很突出,其中数百万腺苷被酶的成员脱离插入。a-to-i RNA编辑具有大量的生物学功能,但在大规模转录组数据集中的检测仍然是未解决的计算任务。为此,我们开发了Reditools,这是第一个软件包,该软件包专门用于RNA编辑Pro filefifing RNA序列(RNASEQ)数据。它已成功地用于人类转录组中,证明了RNA编辑的组织和细胞类型特异性及其普遍性。在我们的专业重复数据库中收集了有关人类RNASEQ数据的大规模重新分析分析的结果,其中包含超过450万个事件。在这里,我们详细描述了两个基于我们的计算资源,重新数字和重复的生物信息学过程。在第一个程序中,我们概述了在人类细胞系NA12878中检测RNA编辑的工作流,为此,转录组和整个基因组数据可用。在第二个程序中,我们展示了如何在亨廷顿疾病供体的验尸样本中鉴定在特定的重新编码位点上的非调节编辑。在64位计算机上运行≥32GB的随机存储器(RAM)的Linux上,这两个过程均应使用4至24个内核,〜76 h。我们的方案旨在研究具有可用转录组和/或基因组读数的不同生物体中的RNA编辑。可以在https://github.com/bioinfouniba/reditools上获得完成这两个过程和Docker映像的脚本。
高通量测序在生物医学领域已变得无处不在。随着新技术的出现和测序成本的下降,可用数据的多样性和数量呈指数级增长,成功浏览数据变得更具挑战性。尽管数据集通常由公共存储库托管,但科学家必须依靠不一致的注释来识别和解释有意义的数据。此外,高通量生物数据的实验异质性和广泛的质量意味着即使具有所需细胞系、组织类型或分子靶标的数据也可能不易解释或整合。我们开发了 ORSO(社交组学在线资源)作为一个易于使用的 Web 应用程序,将生命科学家与基因组学数据联系起来。在 ORSO 中,用户在数据驱动的社交网络中交互,他们可以收藏数据集并关注其他用户。除了来自主要生物医学联盟的 30,000 多个数据集外,用户还可以将自己的数据贡献给 ORSO,以方便其他用户发现它。 ORSO 利用用户交互,提供了一种新颖的推荐系统,可自动将用户与托管数据连接起来。除了社交互动之外,推荐系统还考虑了主要读取覆盖率信息和带注释的元数据。ORSO 以图形显示方式呈现推荐系统使用的相似性,从而允许探索数据集关联。网络图的拓扑结构反映了已建立的生物学,相关系统的样本被分组在一起。我们使用从胚胎干细胞分化到心肌细胞的 RNA 序列时间过程数据集测试了推荐系统。ORSO 推荐系统正确地预测早期数据点源为胚胎干细胞,晚期数据点源为心脏和肌肉样本,从而推荐了相关数据集。通过将科学家与相关数据联系起来,ORSO 提供了一种重要的新服务,促进了广泛的研究兴趣。
