摘要:机器学习领域的快速发展也带来了一些生存挑战,这些挑战本质上都与“信任”这一广义概念有关。这一广义概念的各个方面包括对任何机器学习过程输出的信任(以及防止黑匣子、幻觉等)。对科学的信任正受到威胁,尤其是现在法学硕士可以产生“好看的废话”,论文工厂的出现是为了应对当前研究环境中不正当的奖励制度。同一枚硬币的另一面是,如果机器学习得不到适当的控制,它也会突破安全和隐私障碍,违反 GDPR 以及其他道德、法律和社会障碍,包括公平性。此外,数据“某处”的存在绝不意味着其实际可重用性。这包括现已确立的 FAIR 原则的四个要素:许多数据即使找到也无法找到,在明确定义的条件下也无法访问,如果访问则无法互操作(第三方和机器无法理解),这导致绝大多数数据和信息无法重复使用,除非违反版权、隐私法规或隐含或明确支撑查询或深度学习算法的基本概念模型。现在,越来越多的数据也将被机器“独立”使用,所有这些挑战都将严重加剧。本次主题演讲将讨论“数据访问”相对于传统的“数据共享”(包含数据下载、传输和失去控制的内涵)如何减轻大多数(如果不是全部)传统“数据共享”的不良副作用。对于联合数据访问,数据应该从另一个意义上或角度来看是公平的,它们应该是“联合的、AI-Ready”的,以便访问算法可以回答与访问控制、同意、格式相关的问题,并且可以读取有关数据本身的丰富(公平)元数据,以确定它们是否“适合用途”和机器可操作(即公平数字对象或机器可操作单元)。“适合用途”的概念远远超出了(但包括)有关方法、质量、误差线等的信息。访问算法的所有操作的“不可变日志记录”至关重要,尤其是在使用“群体学习”中的自学习算法时。足以让我们忙上一阵子了。https://www.nature.com/articles/s41586-021-03583-3
我们在过去5年(2024年4月22日至2019年4月22日之间)在关键字“联合数据网络”上搜索了PubMed,并确定了任何描述FDN并包括健康数据的出版物。我们通过使用内部大语言模型来补充这些发现,根据与初始搜索中确定的关键论文的相似性分数来识别其他论文。我们筛选了确定的论文,这些论文描述了出版物中提到或引用的任何其他FDN感兴趣的FDN。最后,我们询问了四位具有FDN研究经验的流行病学同事,如果我们发现的FDN列表中可能会缺少任何网络,因为即使他们没有出版物,我们也希望包括已知的FDN。
近年来,“被遗忘的权利”(RTBF)的概念已成为数字信任和人工智能安全数据隐私的关键方面,需要提供支持根据要求删除个人数据的机制。因此,机器学习(MU)引起了相当大的关注,这使ML模型可以选择性地消除可识别的信息。从MU演变出来的是,联邦未学习(FU)已经出现了,以面对联合学习(FL)设置中数据擦除的挑战,该设置促使FL模型能够取消fl客户端或与客户有关的可识别信息。尽管如此,联邦学习的独特属性引入了FU技术的特定挑战。这些挑战需要在开发FU算法时进行量身定制的设计。虽然在该领域存在各种概念和许多联合的未学习方案,但统一的工作流程和FU的量身定制设计尚不清楚。因此,这项全面的调查深入研究了FU的技术和方法,提供了基本概念和原则的概述,评估了现有的联邦未学习算法,并审查了针对联邦学习量身定制的优化。此外,它讨论了实际应用并评估其局限性。最后,它概述了未来研究的有希望的方向。
research p oster s ummary联合学习(FL)系统[5]允许培训机器学习模型分布在多个客户端,每个客户都使用私人数据。传统上,在几轮中,FL执行三个步骤直到停止条件发生:1。服务器将全局模型权重发送给客户端; 2。每个客户端在本地使用私人数据训练模型,并将其权重发送给服务器;和3。服务器合并了客户端的权重,以制定改进的全局模型。由于资源和数据的异质性,客户选择在FL系统的功效[1],[2],[6],[8],[8],[11] - [14]中起着至关重要的作用。训练回合所花费的时间由最慢的客户确定。此外,能源消耗和碳足迹也被视为主要问题。在这种情况下,我们提出了FL:MEC和ECMTC的两种最佳时间和能源的客户选择算法。第一个将训练时间和总能量消耗最小化,而第二个则逆转了两个指标之间的优先级,同时还要满足截止日期。尽管相关工作的贡献,但据我们所知,这项工作是第一个提出算法,通过共同优化执行时间和能源消耗,同时定义每个客户应在本地使用多少数据,从而使具有异质资源的客户选择算法。在我们的方法中,客户选择被建模为必须分配给一组客户端r的任务t数。每个客户端I具有一组分配容量(A I),其中任务象征着本地数据单位。此外,我有时间(P I)和能量(E I)成本与其分配的任务数(X I)相关的每个客户端。给定的一轮具有与其所选客户端相关的pan和en gy的费用,分别表示为优化目标c max和σe,它们定义为c max:= maxi∈Rp i(x i)和σe:= p
摘要:在医学诊断领域实施机器学习算法的趋势是必要且有意义的。然而,数据隐私已成为应用中的一大问题。本文使用联邦学习(FL)架构来处理隐私问题,并找到提高模型性能的方法。该研究结合 FedAvg FL 算法和 CNN 模型 EfficientNet 在脑肿瘤分类(MRI)数据集上训练模型。在实施算法之前,该研究对数据进行了一些预处理。然后,该研究使用 EfficientNet 进一步处理和识别图像,并使用 FedAvg 对客户端训练的模型进行加权平均。此外,该研究探索了优化器和损失函数,选择了更适合此任务的 AdamW 和交叉熵损失。最后,该研究深入了参数调整工作,绘制了一些曲线和表格来可视化结果。经过参数调整后,本文发现测试准确率高达 81.218%,所有客户端的平均训练准确率高达近 99%。另外,本文还讨论了不同CNN模型的实现条件,分析了它们在医学诊断领域的优缺点,为网络模型和算法的结合提供了一些思路。
1 Alpha模型是我们的“自动分析师”,它每天都会评估我们宇宙中每个可投资公司的吸引力。用于选择股票的指标是通过经济推理和统计有效性证明的,并且具有长期的重点,从而导致投资组合流动率较低。他们分为六个类别:估值,情感,增长,盈利能力,公司行为(包括治理)和资本结构。该模型标识哪些库存具有这些特征最有吸引力的组合,并且随后将输出用于创建优化的投资组合,旨在最大程度地提高风险调整后的回报。Alpha模型还使用来自我们负责任的投资和参与专家的专有数据,以在每个估值中对公司治理进行评估。
联合学习(FL)是人工智能中的最先进技术,可在降低计算和通信成本的同时,保留数据隐私和安全性。它改变了传统的集中机器学习和深度学习方法,以实现无需数据交换的分散模型培训。这项工作介绍了FLAUTIM,这是基于Kubernetes(K8S)和Flower Framework的巴西和拉丁美洲的FL平台的首次实施。FLAUTIM专为学术使用而设计,使没有技术背景的研究人员可以轻松地在该平台上进行FL实验。此外,该平台允许开发涉及从连接车辆收集的数据的应用程序。因此,本研究旨在介绍这个新的FL平台,从而提供其架构的全面细节。
我们通过不信任服务器或其他筒仓/客户的人的私人数据来重新审视联合学习(FL)的问题。在这种情况下,每个筒仓(例如医院)有来自几个人的数据(例如患者),需要保护每个人数据的隐私(例如健康记录),即使服务器和/或其他孤岛试图发现此数据。silo记录级差异差异隐私(ISRL-DP)通过要求Silo I的通信满足项目级差异隐私,从而防止每个Silo的数据被泄漏。先前的工作[Lowy and Razaviyayn,2023a]表征了具有同质(I.I.D.)ISRL-DP算法的最佳多余风险范围筒仓数据和凸损失函数。但是,两个重要的问题被打开:(1)可以通过异质(非I.I.D。)实现相同的多余风险范围。孤岛数据?(2)可以通过更少的沟通回合实现最佳风险范围吗?在本文中,我们对两个问题给出了积极的答案。我们提供了新颖的ISRL-DP FL算法,这些算法在存在异质筒仓数据的情况下达到了最佳的过量风险界限。此外,我们的算法比以前的最新算法更有沟通效率。对于平滑的损失功能,我们的算法达到了最佳的多余风险界限,并且具有与非私有的下限相匹配的通信复杂性。此外,我们的算法比以前的最新算法更有效。
摘要。分散的联合学习(DFL)是一种创新的范式来培训协作模型,以解决单一的失败限制。但是,FL和DFL的安全性和可信赖性因中毒攻击而受到损害,从而对其表现产生负面影响。现有的防御机制是为集中式FL设计的,它们不能充分利用DFL的特殊性。因此,这项工作引入了Sentinel,这是一种防御策略,以抵消DFL中的中毒攻击。Sentinel利用本地数据的可访问性,并定义了一个三步聚合协议,该协议包括相似性过滤,自举验证和归一化以保护恶意模型更新。Sentinel已通过不同的数据集和数据分布进行了评估。此外,已经验证了各种中毒攻击类型和威胁水平。当数据遵循IID(独立和相同分布)配置时,结果与未靶向和有针对性的中毒攻击相对于不靶向和有针对性的中毒攻击提高了最新性能。此外,在非IID配置下,它可以分析Sentinel和其他最先进的强大聚合方法的性能如何降低。
