基于锚点的大规模多视图聚类因其在处理海量数据集方面的有效性而引起了广泛关注。然而,当前的方法主要通过探索锚点图或投影矩阵之间的全局相关性来寻找用于聚类的共识嵌入特征。在本文中,我们提出了一种简单而有效的可扩展多视图张量聚类(S 2 MVTC)方法,我们的重点是学习视图内和跨视图的嵌入特征的相关性。具体而言,我们首先通过将不同视图的嵌入特征堆叠到张量中并旋转它来构造嵌入特征张量。此外,我们构建了一种新颖的张量低频近似(TLFA)算子,它将图相似性结合到嵌入特征学习中,有效地实现不同视图内嵌入特征的平滑表示。此外,对嵌入特征应用共识约束以确保视图间语义一致性。在六个大规模多视图数据集上的实验结果表明,S 2 MVTC 在聚类性能和 CPU 执行时间方面明显优于最先进的算法,尤其是在处理海量数据时。S 2 MVTC 的代码已公开发布在 https://github.com/longzhen520/S2MVTC。
1。一种自我监督的模型登录方法,仅取决于正面匹配对以改善面部嵌入。2。面部聚类的基于深度学习的相似性度量,该指标会自动适应给定模型的学习嵌入空间。3。不需要任何用户输入参数的全自动视频面聚类算法。4。发布电影脸聚类基准数据集,称为MoviefaceCluster,该数据集提供了电影域中存在的极端挑战的面部聚类场景。
摘要 — 本文提出了一种基于电网内现行功率流条件的节点聚类新方法。为此,首先,将网络的有功功率流状态建模为有向无环图。该有向图明确表示功率流向何处,这有助于监控和分析系统漏洞。有向无环图表示还可以轻松识别仅提供或吸收有功功率的总线:这些总线分别是纯源节点和纯汇节点。对系统中的每个节点应用迭代路径查找程序,以枚举供电的源节点和其将功率转发到的下游汇节点。然后应用新颖的聚类算法将共享同一组可达源节点和汇节点的节点分组在一起。首先提出这种新颖的聚类方法作为一种工具,通过更好地总结大型电网中的总功率流配置来提高控制室操作员的态势感知能力。所提出的方法应用于两个样本电网,并阐述了与河流系统的类比,将支流、分流和中央主流等概念应用于电网。
近年来,基于锚点的方法在多视图聚类中取得了可喜的进展。这些方法的性能受到锚点质量的显著影响。然而,以前的研究生成的锚点仅仅依赖于单视图信息,忽略了不同视图之间的相关性。特别地,我们观察到相似的模式更有可能存在于相似的视图之间,因此可以利用这种相关性信息来提高锚点的质量,而这同样被忽略了。为此,我们提出了一种新颖的即插即用的通过视图相关性进行多视图聚类的锚点增强策略。具体而言,我们基于对齐的初始锚点图构建视图图来探索视图间相关性。通过从视图相关性中学习,我们使用相邻视图上锚点和样本之间的关系来增强当前视图的锚点,从而缩小相似视图上锚点的空间分布。在七个数据集上的实验结果证明了我们的方法优于其他现有方法。此外,大量的对比实验验证了所提出的锚增强模块应用于各种基于锚的方法时的有效性。
摘要 集群计算在数据分析、科学模拟和人工智能等各个领域发挥着关键作用。通过利用多台互连计算机的功能,集群能够高效地处理大规模计算任务。然而,传统的集群计算方法具有固有的局限性,可能会阻碍其性能和可扩展性。近年来,量子计算已成为一种有前途的范式,有可能彻底改变计算能力。量子计算机利用量子力学原理比传统计算机更快地执行复杂计算。专为量子计算机设计的量子算法在解决传统系统计算挑战性问题方面表现出了卓越的能力。本研究重点关注量子算法在提高集群效率方面的应用。通过利用量子计算的独特属性(例如叠加和纠缠),量子算法提供了提高集群计算系统性能和可扩展性的可能性。本研究的目的是深入探讨在集群计算环境中使用量子算法的潜在优势、挑战和未来前景。通过研究现有的为提高集群效率而设计的量子算法并分析现实世界的案例研究,我们旨在深入了解这一新兴领域的实际意义。通过这一探索,我们力求阐明将量子算法集成到集群计算中的机会和局限性,并确定进一步研究和开发的潜在途径。通过利用
摘要 研究:AI 社会认知评估与建模。评估 LLM 中的心智理论及其在心理学中的应用 NLP:LLM IFT、表征学习(对比和三重态损失)、语义聚类、总结 DL:Transformers、MoE、EncDec、RNNs、DPO、LoRA 工具:Python、Pytorch、Deepspeed、AWS Sagemaker、hydra、SQL 管理:建立 ML 团队、职能、策略和 OKR、招聘和指导科学家和实习生以及建立数据和注释合作伙伴关系。
图像包含大量冗余信息,使其具有挑战性地在大规模上从它们中有效地了解它们。最近的工作通过在视觉语言构想学习期间掩盖图像贴片来解决这个问题[15,33,36,70]。一种简单的方法是随机放下大部分斑块,通过降低每个训练迭代中的计算成本和记忆使用量,从而更有效地培训训练[36]。替代策略是掩盖语义相关的贴片[15,33,70],例如属于同一对象的贴片。这迫使学习的模型预测从上下文中描述缺少场景结构的单词,从而改善了学识渊博的表示。但是,这种方法需要一种单独的机制来将语义重新贴定的补丁分组在一起,这为学习过程增加了相当大的复杂性,并且计算上很昂贵。我们提出了一种简单的掩盖策略,用于避免这些缺点的多模式对比学习。在训练期间,我们掩盖了斑块的随机簇(图1)。对于此聚类,我们将Patches的原始RGB值用作特征表示。我们的方法利用了一个事实,即视觉相似性的简单度量通常可以限制相干的视觉结构,例如对象部分[18,53],
对抗训练(AT)是提高深度神经网络鲁棒性的最常用机制。最近,一种针对中间层的新型对抗攻击利用了对抗训练网络的额外脆弱性,输出错误的预测。这一结果说明对抗训练中对抗扰动的搜索空间不足。为了阐明中间层攻击有效的原因,我们将前向传播解释为聚类效应,表征神经网络对于与训练集具有相同标签的样本的中间层表示相似,并通过相应的信息瓶颈理论从理论上证明了聚类效应的存在。随后我们观察到中间层攻击违反了 AT 训练模型的聚类效应。受这些重要观察的启发,我们提出了一种正则化方法来扩展训练过程中的扰动搜索空间,称为充分对抗训练(SAT)。我们通过严格的数学证明给出了经过验证的神经网络鲁棒性界限。实验评估表明,SAT 在防御针对输出层和中间层的对抗性攻击方面优于其他最先进的 AT 机制。我们的代码和附录可以在 https://github.com/clustering-effect/SAT 找到。
聚类是算法中的一个重要主题,在机器学习、计算机视觉、统计学和其他几个研究学科中有着广泛的应用。图聚类的传统目标是找到具有低电导性的聚类。这些目标不仅适用于无向图,而且无法考虑聚类之间的关系,而这对于许多应用来说可能是至关重要的。为了克服这些缺点,我们研究了有向图(有向图),其聚类彼此之间展示了更多的“结构”信息。基于有向图的 Hermitian 矩阵表示,我们提出了一种近线性时间的有向图聚类算法,并进一步表明我们提出的算法可以在合理的假设下以亚线性时间实现。我们的理论工作的意义通过对联合国商品贸易统计数据集的大量实验结果得到证明:我们算法的输出聚类不仅展示了聚类(国家集合)在进出口记录方面如何相互关联,还展示了这些聚类如何随着时间的推移而演变,这与已知的国际贸易事实一致。
