构建准确的地图是构成可靠的局部设备,计划和导航的关键构建块。我们提出了一种新的方法,可以利用LiDAR扫描来建立动态环境的准确地图。为此,我们建议将4D场景编码为新的时空隐式神经图表示,通过将时间依赖性的截断符号距离函数拟合到每个点。使用我们的代表,我们通过过滤动态零件来提取静态图。我们的神经表示基于稀疏特征网格,一种全球共享的解码器和时间依赖性的BAIS函数,我们以无监督的方式共同优化。要从一系列li-dar扫描中学习此表示,我们设计了一个简单而有效的损耗函数,以分段方式监督地图优化。我们在包含静态图的重建质量和动态点云的分割的各种场景上评估了我们的方法1。实验结果表明,我们的方法是删除输入点云的动态部分的过程,同时重建准确而完整的3D地图,以超出几种最新方法。
背景:静息态功能性磁共振成像 fMRI (rs- fMRI) 已广泛用于研究精神疾病的大脑功能,从而深入了解大脑组织。然而,rs-fMRI 数据的高维性给数据分析带来了重大挑战。变分自动编码器 (VAE) 是一种神经网络,在提取静息态功能连接 (rsFC) 模式的低维潜在表示方面发挥了重要作用,从而解决了 rs-fMRI 数据的复杂非线性结构。尽管取得了这些进展,但解释这些潜在表示仍然是一个挑战。本文旨在通过开发可解释的 VAE 模型并使用 rs-fMRI 数据在自闭症谱系障碍 (ASD) 中测试其效用来解决这一差距。
为了处理现实世界中的噪声数据和不完整信息,我们将机器学习的通用性和抗噪性与知识表示和符号推理的严谨性和可重用性相结合,构建能够灵活应对未知情况的强大人工智能。我们还旨在将AI应用到以前从未应用过的领域,例如估计COVID-19的基因网络,预测辐射下的细胞动态以及基于媒体数据分析行为。
大脑解码技术为解释神经活动的解释以重现思想,情感和运动的方式铺平了道路。Tang等。 (2023)引入了一种新颖的方法,该方法将语言模型用作基于功能磁共振成像(fMRI)数据的大脑解码的生成模型。 在他们的工作中构建,这项研究探讨了使用三种其他语言模型的使用以及先前研究中使用的GPT模型,以改善解码功能。 此外,我们使用嵌入模型添加了一个评估度量,提供了比BertScore更高水平的语义相似性。 通过比较解码的表现并确定导致良好性能的因素,我们发现高解码精度并不仅仅取决于准确预测大脑活动的能力。 相反,该模型倾向于生成更精确的句子重新构造的文本类型(例如Web文本,博客,新闻文章和书籍),它倾向于生成更重要的作用。Tang等。(2023)引入了一种新颖的方法,该方法将语言模型用作基于功能磁共振成像(fMRI)数据的大脑解码的生成模型。在他们的工作中构建,这项研究探讨了使用三种其他语言模型的使用以及先前研究中使用的GPT模型,以改善解码功能。此外,我们使用嵌入模型添加了一个评估度量,提供了比BertScore更高水平的语义相似性。通过比较解码的表现并确定导致良好性能的因素,我们发现高解码精度并不仅仅取决于准确预测大脑活动的能力。相反,该模型倾向于生成更精确的句子重新构造的文本类型(例如Web文本,博客,新闻文章和书籍),它倾向于生成更重要的作用。
从网络数据中学习可概括的视觉表示已为机器人技术带来了令人鼓舞的结果。然而,预循环方法着眼于预训练2D表示,是应对闭塞的优势,并在复杂的3D场景中准确地将对象定位。同时,3D代表学习仅限于单对象。为了解决这些局限性,我们引入了一个名为Sugar的机器人技术的新型3D预训练框架,该框架通过3D点云捕获对象的语义,几何和负担性能。我们强调了3D表示学习中混乱场景的重要性,并自动构建一个受益于模拟中无需成本监督的多对象数据集。Sugar采用一种多功能变压器的模型来共同解决五个预训练任务,即用于语义学习的跨模式知识蒸馏,以掩盖点建模,以取消几何结构,掌握姿势合成以进行对象负担,3D实例分割和引用表达地面以分析杂乱无章的场景。我们对三个与机器人相关的任务进行了学习的代表,即零射击3D对象识别,引用凸起的接地和语言驱动的机器人操作。实验结果表明,糖的3D表示优于最先进的2D和3D表示。
开放式对象检测(OSOD)已成为当代研究方向,以解决对未知对象的检测。最近,很少有作品通过使用Con-Contrastive聚类来分开未知类,在OSOD任务中实现了可观的性能。相比之下,我们提出了一种新的基于语义聚类的方法,以促进语义空间中有意义的群集的对齐,并引入一个类去相关模块以实现群间间的分离。我们的方法进一步不适合对象焦点模块预测对象分数,从而增强了未知对象的检测。此外,我们采用了i)一种评估技术,该技术对低置信度输出进行了惩罚,以减轻对未知对象的错误分类的风险,ii)一种称为HMP的新指标,该指标使用hMP使用Har-nonic Mean结合了已知和未知的精度。我们的广泛实验表明,所提出的模型可以在OSOD任务上对MS-Coco&Pascal VOC数据集有显着改进。
最近,密集的潜在变量模型已显示出令人鼓舞的结果,但是它们的分布式和潜在的代码使它们降低了易于解释,并且对噪声的影响较低。另一方面,稀疏表示更为简约,提供了更好的解释性和噪声稳健性,但是由于涉及的复杂性和计算成本,很难实现稀疏性。在此过程中,我们提出了一种新颖的无监督学习方法,以利用逐渐稀疏的尖峰和平板分布作为我们的先验,以在发电机模型的潜在空间上强化稀疏性。我们的模型由自上而下的发电网络组成,该网络将潜在变量映射到观测值。我们使用最大似然采样来推断发电机后方向的潜在变量,并且推理阶段的尖峰和平板正则化可以通过将非信息性潜在维度推动到零来引起稀疏性。我们的实验表明,学到的稀疏潜在表示保留了大多数信息,我们的模型可以学习解开的语义,并赋予潜在代码的解释性,并增强分类和denosing任务的鲁棒性。
虽然最近的无模型增强学习(RL)方法已经证明了人类水平在游戏环境中的有效性,但它们在视觉导航等日常任务中的成功受到了限制,尤其是在很明显的外观变化下。此限制来自(i)样本效率不佳和(ii)对培训方案的过度效果。为了应对这些挑战,我们提出了一种世界模型,该模型使用(i)对比不受监督的学习和(ii)干预不变的统治者学习不变特征。学习世界动态的明确表示世界模型,提高样本效率,而对比度学习隐含地实施不变特征的学习,从而改善了概括。,随着对比的损失与世界模式的na'整合还不够好,因为基于世界模型的RL方法独立地优化表示表示和代理策略。为了克服这个问题,我们提出了一种干预 - 不变的正规剂,其形式是辅助任务,例如深度预测,图像DeNoising,图像分割等,以明确执行不变性以进行样式的干预。我们的方法优于当前基于最新的模型和不含模型的RL方法,并显着改善了IGIBSON基准测试中评估的分数范围内导航任务。仅使用视觉观察,我们进一步证明了我们的方法超过了最近的语言引导导航基础模型,这对于在计算功能有限的机器人上部署至关重要。最后,我们证明了我们提出的模型在吉布森基准上其感知模块的SIM到真实传输方面表现出色。
机器人及时通过传感器数据构建持久,准确且可操作的模型的能力是自主操作的范围。在将世界表示为点云可能足以进行本地化时,避免障碍物需要更密集的场景表示形式。另一方面,更高级别的语义信息通常对于分解必要的步骤来完成一项复杂的任务,例如烹饪,自主是至关重要的。因此,迫在眉睫的问题是,手头机器人任务的合适场景表示是什么?这项调查提供了对关键方法和框架的全面回顾,这在机器人空间感知领域推动了进步,并特别关注了代表的历史演变和当前的趋势。通过将场景建模技术分类为三种主要类型(公式,公式和指标 - 语言流行),我们讨论了空间启示框架正在从构建世界的纯几何模型转变为更高级的数据结构的方式,这些模型包括更高级别的概念,例如对象实例和位置的概念。特别重点是实时同时定位和映射(SLAM)的方法,它们与深度学习的集成,以增强了鲁棒性和场景的理解,以及它们处理场景动态性的能力,作为当今驾驶Robotics研究的一些最热门的主题。我们在讨论方面的挑战和未来的研究方向的讨论中进行了结论,以建立适合长期自治的强大而可扩展的空间感知系统。
