摘要:该项目旨在开发一个旨在在室内环境(例如购物中心,公交车站和电影院)操作的自主垃圾机器人。机器人的主要目标是在浏览空间并避免障碍的同时检测和收集垃圾项目。利用传感器和图像处理技术的组合,机器人可以识别垃圾对象,并调整其在不误认为障碍物的情况下将其捡起的路径。通过采用具有成本效益的硬件组件和简化算法,我们旨在创建一个实用的解决方案,以解决公共空间中的垃圾污染,这证明了机器人技术在环境可持续发展方面的潜力。关键字:Raspberry Pi,垃圾检测,对象识别,避免障碍物,节点MCU,机器人,Arduino IDE
尽管最近的研究通过深度学习技术突破了极限,但从 3D 点云中进行物体检测仍然是一项具有挑战性的任务。由于严重的空间遮挡和点密度随到传感器距离的固有变化,同一物体在点云数据中的外观会有很大变化。因此,设计针对这种外观变化的鲁棒特征表示是 3D 物体检测方法的关键问题。在本文中,我们创新地提出了一种类似域自适应的方法来增强特征表示的鲁棒性。更具体地说,我们弥合了特征来自真实场景的感知域和特征从由富含详细信息的非遮挡点云组成的增强场景中提取的概念域之间的差距。这种领域自适应方法模仿了人脑在进行物体感知时的功能。大量实验表明,我们简单而有效的方法从根本上提高了 3D 点云物体检测的性能并取得了最先进的结果。
许多基于机器学习的轴突追踪方法依赖于带有分割标签的图像数据集。这需要领域专家的手动注释,这需要大量劳动力,并且不适用于以细胞或亚细胞分辨率对半球或整个脑组织进行大规模脑映射。此外,保留轴突结构拓扑对于理解神经连接和大脑功能至关重要。自监督学习 (SSL) 是一种机器学习框架,允许模型在未注释的数据上学习辅助任务,以帮助完成监督目标任务。在这项工作中,我们提出了一种新颖的 SSL 辅助任务,即为面向拓扑的轴突分割和中心线检测的目标任务重建边缘检测器。我们使用小鼠大脑数据集对三个不同的 SSL 任务进行了 3D U-Nets 预训练:我们提出的任务、预测排列切片的顺序和玩魔方。然后,我们在不同的小鼠大脑数据集上评估了这些 U-Nets 和基线模型。在所有实验中,针对我们提出的任务进行预训练的 U-Net 分别将基线的分割、拓扑保留和中心线检测提高了 5.03%、4.65% 和 5.41%。相比之下,切片排列和魔方预训练的 U-Net 并没有比基线有持续的改进。
摘要 — 在癫痫监测中,由于脑电图伪影在幅度和频率上具有形态相似性,因此经常被误认为是癫痫发作,这使得癫痫发作检测系统容易受到更高的误报率的影响。在这项工作中,我们介绍了一种基于并行超低功耗 (PULP) 嵌入式平台上最少数量的脑电图通道的伪影检测算法的实现。分析基于 TUH 脑电图伪影语料库数据集,并重点关注颞电极。首先,我们使用自动机器学习框架在频域中提取最佳特征模型,在 4 个颞脑电图通道设置下实现了 93.95% 的准确率和 0.838 F1 得分。所实现的准确率水平比最先进的水平高出近 20%。然后,这些算法针对 PULP 平台进行并行化和优化,与最先进的低功耗伪影检测框架实现相比,能效提高了 5.21 倍。将此模型与低功耗癫痫发作检测算法相结合,可以在可穿戴外形尺寸和功率预算下使用 300 mAh 电池进行 300 小时的连续监测。这些结果为实现经济实惠、可穿戴、长期癫痫监测解决方案铺平了道路,该解决方案具有低假阳性率和高灵敏度,可满足患者和护理人员的要求。临床意义——所提出的 EEG 伪影检测框架可用于可穿戴 EEG 记录设备,结合基于 EEG 的癫痫发作检测算法,以提高癫痫发作检测场景的稳健性。索引词——医疗保健、时间序列分类、智能边缘计算、机器学习、深度学习
我们介绍多视图的细心上下文化(MVACON),这是一种简单而有效的方法,用于改善基于查询的多视图3D(MV3D)对象检测中的2D- TO-3D功能。尽管在基于查询的MV3D对象检测的领域取得了显着的进展,但先前的艺术通常会因高分辨率的高分辨率2D特征而缺乏基于密集的注意力提升的高分辨率2D特征,或者由于高计算成本,或者由于3D Queries的高度密集地接地不足,无法以3D Queries的高度质量为基于稀疏注意的多级2D功能。我们提出的MVACON使用代表密集但计算稀疏的细心特征连续化方案击中了两只鸟,该方案对特定的2d到3d feleture提升方法不可知。在实验中,使用BEVFormer及其最近的3D变形注意(DFA3D)变体以及PETR对纳斯曲霉基准进行了彻底的测试,并显示出一致的检测性能提高,尤其是在位置,方向和VELOCITY PRECTICTAR中提高了一致的检测性能。还可以在Waymo-Mini基准测试器上进行测试,并具有类似的改进。我们在定性和定量上表明,基于全局群集的上下文有效地编码了MV3D检测的密集场景级上下文。我们提出的MVA-CON的有希望的结果加强了计算机视觉中的格言 - “(contectu-alsized)特征事项”。
近年来,文本图像联合预训练技术在各种任务中显示出令人鼓舞的结果。然而,在光学特征识别(OCR)任务中,将文本实例与图像中的相应文本区域对齐是一个挑战,因为它需要在文本和OCR文本之间有效地对齐(将图像中的文本称为ocr-文本以与自然语言中的文本区分开来),而不是对整体图像内容的全面理解。在本文中,我们提出了一种新的预训练方法,称为o cr-text d估计化m odeling(ODM),该方法根据文本提示将图像中的文本样式传输到统一样式中。使用ODM,我们在文本和OCR文本之间实现了更好的对齐方式,并启用预训练的模型以适应场景文本的复杂和多样化的样式。此外,我们为ODM设计了一种新的标签生成方法,并将其与我们提出的文本控制器模块相结合,以应对OCR任务中注释成本的挑战,并以大量未标记的数据参与预培训。在多个Pub-LIC数据集上进行的广泛实验表明,我们的方法显着地证明了性能,并且在场景文本检测和发现任务中的当前预训练方法优于当前的预训练方法。代码在ODM上可用。
摘要 — 寻找合适的停车位是一个具有挑战性的问题,尤其是在大城市。随着汽车保有量的增加,停车位变得越来越稀缺。对这些停车位的需求不断增长,再加上有限的停车位,导致了供需失衡。缺乏足够的停车管理系统导致许多街道上到处都是非法停放的汽车。需要一个可扩展、可靠、高效的停车管理系统来解决这个问题。基于深度学习的计算机视觉技术已经成为解决此类问题的有希望的解决方案。这些技术对图像识别和处理领域产生了巨大的影响。它们还为车辆跟踪领域的进一步应用提供了巨大的潜力。因此,它们可以用来检测停车位。
我保证,据我所知,我的论文不侵犯任何人的版权,也不违反任何专有权利,并且我的论文中包含的任何想法、技术、引用或来自他人作品的任何其他材料(无论是否已发表)均已根据标准引用惯例完全承认。此外,如果我所包含的受版权保护的材料超出了《印度版权法》所规定的公平使用范围,我保证我已获得版权所有者的书面许可,可以将此类材料纳入我的论文中,并将此类版权许可的副本附在我们的附录中。
我们对一项名为动力电池检测(PBD)的新任务进行了全面的研究,该任务旨在从 X 射线图像中定位密集的阴极和阳极板端点,以评估动力电池的质量。现有制造商通常依靠人眼观察来完成 PBD,这使得很难平衡检测的准确性和效率。为了解决这个问题并让更多人关注这个有意义的任务,我们首先精心收集了一个称为 X 射线 PBD 的数据集,该数据集包含从 5 家制造商的数千个动力电池中选择的 1,500 张不同的 X 射线图像,具有 7 种不同的视觉干扰。然后,我们提出了一种基于分割的新型 PBD 解决方案,称为多维协作网络(MDCNet)。借助线和计数预测器,可以在语义和细节方面改进点分割分支的表示。此外,我们设计了一种有效的距离自适应掩模生成策略,可以缓解由板分布密度不一致引起的视觉挑战,从而为 MDCNet 提供稳定的监督。无需任何花哨的修饰,我们基于分割的 MDCNet 始终优于其他各种角点检测、人群计数和基于一般/微小物体检测的解决方案,使其成为有助于促进 PBD 未来研究的强大基础。最后,我们分享了一些潜在的困难和未来研究的工作。源代码和数据集将在 X-ray PBD 上公开提供。
水是所有人类活动的必要组成部分。根据联合国世界水评估计划,每天,200万吨污水,制造和农业废物被排放到世界水中。由于人口需求和减少清洁水供应以及可用的水污染管理机制;迫切需要使用计算方法智能管理可用的水。本文提出了人工神经网络,特别是卷积神经网络(CNN),用于自动化水杂质检测。为了完善模型,使用管道中的浑浊水的图片来检测事件。深度学习的算法通过4220张图像的数据集进行了大量培训后达到96.3%的准确性,反映了各种污染的污染。这表明该模型可用于水系统污染检测。
