与基于卷积神经网络(CNN)相比,我们研究了基于变压器的行人检测模型较低性能的原因。CNN模型会产生密集的行人建议,单独完善每个建议,然后对其进行非最大抑制(NMS)的跟进,以产生稀疏的预测。在争论中,变压器模型每个地面真相(GT)行人盒选择一个建议,然后从中选择了正面的正态。所有其他建议,其中许多与选定的建议高度相似,都通过了负梯度。尽管这导致了稀疏的预测,从而消除了NM的需求,但在许多类似的建议中,任意选择,有效的训练和较低的行人检测准确性。为了减轻问题,我们建议基于Min-Cost-Flow的配方,而不是常用的Kuhn-Munkres匹配算法,并纳入了诸如每个地面真相盒的约束,并且与一个建议的提案相匹配,并且许多同样好的建议可以与单个地面真相盒相匹配。我们提出了基于匹配算法的第一个基于变压器的行人检测模型。广泛的实验表明,我们的方法达到了3个失误率(较低)3。7 /17。4 /21。8/8。3/2。0在Eurocity / tju-traffic / tju-校园 /城市专家 /加州理工学院数据集中,而4个。7/18。7/24。8/8。5/3。 1通过当前的sota。 代码可从https://ajayshastry08.github.io/flow_ matcher 获得。5/3。1通过当前的sota。代码可从https://ajayshastry08.github.io/flow_ matcher
雷达相机3D对象检测旨在与雷达信号与摄像机图像进行交互,以识别感兴趣的对象并定位其相应的3D绑定框。为了克服雷达信号的严重稀疏性和歧义性,我们提出了一个基于概率deno的扩散建模的稳健框架。我们设计了框架,可以在不同的多视图3D检测器上易于实现,而无需在训练或推理过程中使用LiDar Point Clouds。在特定的情况下,我们首先通过开发带有语义嵌入的轻质DENOIS扩散模型来设计框架编码器。其次,我们通过在变压器检测解码器的深度测量处引入重建训练,将查询降解训练开发为3D空间。我们的框架在Nuscenes 3D检测基准上实现了新的最新性能,但与基线检测器相比,计算成本的增加很少。
实现统一的单眼3D对象检测,包括室内和室外场景,在机器人导航等应用中非常重要。然而,涉及各种数据方案来训练模型引起了挑战,因为它们的特性显着不同,例如,二 - 几何特性和异质域分离。为了应对这些挑战,我们根据鸟类的视图(BEV)检测范式建立了一个检测器,在该检测范式中,当采用多个数据方案以训练检测器时,明确的特征投影有利于对几何学学习模棱两可。然后,我们将经典的BEV检测体系结构分为两个阶段,并提出了不均匀的BEV网格设计,以处理由上述Challenges引起的收敛不稳定。此外,我们开发了稀疏的BEV功能策略,以降低计算成本和处理异质域的统一操作方法。将这些技术结合起来,得出了一个统一的检测器Unimode,它超过了富有挑战性的Omni3D数据集(一个大规模的数据集(一个室内和室外场景))的先前最先进的AP 3D,揭示了Bev bev tor tor tor tor tor tor tor unified 3D对象的第一个成功概括。
在最近的研究中,已对开放式摄制对象检测任务进行了大量关注,旨在概括训练期间标记的类别的有限级别,并检测推理时任意类别名称所描述的对象。与常规对象检测相比,打开的词汇对象检测在很大程度上扩展了对象检测类别。但是,它依赖于计算图像区域与一组具有验证视觉和语言模型的任意类别名称之间的相似性。这意味着,尽管具有开放式的性质,但该任务仍然需要在推理阶段的预定义对象类别。这提出了一个问题:如果我们在推理中对对象类别没有确切的了解,该怎么办?在本文中,我们称之为新的设置为生成性开放式对象检测,这是一个更普遍和实际的问题。为了解决它,我们将对象检测形式为生成问题,并提出了一个名为generateu的简单框架,该框架可以检测密集的对象并以自由形式的方式生成其名称。尤其是,我们采用可变形的DETR作为区域促成生成器,其语言模型将视觉区域转换为对象名称。为了评估自由形式的对象划分任务,我们介绍了一种评估方法,旨在定量测量生成量的性能。广泛的实验表明我们的生成量强烈的零射击性能。代码可在以下网址获得:https://github.com/foundationvision/generateu。例如,在LVIS数据集上,我们的GenerateU在推理过程中属于类别名称,即类别名称无法看到类别名称,即使类别名称看不见类别名称,我们的GenerateU也可以与开放式唱机对象检测方法GLIP相当。
摘要 - 该研究旨在实施能够自主检测绵羊目标并在2D占用图上代表它们的系统,其最终目标是促进在UXV平台上自主牧羊。本文详细介绍了Blackboard System的开发,Blackboard System是一种用于自动目标检测和映射的软件解决方案。使用Python和C编程语言,Blackboard系统将单眼深度感测与自主目标检测,以产生全面的深度和目标图。这些地图是合并的,以产生从高架相机的角度捕获的操作区域的详细的2D鸟视图。黑板系统的独特功能是其模块化框架,它允许无缝更新或更换其深度传感和目标检测模块。
单眼3D检测(M3D)的目的是从单视图像中进行精确的3D观察定位,该图像通常涉及3D检测框的劳动密集型注释。最近已经研究了弱监督的M3D通过利用许多存在的2D注释来遵循3D注释过程,但通常需要额外的培训数据,例如LiDAR Point Clouds或多视图图像,这些数据会大大降低其在各种应用中的适用性和可用性。我们提出了SKD-WM3D,这是一个弱监督的单眼3D检测框架,利用深度插入以实现M3D,并具有单一视图图像,而无需任何3D注释或其他培训数据。SKD-WM3D中的一个关键设计是一个自我知识的蒸馏框架,它通过融合深度信息并有效地减轻单核场景中固有的深度模棱两可,从而将图像特征转换为3D类似的表示形式,而无需计算上的计算层面。此外,我们设计了不确定性感知的分离损失和梯度定位的转移调制策略,分别促进了知识获取和知识转移。广泛的实验表明,SKD-WM3D明显超过了最新的实验,甚至与许多完全监督的方法相当。
水是所有人类活动的必要组成部分。根据联合国世界水评估计划,每天,200万吨污水,制造和农业废物被排放到世界水中。由于人口需求和减少清洁水供应以及可用的水污染管理机制;迫切需要使用计算方法智能管理可用的水。本文提出了人工神经网络,特别是卷积神经网络(CNN),用于自动化水杂质检测。为了完善模型,使用管道中的浑浊水的图片来检测事件。深度学习的算法通过4220张图像的数据集进行了大量培训后达到96.3%的准确性,反映了各种污染的污染。这表明该模型可用于水系统污染检测。
摘要:该项目旨在开发一个旨在在室内环境(例如购物中心,公交车站和电影院)操作的自主垃圾机器人。机器人的主要目标是在浏览空间并避免障碍的同时检测和收集垃圾项目。利用传感器和图像处理技术的组合,机器人可以识别垃圾对象,并调整其在不误认为障碍物的情况下将其捡起的路径。通过采用具有成本效益的硬件组件和简化算法,我们旨在创建一个实用的解决方案,以解决公共空间中的垃圾污染,这证明了机器人技术在环境可持续发展方面的潜力。关键字:Raspberry Pi,垃圾检测,对象识别,避免障碍物,节点MCU,机器人,Arduino IDE
收集了包括无人机和干扰因素的数据收集测试数据。无人机数据故意多样化,以各种距离和背景为特色。无人机在遥远的地方测试了模型检测无人机的准确性,该数据的细节受到限制,而在不同背景下的无人机测试了模型对噪声的弹性。根据类似于无人机或与无人机一起发现的对象,故意选择了干扰物数据。由于在选择和标记训练数据时犯了错误,该模型测试了模型被模型中存在的类似特征和偏见误导或愚弄的倾向。在步骤1中,总共收集了12206张图像,其中包括7755张图像和分散图像,其余4451张图像。
摘要:人工智能(AI)严重影响了各个部门,突破了技术和重新定义过程的界限。本文研究了AI进步的三个关键领域:用于软件开发的GitHub Copilot,长期记忆(LSTM)网络检测假新闻以及AI对运输的更大影响。Github副副词是AI-Power Edsing Assistant,正在彻底改变开发人员编写代码的方式。LSTM,一种复发性神经网络(RNN)的形式,提供了一种有效的解决方案来检测错误信息。最后,AI通过自动驾驶车辆和交通管理对运输的贡献,展示了AI如何重塑运输领域的基础设施,安全性和效率。本文旨在全面了解这些技术的工作方式及其社会影响。
