驾驶是一项复杂的活动,需要仔细计划和持续关注。人类驾驶员根据观察结果,过去的经验以及对潜在情景和必要行动的期望来分析其周围环境。尽管对观测数据进行了自动驾驶培训,但它们面临着陌生,不确定和冒险的驾驶情况的挑战。这些车辆在具有各种元素的环境中运行,例如交通标志,行人和其他车辆。了解这些要素之间的关系和互动对于在不同情况下理解自动驾驶汽车的行为至关重要。要实现5级完整驾驶自动化,这需要一个能够在没有人工干预的情况下处理所有驾驶任务的系统,人工智能(AI)模型需要高质量的表示,发现以及对驾驶场景中元素之间因果关系的理解1。在因果关系(CBN)[1]中表达的对因果关系的理解将受益于知识图(kg)中的明确表示。这个想法提出了许多重要的研究问题。在驾驶场景中,基于CBN的因果关系可以帮助理解广告场景吗?可以在KG中使用基于CBN的因果表示执行干预和反事实推理,例如确定特定的
了解道路结构对于实现自动驾驶至关重要。此信息主题包含两个基本组成部分 - 车道与车道与交通元素之间的关联之间的互连(例如,交通信号灯),其中仍然没有综合拓扑推理方法。一方面,现有的地图学习技术在使用基于分段或基于LAN线的表示中得出车道连接方面面临挑战;或先前的方法专注于中心线检测,同时忽略了互动建模。另一方面,将流量元素分配给车道的主题在图像域中受到限制,而图像和3D视图之间对应关系的构造是未开发的挑战。为了解决这些问题,我们提出了Toponet,这是一个用于分析驾驶场景的最终端拓扑推理网络。为了有效地捕获驾驶环境的拓扑结构,我们介绍了三个关键设计:(1)将嵌入式的介绍从2D元素集成到统一的特征空间中; (2)一个精选的场景图神经网络,该网络建模并促进网络中的相互作用; (3)设计了一个场景知识图,而不是任意传输消息,而是将先验知识与各种类型的场景拓扑区分开。我们在具有挑战性的场景上评估了Toponet理解基准OpenLane-V2,我们的方法在所有感知和拓扑指标中都超过了所有以前的作品。该代码将公开发布。
摘要 - 与其相关的研究人员和设计师所付出了许多努力,将隐藏在元评估和虚拟现实技术中的潜力进行了努力,这使得元和虚拟现实的构建成为了一个趋势主题。在虚拟世界中,除虚拟体系结构外,虚拟景观还起着必不可少的作用。同时,尽管游戏中的景观构成了虚拟景观的重要组成部分,但电影和动画视觉效果中的景观在虚拟景观中也起着重要作用。与电影或动画中的景观相比,玩游戏可以被视为与游戏景观的主观互动,该游戏更接近与Metaverse或虚拟现实的互动(它们都显示出与虚拟景观的主观互动)。因此,本文将把游戏作为研究媒介。Tsushima游戏幽灵中美丽的景观获得了广泛的好评。因此,本文将基于Tsushima幽灵的游戏景观,以分析游戏景观的顺序和场景景观之间的相关性和主观评估。因此,这项研究的目的是找到定量度量指标之间的有意义的相关性(本文将是分形维度,这是游戏景观的复杂性水平)和主观语句,以提供设计建议,以构建游戏中虚拟景观。
我们介绍𝑆3,一种新颖的方法,用于产生表达性,以动画为中心的3D头和对话中角色的眼睛动画。给定语音音频,导演脚本和摄影3D场景作为输入,我们会自动输出每个角色的头和眼睛的动画3D旋转。𝑆3将动画和心理语言的见解提炼成一个新颖的模块化框架,以捕捉对话式捕捉:音频驱动的节奏性头运动;叙事脚本驱动的象征性的头和眼睛手势;以及根据音频驱动的凝视焦点/厌恶和3D视觉场景显着性计算出的凝视轨迹。我们的评估是四个方面:我们针对地面真相数据和基线替代方案进行定量验证算法;我们进行了一项感知研究,表明我们的结果与先前的艺术相比有利。我们介绍了动画仪控制和对3输出的批评的示例;并提出大量引人入胜且多样化的对话凝视动画。
计算机视觉技术在自动驾驶汽车的感知堆栈中起着核心作用。使用此类方法来感知给定数据的车辆周围环境。3D激光雷达传感器通常用于从场景中收集稀疏的3D点云。然而,根据人类的看法,这种系统努力鉴于那些稀疏的点云,因此很难塑造现场的看不见的部分。在此问题中,场景完成任务旨在预测LiDAR测量中的差距,以实现更完整的场景表示。鉴于最近扩散模型作为图像的生成模型的有希望的结果,我们建议将其扩展以实现单个3D LIDAR扫描的场景。以前的作品使用了从LiDAR数据提取的范围图像上使用扩散模型,直接应用了基于图像的扩散方法。差不多,我们建议直接在这些点上操作,并介绍尖锐的和降解的扩散过程,以便它可以在场景规模上有效地工作。与我们的方法一起,我们提出了正规化损失,以稳定在denoising过程中预测的噪声。我们的实验评估表明,我们的方法可以在单个LIDAR扫描中完成场景,作为输入,与最新场景完成方法相比,产生了更多详细信息的场景。我们认为,我们提出的扩散过程公式可以支持应用于场景尺度点云数据的扩散模型中的进一步研究。1
航空航天已经开发了高保真的太空领域意识(SDA)场景模拟器,为基于地面和空间的电光传感器提供现实的太空监视场景,以在从概念开发到操作到操作以及评估任务数据处理Algorithm和其他数据Pipeelines的所有阶段中的利益相关者为利益相关者提供模拟图像。我们使用传感器 - 目标参与方案构建场景,该场景在添加适当的背景,恒星,目标和噪声组件的同时对场景的频段辐射指定进行建模。场景模拟器使用恒星目录,包括超过十亿星的Gaia目录,将它们准确地放入图像中,并准确地表示其颜色校正的带有带有的亮度降低至22级。模拟器使用其他已发表的数据来对银河系平面中的黄道光和未解决的恒星的自然天空亮度进行建模。此外,由于未拒绝的杂散光而产生的较高背景是基于实验室和轨道测量结果注入诸如宇宙射线之类的时间背景效应。模拟器可选地包含了电流传感器偏置结构和噪声源的实验室测量,例如深电流,读取噪声和其他时空传感器噪声的来源。由模拟器创建的高保真场景目前用于降低风险,指导技术开发并为多个程序提供操作范围,以确保传感器硬件性能和数据处理软件将满足任务需求和要求。航空航天可以通过任何传感器观察操作概念(CONOPS)模拟场景,场景中的目标可以以任何忠诚度建模,从简单的漫不好物球体到高保真计算机辅助设计(CAD)模型,呈现出具有现实的双向反射率分配功能(Brundfs)和摄取复杂的效果。
为主动和被动的光学感官技术提供了互补的方式。此外,现有的雷达传感器具有很高的成本效益,并且在运行在户外操作的机器人和车辆中。我们介绍了雷达场 - 一种为活动雷达成像器设计的神经场景重建方法。我们的方法将具有隐式神经几何形状和反射模型的显式,物理知识的传感器模型团结起来,以直接合成原始雷达测量并提取场景占用率。所提出的方法不依赖卷渲染。相反,我们在傅立叶频率空间中学习字段,并通过原始雷达数据监督。我们验证了我们在各种室外场景中的有效性,包括带有密集车辆和基础设施的城市场景以及MM波长感应的恶劣天气情况。
摘要:扩散策略是有条件的扩散模型,这些模型学习以机器人和环境状态为条件的机器人动作分布。他们最近显示出胜过确定性和替代作用分布学习公式的表现。3D机器人策略使用3D场景特征表示形式使用感应深度从单个或多个相机视图汇总。他们已经显示出比在相机观点之间更好地概括其2D对应物。我们统一了这两条工作和现在的3D扩散器演员,这是一种具有新颖的3D DeNoising Transformer的神经政策,它融合了来自3D视觉场景的信息,语言指令和本体感受,以预测NOISISE 3D ROBOT姿势的噪声。3D扩散器Actor在RLBench上设置了新的最先进的,其绝对性能增益比当前的SOTA在多视图设置上占据了18.1%,并且在单视图设置上的绝对增益为13.1%。在加尔文基准测试上,它比当前的SOTA相对增加了9%。它还学会了通过少数示威来控制现实世界中的机器人操纵器。通过与当前的SOTA策略和模型的消融进行彻底比较,我们显示了3D扩散器演员的设计选择极大地超过了2D表示,回归和分类目标,绝对关注和整体非言语的非言语非言语的3D场景嵌入。
生成模型中的进步引发了人们对产生图像的重大兴趣,同时遵守特定的结构指南。场景图到图像生成就是生成与给定场景图一致的图像的一项任务。然而,视觉场景的复杂性在基于场景图内的指定关系准确对齐的观察中提出了一个挑战。现有方法通过先预测场景布局并使用对抗性训练从这些布局生成图像来处理此任务。在这项工作中,我们介绍了一种新颖的方法来从场景图中产生iM,从而消除了预测中间布局的需求。我们利用预先训练的文本对图像扩散模型和剪辑指导来将图形知识转化为图像。向此,我们首先使用基于GAN的培训将图形编码器与相应图像的剪辑特征与相应图像的剪辑特征对齐。此外,我们将图形特征与给定场景图中存在的对象标签的剪辑嵌入融合在一起,以创建一个一致的剪辑引导性调节信号。在条件输入中,对象嵌入提供了图像的粗糙结构,图形特征提供了基于对象之间关系的结构对齐。fi-Nelly,我们对图一致的调节信号和夹子对准损失的图一致的调节信号进行了预训练的扩散模型。详细的实验表明,我们的方法在可可粘合和视觉基因组数据集的标准基准上的现有方法优于现有方法。我们的代码和重现结果的说明可以在https://anonymon.4open.science/r/gandiffuclip-d9e8中找到。
摘要 - 由于数据稀缺,在混乱的场景中挖掘仍然是灵巧的手。为了解决这个问题,我们提出了一个大规模的合成数据集,包括1319个对象,8270个场景和4.26亿个格拉斯普斯。除了基准测试之外,我们还从掌握数据中探索了数据有效的学习策略。我们揭示了以局部特征为条件的生成模型和强调复杂场景变化的GRASP数据集的组合是实现有效概括的关键。我们提出的生成方法在模拟实验中优于所有基准。更重要的是,它通过测试时间深度恢复表明了零拍的SIM到现实转移,获得了90.70%的现实世界灵巧抓地力成功率,展示了利用完全合成训练数据的强大潜力。
