视觉问题回答(VQA)是一项具有挑战性的任务,需要通过关系推理对图像和问题进行跨模式理解,从而导致正确答案。为了弥合这两种方式之间的语义差距,以前的作品着重于所有可能对的单词区域对齐,而无需更多地关注相应的单词和对象。同样处理所有对,而无需考虑关系一致性,这是模型的性能。在本文中,为了对齐关系对并整合VQA系统的解释性,我们提出了一个跨模式的关系构建网络(CRRN),以掩盖不一致的注意力图,并突出相应单词对的全部潜在比对。具体来说,我们提出了两个相关性掩码,用于模式间和模式内突出显示,从而推断出图像中句子或区域中越重要的单词。可以通过掩盖未对齐的关系来增强一致对的关注相互关系。然后,我们提出了两个新颖的损失L CMAM和L SMAM,并具有明确的超级视觉,以捕获视觉和语言之间的细粒度相互作用。我们进行了彻底的实验来证明有效性并实现了GQA基准的竞争性绩效,以达到61.74%。
在这项工作中,我们提出了梦想,这是一种fMRI到图像的方法,用于重建从大脑活动中查看的图像,基于人类Vi-Sual System的基本知识。我们制作的反向途径模仿了人类如何看待视觉世界的高度和平行性质。这些量身定制的途径专门用于fMRI数据的解密语义,颜色和深度线索,反映了从视觉刺激到fMRI录音的前进途径。这样做,两个组件模仿了人类视觉系统中的反向过程:反向Vi-Sual Toalsosis Cortex(R-VAC)逆转了该大脑区域的途径,从fMRI数据中提取语义;反向平行的PKM(R-PKM)组件同时预测fMRI信号的颜色和深度。实验表明,从外观,结构和语义的一致性方面,我们的方法优于最新模型。代码将在https://github.com/weihaox/dream上提供。
7KLV UHVHDUFK LV AND AND IN THE JLVDOLVDWLQ AND VILTERS VIQVRU\ H[SHUVLVWHQW AND AND AND LOVE PDSSSLVLEOs :KHURH KRZ LV LW IHOW LPDJLQHG LPDJHG" &DQ LW EH EVILIC PDSSHG frqvhtxhqwqwo \ who'&dq and and and and ylvdo odqjxdjo Infurlisionary。 prghov wr fkdqjh和shuvrq v olyhg h [shulhqfh“&kurqlq 3dlq 6 \ qgurp lv lv lv lv lvleoh xqsudvsdeoh lw dihfwv shrsoh shrsoh shrsoh shrsoh shrsoh shrsoh shrsoh shrsoh shrsoh shrsoh shrsoh hvvhqwldoo \ lw v d v d v v d vljqd and ysof and ysof and in vlj and in vlj and in vlj and in vlj and in vljq w and yus in vljq ryhu vhqvlwlvdwlrq ri wkh fhqwudo qhuyrxv v \ vwhp rffxuv $ 0d \ lq o lq 、1hxurlpdjdjdjdjvxdolvl whe和and and and and and and and and and and and and lq hylghqfhr frujdqlvdwlvdwlvdwlvuv和非常权利的权利ri ri iss olhv lq wr lqwhuxsw wkhvh vljqdov及其在此之前,与fdq uhdfd uhdfd vxe vxe vxe fruwlfd pruh frujqlwlyh odqjqllyh odqjjxdjjhg e eld wrrnwrrwhglrwhrrr wrrrr fruwlfd fruwlfd Ilqg rxw仅在[shulhqfh pdnlqj,prgho ri vrphwklqj eulqjlqj in [and and this and and and and and and and and and and and and and and and and and and and和fdw中,这是这个dooohyld ru glvr ru glvrvrpiruw suhvhqhqwklq ihq ihef vr vr vr vr vr vrr vrr vrr vrr vrr vr vr vrphwklqj eulqjlqj ihef lv fdvh fdvh fdvh lq p \ rxw rxw vwxfn dv lqvwhdg vrphwrjhwkkhu这个ioxlg fdq fdq fdvlvw zlwk wany wany wany wany wany wany
通过视觉引导手部动作进行的计算机交互通常采用抽象的基于光标的反馈或不同程度真实感的虚拟手 (VH) 表示。目前尚不清楚在虚拟现实环境中更改这种视觉反馈的效果。在这项研究中,19 名健康的右撇子成年人使用四种不同类型的视觉反馈执行食指运动(“动作”)和观察运动(“观察”):简单的圆形光标 (CU)、指示手指关节位置的点光 (PL) 图案、阴影卡通手 (SH) 和逼真的 VH。使用数据手套记录手指运动,并以光学方式记录眼动追踪。我们使用功能性磁共振成像 (fMRI) 测量大脑活动。与基线相比,动作和观察条件均显示枕颞皮质中的 fMRI 信号响应更强。动作条件还会引起运动、体感、顶叶和小脑区域的双侧激活增加。对于这两种情况,带有移动手指的手部反馈(SH、VH)比 CU 或 PL 反馈导致更高的激活,特别是在早期视觉区域和枕颞皮质中。我们的结果表明,与视觉不完整的手部和抽象反馈相比,在视觉引导的手指运动过程中,皮质区域网络的募集更强。这些信息可能对研究和应用或训练相关范例中涉及人体部位的视觉引导任务的设计产生影响。
实现强大而实时的3D感知是自动驾驶汽车的基础。虽然大多数现有的3D感知方法优先考虑检测准确性,但十个忽略了关键方面,例如计算效率,板载芯片部署友好性,对传感器安装偏差的韧性以及对各种VE-HILE类型的适应性。为了应对这些挑战,我们提出了nvautonet:一种专业的鸟类视图(BEV)感知网络 - 针对自动化车辆的明确量身定制。nvautonet将同步的相机图像作为输入,并预测3D信号(例如障碍物,自由空间和停车位)。NVAUTONET架构(图像和Bev Back-bones)的核心依赖于有效的卷积网络,该网络使用Tensorrt优化了高性能。我们的图像到BEV转换采用简单的线性层和BEV查找表,从而确保了快速推理速度。Nvautonet在广泛的专有数据集中受过培训,在NVIDIA DRIVE ORIN SOC上以每秒53帧的速度运行,始终达到升高的感知精度。值得注意的是,Nvautonet表现出对不同汽车模型产生的偏差偏差的韧性。此外,Nvautonet在适应各种车辆类型方面表现出色,这是通过廉价模型的微调程序来促进的,可以加快兼容性调整。
从网络数据中学习可概括的视觉表示已为机器人技术带来了令人鼓舞的结果。然而,预循环方法着眼于预训练2D表示,是应对闭塞的优势,并在复杂的3D场景中准确地将对象定位。同时,3D代表学习仅限于单对象。为了解决这些局限性,我们引入了一个名为Sugar的机器人技术的新型3D预训练框架,该框架通过3D点云捕获对象的语义,几何和负担性能。我们强调了3D表示学习中混乱场景的重要性,并自动构建一个受益于模拟中无需成本监督的多对象数据集。Sugar采用一种多功能变压器的模型来共同解决五个预训练任务,即用于语义学习的跨模式知识蒸馏,以掩盖点建模,以取消几何结构,掌握姿势合成以进行对象负担,3D实例分割和引用表达地面以分析杂乱无章的场景。我们对三个与机器人相关的任务进行了学习的代表,即零射击3D对象识别,引用凸起的接地和语言驱动的机器人操作。实验结果表明,糖的3D表示优于最先进的2D和3D表示。
我们使用两种互补视觉方式探索视觉增强学习(RL):基于框架的RGB凸轮和基于事件的动态视觉传感器(DVS)。iSTING多模式视觉RL方法在有效提取与任务相关的信息时经常遇到挑战。为了解决这个问题,我们提出了用于视觉RL的分解多模式表示(DMR)框架。它将输入分为三个不同的组成部分:与任务相关的效果(共同功能),RGB特异性噪声和DVS特异性噪声。共同创作表示与RL任务相关的两种模式中的完整信息;这两个噪声组件都受到数据重构损失以避免信息泄漏的约束,与共同创作形成对比,以最大程度地差异。广泛的经验表明,通过明确分开不同信息的类型,我们的方法可实现与最先进的方法相比,实质性改善的政策绩效。
以生物风格的活动相机跟踪近年来引起了人们的兴趣。现有的作品要么利用对齐的RGB和事件数据进行准确跟踪,要么直接学习基于事件的跟踪器。前者会产生较高的推理成本,而后者可能容易受到嘈杂事件或稀疏空间分辨率的影响。在本文中,我们提出了一个新型的分层知识蒸馏框架,该框架可以在培训期间完全利用多模式 /多视图信息,以促进知识转移,使我们能够仅使用事件信号来实现测试过程中高速和低潜伏期视觉跟踪。特别是,基于教师变压器的多模态跟踪框架首先是通过同时喂食RGB框架和事件流来训练的。然后,我们设计了一种新的分层知识蒸馏策略,其中包括成对相似性,功能表示和基于响应地图的知识蒸馏,以指导学生变形金刚网络的学习。在术语中,由于现有的基于事件的跟踪数据集都是低分辨率(346×260),因此我们提出了名为EventVot的第一个大规模高分辨率(1280×720)数据集。它包含1141个视频,并涵盖了许多类别,例如行人,车辆,无人机,乒乓球等。对低分辨率(Fe240Hz,Vi-Sevent,Coesot)和我们新提出的高分辨率EventVot数据集的进行了实验进行了实验
基于变压器的模型已在包括图像超级分辨率(SR)在内的低级视觉任务中取得了显着的结果。但是,在获得全球信息时,基于不重叠的窗口中依赖自我注意的早期aperach遇到了挑战。为了激活全球更多输入像素,已经提出了混合注意模型。此外,通过仅将像素的RGB损失(例如L 1)降至最低而无法捕获基本的高频降低,训练不足。本文提出了两种贡献:i)我们引入了卷积非本地稀疏注意(NLSA)块,以扩展混合变压器体系结构,以增强其接受场。ii)我们采用小波损失来训练变压器模型,以提高定量和主观性能。虽然先前已经探索过小波损耗,但在基于训练变压器的SR模型中显示了它们的力量是新颖的。我们的实验结果表明,所提出的模型在各种基准数据集中提供了状态的PSNR结果以及出色的视觉性能。
