单光摄像机的惊人发展为科学和工业成像创造了前所未有的机会。但是,这些1位传感器通过这些1位传感器进行的高数据吞吐量为低功率应用创造了重要的瓶颈。在本文中,我们探讨了从单光摄像机的单个二进制框架生成颜色图像的可能性。显然,由于暴露程度的差异,我们发现这个问题对于标准色素化方法特别困难。我们论文的核心创新是在神经普通微分方程(神经ode)下构建的暴露合成模型,它使我们能够从单个观察中产生持续的暴露量。这种创新可确保在Col-Orizers进行的二进制图像中保持一致的曝光,从而显着增强了着色。我们演示了该方法在单图像和爆发着色中的应用,并显示出优于基准的生成性能。项目网站可以在https://vishal-s-p.github.io/projects/ 2023/generative_quanta_color.html
开放式摄取的人类对象相互作用(HOI)的构图与检测以自然语言为指导的新型HOI的问题有关,这对于不认为以人为中心的场景至关重要。然而,先前的零射HOI检测器通常使用相同水平的图形图来模拟距离的HOI,从而在包含具有较大距离的人类对象对的场景中导致次优性能。此外,这些检测器主要依赖类别名称,并概述语言可以提供的丰富上下文信息,这对于捕获通常很少见的开放词汇概念至关重要,而单独使用类别名称的词汇量不佳。在本文中,我们引入了一种新型的端到端开放词汇HOI检测框架,该框架具有有条件的多级解码和细粒度的semantic增强(CMD-SE)(CMD-SE),从而利用了视觉语言模型(VLMS)的潜力。具体来说,我们建议通过在两部分匹配过程中结合软性结合来对具有不同特征图的不同距离的人类对象对进行建模。更重要的是,通过利用大型语言模型(LLM),例如GPT模型,我们利用了他们广泛的世界知识来生成人体部分状态的描述,以进行各种相互作用。然后,我们整合了人体部分的泛化和细粒语义,以证明相互作用的识别。在两个数据集(Swig-hoi和Hico-det)上进行的实验结果表明,我们提出的方法达到了最新的方法,可以实现开放的词汇HOI检测。代码和模型可在https://github.com/ltttpku/cmd-se-版本中使用。
最近,模型合并技术已浮出水面,作为将多个单元模型组合为单个多泰模型组合的解决方案。但是,该领域的先前努力需要进行其他培训或细调过程,或者要求模型具有相同的预先训练的初始化。在这项工作中,我们在W.R.T.先前的工作中确定了一个缺点。单位相似性在重量空间和激活空间中的不一致性。为了解决这种不一致,我们提出了一个创新的模型合并框架,该模型是在双空间约束(MUDSC)下合并的。具体而言,我们主张探索位于双重空间中统一高相似性的区域中的置换矩阵,而不是仅仅使单个空间的目标最大化,这是通过激活和重量相似性矩阵的线性组合实现的。为了提高可用性,我们还对群体结构进行了对企业的适应,包括多头关注和群体标准化。全面的实验比较表明,MUDSC可以很明显地提高具有各种任务组合和体系结构的合并模型的性能。此外,多任务损失景观中合并模型的可视化表明,MUDSC使合并的模型能够驻留在重叠段中,其中每个任务都有统一的较低损失。我们的代码可在https://github.com/zju-vipa/training_free_model_merging上公开获取。
M.Sc. 化学家SC ..的化学(以前)生物学。 4:B.Sc. 数学GAFUF 8A化学家和计算机SC的生物学。 对于化学家D B.Sc. 化学家和计算机SC的生物学H JAFTUF胸罩数学。 对于化学家TtyaàM.Sc.化学家SC ..的化学(以前)生物学。4:B.Sc. 数学GAFUF 8A化学家和计算机SC的生物学。 对于化学家D B.Sc. 化学家和计算机SC的生物学H JAFTUF胸罩数学。 对于化学家Ttyaà4:B.Sc.数学GAFUF 8A化学家和计算机SC的生物学。对于化学家D B.Sc.化学家和计算机SC的生物学H JAFTUF胸罩数学。对于化学家Ttyaà
当前的视频异常检测(VAD)方法本质上仅限于封闭设置的设置,并且可能在开放世界应用程序中遇到困难,在培训期间,测试数据中可能存在异常类别。最近的一些研究试图解决更现实的开放式VAD,该研究旨在解散视为异常和正常视频的看不见异常。但是,尽管这种能力对于构建更明智的视频监视系统至关重要,但这种设置着重于预测框架异常得分,没有识别异常类别的能力。本文进一步迈出了一步,并探讨了开放词汇视频异常检测(OVVAD),我们的目的是利用预训练的大型模型来检测和cate-可见和看不见的异常。为此,我们提出了一个模型,该模型将OVVAD分解为两个相互构成的任务 - 类不足的检测和特定于类的分类 - 并共同优化了这两个任务。特别是,我们设计了一个语义知识注入模块,以从大语言模型中引入语义知识以进行检测任务,并设计一种新型的异常合成模块,以在大型视觉生成模型的帮助下生成伪异常视频,以实现分类任务。这些语义知识和综合异常大大扩展了我们模型在检测和分类各种可见和看不见的异常方面的能力。对三个广泛使用的基准测试的实验实验实现了我们的模型在OVVAD任务上实现了最新的性能。
我们发现,对于七个领域中的六个,我们分析的研究并未为开放基础模型的边际风险提供有说服力的证据:他们不考虑框架中的步骤,例如现有技术或防御能力如何适应边际风险。但是,对于与CSAM相关的风险,Thiel等人。(2023)3进行了完整的分析,该分析显示了未能令人满意解决的开放基础模型的边际风险。4为了提供指导,我们对自动网络安全脆弱性检测和NCII进行了初步的边际风险评估,我们发现,当前开放基础模型的边际风险较低,对于自动化脆弱性检测(部分是由于AI的有效性而用于防御的效率),而开放模型的开放型风险对NCII有可能。
我们提出了Vidim,这是一个视频间隔的生成模型,该模型在启动和最终框架下创建了简短的视频。为了实现高保真度并在输入数据中产生了看不见的信息,Vidim使用级联的分化模型首先以低分辨率生成目标视频,然后在低分辨率生成的视频上生成高分辨率视频。我们将视频插补的先前最新方法归纳为先前的最新方法,并在大多数设置中演示了这种作品如何在基础运动是复杂,非线性或模棱两可的情况下失败,而Vidim可以轻松处理此类情况。我们还展示了如何在开始和最终框架上进行无分类器指导,并在原始高分辨率框架上调节超级分辨率模型,而没有其他参数可以解锁高保真性结果。vidim可以从共同降低所有要生成的框架,每个扩散模型都需要少于十亿个pa-rameters来产生引人注目的结果,并且仍然可以在较大的参数计数下享有可扩展性和提高质量。请在vidim- Interpolation.github.io上查看我们的项目页面。
在最近的研究中,已对开放式摄制对象检测任务进行了大量关注,旨在概括训练期间标记的类别的有限级别,并检测推理时任意类别名称所描述的对象。与常规对象检测相比,打开的词汇对象检测在很大程度上扩展了对象检测类别。但是,它依赖于计算图像区域与一组具有验证视觉和语言模型的任意类别名称之间的相似性。这意味着,尽管具有开放式的性质,但该任务仍然需要在推理阶段的预定义对象类别。这提出了一个问题:如果我们在推理中对对象类别没有确切的了解,该怎么办?在本文中,我们称之为新的设置为生成性开放式对象检测,这是一个更普遍和实际的问题。为了解决它,我们将对象检测形式为生成问题,并提出了一个名为generateu的简单框架,该框架可以检测密集的对象并以自由形式的方式生成其名称。尤其是,我们采用可变形的DETR作为区域促成生成器,其语言模型将视觉区域转换为对象名称。为了评估自由形式的对象划分任务,我们介绍了一种评估方法,旨在定量测量生成量的性能。广泛的实验表明我们的生成量强烈的零射击性能。代码可在以下网址获得:https://github.com/foundationvision/generateu。例如,在LVIS数据集上,我们的GenerateU在推理过程中属于类别名称,即类别名称无法看到类别名称,即使类别名称看不见类别名称,我们的GenerateU也可以与开放式唱机对象检测方法GLIP相当。
手势在人类和人类机器人相互作用中起着关键作用。在基于任务的上下文中,诸如指向之类的神性手势对于指导关注与任务相关的实体至关重要。虽然大多数基于任务的人类和人类手机Di-Alogue专注于封闭世界领域的工作,但重新研究已开始考虑开放世界任务,在这种任务中,与任务相关的对象可能不知道与先验者相互作用。在开放世界任务中,我们认为必须对手势进行更细微的考虑,因为交互者可以使用桥接传统手势类别的手势,以便浏览其任务环境的开放世界维度。在这项工作中,我们探讨了在开放世界任务上下文中使用的手势类型及其使用频率。我们的结果表明需要重新考虑在人类和人类机器人相互作用的研究中进行手势分析的方式。
开放式对象检测(OSOD)已成为当代研究方向,以解决对未知对象的检测。最近,很少有作品通过使用Con-Contrastive聚类来分开未知类,在OSOD任务中实现了可观的性能。相比之下,我们提出了一种新的基于语义聚类的方法,以促进语义空间中有意义的群集的对齐,并引入一个类去相关模块以实现群间间的分离。我们的方法进一步不适合对象焦点模块预测对象分数,从而增强了未知对象的检测。此外,我们采用了i)一种评估技术,该技术对低置信度输出进行了惩罚,以减轻对未知对象的错误分类的风险,ii)一种称为HMP的新指标,该指标使用hMP使用Har-nonic Mean结合了已知和未知的精度。我们的广泛实验表明,所提出的模型可以在OSOD任务上对MS-Coco&Pascal VOC数据集有显着改进。
