Show Me Examples: Inferring Visual Concepts from Image Sets
视觉语言模型 (VLM) 可以遵循复杂的文本指令,但它们很难从纯粹的视觉上下文中进行推理。特别是,当前的模型无法从示例图像集中推断出共享概念并将其应用于新的输入。我们引入了集合视觉概念推理(VICIS),这是一项评估这种能力的任务。给定共享概念和查询图像的一小部分上下文图像,模型必须生成新图像,以保留上下文定义的概念,同时与查询保持一致。我们证明最先进的 VLM 在这项任务上表现不佳......
Legacy Effects 获得奥斯卡提名的二人组 Shane Mahan 和 Lindsay MacGowan 分享 1986 年影片《异形》中战壕里的故事
One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation
视觉生成模型(例如扩散模型)通常在压缩的潜在空间中运行,以平衡训练效率和样本质量。与此同时,人们对利用高质量的预训练视觉表示越来越感兴趣——无论是在 VAE 内对齐它们还是直接在生成模型内对齐它们。然而,由于面向理解的特征和生成友好的潜在空间之间的根本不匹配,适应这种表示仍然具有挑战性。表示编码器受益于高维潜伏,捕捉不同的假设......
4月底,在上届 MiningWorld Russia 2026 展会上,Polyus Aldan 金矿企业的新型自动化采样系统在“机器人和自动驾驶车辆 (ATC)”类别中亮相。该解决方案被公认为“实用进口替代”类别的获胜者,实际上减少了 70% 以上的体力劳动,将获得分析的时间减少了近三分之一。
在本材料中,我们讨论位于叶卡捷琳堡的 Wingsby 公司 (WINGSBEE) 的项目,该项目专门生产光学分离器。我们与其专家进行了交谈,并了解了所开发解决方案的所有细节。 Wingsby 是 AKSALIT 公司集团的一部分。该公司自 2019 年以来一直生产光学分离器,包括为采矿和其他企业制造机器人和自动化系统,以对传送带上的异物进行分类、提取和清除。
Agentic vision: Building visual intelligence with Amazon Bedrock and MCP servers
在这篇文章中,我们将引导您了解计算机视觉 MCP 服务器,该服务器阐释了这种方法,展示了 AI 系统如何通过单一标准化界面处理视觉信息并做出智能决策。这种融合将曾经复杂的集成挑战转变为简化的流程,使人工智能功能可供更广泛的应用程序和开发人员使用。
MVTec at VISION 2026: Experience the Future of Machine Vision
-展会亮相凸显MVTec的技术和战略方向,以及机器视觉行业的未来 -人工智能成为展会的中心主题 -AI原型展示机器视觉的未来
6 Reasons Why You Should Always Back Up A Visual Approach With An Instrument Approach
下面介绍了如何使用仪表进场来支持目视进场,从而使您的着陆变得更加轻松、安全。
Food Sorting Robot Picking Cell: Control Vision, Grip, Conveyor Takt, And Placement Accuracy
围绕夹具重复性、工艺窗口控制、异常恢复、检查和稳定生产验收等规划食品分拣机器人拣选单元。食品分拣机器人拣选单元:控制视觉、抓力、输送节拍和放置精度首次出现在EVST。
Connecting the dots between visual art and literacy skills
资深英语教育家卡罗尔·贾戈 (Carol Jago) 表示,让学生解读视觉艺术可以增强阅读的分析和解释能力。
LensVLM: Selective Context Expansion for Compressed Visual Representation of Text
视觉语言模型 (VLM) 提供了将文本处理为渲染图像的令人兴奋的可能性,无需将文本标记为长标记序列。由于 VLM 图像编码器将固定大小的图像映射到固定数量的视觉标记,因此不同的渲染分辨率提供了细粒度的压缩旋钮。然而,随着压缩率的增加,准确性会迅速下降:字符缩小到低于视觉编码器的有效分辨率,使它们难以区分。为了解决这个问题,我们提出了 LensVLM,这是一个推理框架和训练后配方,使 VLM 能够扫描……
Hunting ecology predicts eye arrangements in the modular visual system of spiders
狩猎生态学预测蜘蛛模块化视觉系统中的眼睛排列摘要视觉是动物使用的最重要的感官之一,有助于基本行为,包括觅食、导航以及配偶检测和选择。 1 尽管人们对双眼位置和方向与双目环境下生态学的相关性了解很多,2 具有多部分视觉系统(两只以上眼睛)的动物仍然相对被忽视。蜘蛛是非常成功的掠食者,占据了一系列生态位,通常有八只眼睛。在这里,我们使用三维几何形态测量学和进化模型来测试眼睛位置、方向和眼间角度是否与蜘蛛系统发育中 52 个物种的狩猎策略相关。我们证明了眼睛结构的多样化,从现代活板门蜘蛛中看到的祖先内侧簇,到球织蜘蛛中的光环状结构,以及衍生蜘蛛谱系的几个成员的额部眼睛簇。我们发现视觉猎手的眼睛结构具
Vision Tracking Sorting Robot Cell: Close The Recognition, Pick, And Conveyor Loop
视觉跟踪分拣自动化实用指南,涵盖照明、相机定时、传送带速度、拾取窗口、放置逻辑和可追溯性。视觉跟踪分拣机器人单元:关闭识别、拾取和传送带循环首次出现在EVST。
How Outpost VFX Uses AWS to Accelerate AI Model Training for Visual Effects
在这篇文章中,我们将探讨 Outpost VFX 如何使用 AWS 基础设施将训练速度提高 8 倍,以转变其面部替换工作流程、他们为克服单 GPU 限制而实施的技术架构,以及通过 AWS 多 GPU 训练实现的可衡量结果。
Cobot Vision Inspection Loop: Stabilize Positioning Before Chasing Detection Rate
如何围绕零件定位、照明、相机触发、判断阈值、NG流和可追溯性规划协作机器人视觉检测环路。协作机器人视觉检测环路:在追赶检测率之前先稳定定位。
编者注:本文是 Into the Omniverse 的一部分,该系列文章重点介绍开发人员、3D 从业者和企业如何利用 OpenUSD 和 NVIDIA Omniverse 的最新进展来转变其工作流程。视觉人工智能代理正在成为一种实用的方法,可以自动将物理世界的视频数据转化为工厂的运营智能,[...]