编码器关键词检索结果

一层就足够了:采用预训练的视觉编码器进行图像生成

One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation

视觉生成模型(例如扩散模型)通常在压缩的潜在空间中运行,以平衡训练效率和样本质量。与此同时,人们对利用高质量的预训练视觉表示越来越感兴趣——无论是在 VAE 内对齐它们还是直接在生成模型内对齐它们。然而,由于面向理解的特征和生成友好的潜在空间之间的根本不匹配,适应这种表示仍然具有挑战性。表示编码器受益于高维潜伏,捕捉不同的假设......

自动编码器和潜在空间的简要介绍

A Gentle Introduction to Autoencoders & Latent Space

简介 繁重计算是当今各种机器学习算法中的一个众所周知的问题,特别是当生成式人工智能应用于文本、图像和其他非结构化数据时。缓解此问题的主要方法之一是将输入数据压缩为低维表示,同时保留主要上下文。有多种方法可以实现这一目标[...]自动编码器和潜在空间的温和介绍一文首先出现在走向数据科学上。

推出适用于紧凑型机器人和运动控制应用的新型细长空心轴编码器

Introducing the New Slim Hollow Shaft Encoder for Compact Robotics and Motion Control Applications

新型 IH520 系列是一款纤薄的增量式空心轴编码器,旨在为空间有限且需要连续运行的紧凑型机器人和运动控制应用提供精确的运动反馈。该编码器具有低轴向轮廓、法兰安装和空心轴设计,易于安装。

使用混合文本和 ID 嵌入个性化增量视频搜索

Personalizing Incremental Video Search with Hybrid Text and ID Embeddings

增量视频搜索需要在每次击键后进行高质量排名,而意图通常不明确(例如,1-3 个字符前缀)。我们提出了一个 Apple TV 搜索的个性化系统,该系统在排名时结合了互补的语义和协作信号。我们的方法学习两个项目嵌入空间:(i) 基于文本的多语言编码器 (TextEmb),通过对比学习对共同参与三元组进行微调;(ii) 基于 ID 的协作嵌入模型 (IdEmb),根据交互衍生的积极因素进行训练。在服务时,我们从…构建用户表示

Apple Music 搜索的多语言语义检索

Multilingual Semantic Retrieval for Apple Music Search

Apple Music 以数十种语言为 150 多个店面的听众提供服务,其目录每天都会增加数十万首新曲目。在这种规模下,拼写错误、音译和跨语言查询的搜索召回成为会话质量的主要驱动因素,特别是对于占唯一查询大部分的尾部查询。我们提出了一个基于 305M 参数暹罗双编码器的多语言语义检索系统,该编码器根据 GTE 多语言基础进行了微调,并具有课程安排的多目标训练。该模型通过...集成到搜索堆栈中

使用长形式声学编码的分段注意力解码

Segmental Attention Decoding with Long Form Acoustic Encodings

我们解决了基于注意力的编码器-解码器(AED)模型与长形式声学编码的根本不兼容问题。在分段话语上训练的 AED 模型通过利用片段边界之外的有限声学上下文来学习对绝对帧位置进行编码,但在解码这些线索消失的长片段时无法泛化。由于交叉注意力中键和值的排列不变性,该模型失去了对声学编码进行排序的能力。我们提出了四种修改:(1)将显式绝对位置编码注入每个解码的交叉注意力中......

LensVLM:用于文本压缩视觉表示的选择性上下文扩展

LensVLM: Selective Context Expansion for Compressed Visual Representation of Text

视觉语言模型 (VLM) 提供了将文本处理为渲染图像的令人兴奋的可能性,无需将文本标记为长标记序列。由于 VLM 图像编码器将固定大小的图像映射到固定数量的视觉标记,因此不同的渲染分辨率提供了细粒度的压缩旋钮。然而,随着压缩率的增加,准确性会迅速下降:字符缩小到低于视觉编码器的有效分辨率,使它们难以区分。为了解决这个问题,我们提出了 LensVLM,这是一个推理框架和训练后配方,使 VLM 能够扫描……