码器关键词检索结果

解码器重播:好围栏真的能造就好邻居吗?

Decoder Replay: Do good fences really make good neighbors?

虽然俄罗斯和乌克兰因共同边界而发生战争,但其他国家表明,边界可以在不发生武装冲突的情况下拆除或改变。

一层就足够了:采用预训练的视觉编码器进行图像生成

One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation

视觉生成模型(例如扩散模型)通常在压缩的潜在空间中运行,以平衡训练效率和样本质量。与此同时,人们对利用高质量的预训练视觉表示越来越感兴趣——无论是在 VAE 内对齐它们还是直接在生成模型内对齐它们。然而,由于面向理解的特征和生成友好的潜在空间之间的根本不匹配,适应这种表示仍然具有挑战性。表示编码器受益于高维潜伏,捕捉不同的假设......

解码器重播:绘制你自己的未来地图

Decoder Replay: Draw your own map to the future

技术和环境变化发生得如此之快,我们无法想象五年后的世界,更不用说 50 年后的世界了。那么如何为未知做好最好的准备呢?

自动编码器和潜在空间的简要介绍

A Gentle Introduction to Autoencoders & Latent Space

简介 繁重计算是当今各种机器学习算法中的一个众所周知的问题,特别是当生成式人工智能应用于文本、图像和其他非结构化数据时。缓解此问题的主要方法之一是将输入数据压缩为低维表示,同时保留主要上下文。有多种方法可以实现这一目标[...]自动编码器和潜在空间的温和介绍一文首先出现在走向数据科学上。

解码器重播:通过医疗援助产生全球影响力

Decoder Replay: Global influence through medical aid

当一个国家为医疗用品和医生提供国际援助时,它就可以赢得世界各地的盟友。拒绝援助会激起怨恨。

解码器:停火不是和平条约

Decoder: A cease-fire is not a peace treaty

乌克兰和中东战争宣布停火后,炸弹飞来。这些公告是真正迈向和平的一步还是只是一种干扰?

解码器重播:庆祝还是诋毁?

Decoder Replay: To celebrate or denigrate?

我们如何看待世界取决于我们所接受的真实历史。但那个版本的过去依赖于基于部分事实的故事。

解码器重播:任何首相都能长期取悦英国选民吗?

Decoder Replay: Can any PM please British voters for long?

随着英国首相的辞职,我们回顾上一次政府更迭,以了解英国公众对其领导人的期望。

解码器:把沙漠变绿需要的不仅仅是金钱

Decoder: Turning a desert green takes more than money

8,000 公里长的非洲绿化倡议让捐助者兴奋不已。但它的成功取决于愿意与自然合作的农民的汗水和耐心。

解码器重播:为什么禁止社交媒体?

Decoder Replay: Why ban social media?

世界各国政府正在通过法律限制社交媒体的使用。让我们来解决一些疑虑。

推出适用于紧凑型机器人和运动控制应用的新型细长空心轴编码器

Introducing the New Slim Hollow Shaft Encoder for Compact Robotics and Motion Control Applications

新型 IH520 系列是一款纤薄的增量式空心轴编码器,旨在为空间有限且需要连续运行的紧凑型机器人和运动控制应用提供精确的运动反馈。该编码器具有低轴向轮廓、法兰安装和空心轴设计,易于安装。

C++ 即将退役。 Chrome 切换到 Rust 以摆脱旧漏洞

C++ отправляют на заслуженный отдых. Chrome переходит на Rust для спасения от старых дыр

Chromium 创建了一个通用架构来逐步将图像解码器过渡到 Rust。

使用混合文本和 ID 嵌入个性化增量视频搜索

Personalizing Incremental Video Search with Hybrid Text and ID Embeddings

增量视频搜索需要在每次击键后进行高质量排名,而意图通常不明确(例如,1-3 个字符前缀)。我们提出了一个 Apple TV 搜索的个性化系统,该系统在排名时结合了互补的语义和协作信号。我们的方法学习两个项目嵌入空间:(i) 基于文本的多语言编码器 (TextEmb),通过对比学习对共同参与三元组进行微调;(ii) 基于 ID 的协作嵌入模型 (IdEmb),根据交互衍生的积极因素进行训练。在服务时,我们从…构建用户表示

Apple Music 搜索的多语言语义检索

Multilingual Semantic Retrieval for Apple Music Search

Apple Music 以数十种语言为 150 多个店面的听众提供服务,其目录每天都会增加数十万首新曲目。在这种规模下,拼写错误、音译和跨语言查询的搜索召回成为会话质量的主要驱动因素,特别是对于占唯一查询大部分的尾部查询。我们提出了一个基于 305M 参数暹罗双编码器的多语言语义检索系统,该编码器根据 GTE 多语言基础进行了微调,并具有课程安排的多目标训练。该模型通过...集成到搜索堆栈中

使用长形式声学编码的分段注意力解码

Segmental Attention Decoding with Long Form Acoustic Encodings

我们解决了基于注意力的编码器-解码器(AED)模型与长形式声学编码的根本不兼容问题。在分段话语上训练的 AED 模型通过利用片段边界之外的有限声学上下文来学习对绝对帧位置进行编码,但在解码这些线索消失的长片段时无法泛化。由于交叉注意力中键和值的排列不变性,该模型失去了对声学编码进行排序的能力。我们提出了四种修改:(1)将显式绝对位置编码注入每个解码的交叉注意力中......

LensVLM:用于文本压缩视觉表示的选择性上下文扩展

LensVLM: Selective Context Expansion for Compressed Visual Representation of Text

视觉语言模型 (VLM) 提供了将文本处理为渲染图像的令人兴奋的可能性,无需将文本标记为长标记序列。由于 VLM 图像编码器将固定大小的图像映射到固定数量的视觉标记,因此不同的渲染分辨率提供了细粒度的压缩旋钮。然而,随着压缩率的增加,准确性会迅速下降:字符缩小到低于视觉编码器的有效分辨率,使它们难以区分。为了解决这个问题,我们提出了 LensVLM,这是一个推理框架和训练后配方,使 VLM 能够扫描……

时间序列法学硕士,用 t0-alpha 解释

Time-Series LLMs, Explained with t0-alpha

t0-alpha 是用于概率时间序列预测的解码器式补丁转换器。原始序列被分成 32 步补丁,嵌入,通过因果时间注意力和群体注意力层进行处理,并解码为未来分位数而不是单点预测。后时间序列法学硕士,用 t0-alpha 解释首先出现在《走向数据科学》上。