Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling
Token作为现代自回归模型的基本计算单位,生成长度直接影响推理成本和推理性能。尽管它很重要,但现有方法缺乏细粒度的长度建模,主要在粗粒度的序列级别上运行。在本文中,我们介绍了长度值模型(LenVM),这是一个令牌级框架,用于对每个解码步骤的剩余生成长度进行建模。通过将长度建模表述为价值估计问题,并为每个生成的代币分配恒定的负奖励,LenVM…
Clawing My Way into Comprehension (of the Token Tsunami, That Is)
我应该尝试建立一个硅电子参谋长吗?餐厅边桌下的笔记。当我考虑尝试看看所谓的“代理......”时,第一次失败和第二次大脑
Один забытый токен Salesforce — и хакеры разом вскрыли десяток крупнейших компаний
Huntress、Recorded Future、Tanium、Jamf - 受害者名单还在不断增加......
Credentials should never reach the model
凭证永远不应到达模型 工程师将代理连接到支付 API。代理需要 API 令牌,因此令牌位于令牌通常所在的位置:环境变量、配置文件或直接进入提示符。客服人员会阅读并拨打电话。有用。它还刚刚放置了...帖子 Credentials should neverreach the model 首先出现在 DataRobot 上。
Long Context Isn’t Free — I Built a Safe Prompt-Pruning Layer That Makes LLM Systems Work
法学硕士不会因为忘记而失败,而是因为记得太多而失败。随着对话的增长,提示会积累冗余和低价值的令牌,从而增加成本和延迟,同时默默地降低输出质量。本文介绍了一个确定性的提示修剪层,它可以在不破坏依赖关系的情况下减少令牌的使用,并由真正的基准测试和经过生产测试的设计提供支持。 文章《长上下文不是免费的——我构建了一个使 LLM 系统工作的安全提示修剪层》首先出现在《走向数据科学》上。
Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why
在策略蒸馏为训练推理模型提供密集的、按令牌的监督;然而,目前尚不清楚该信号在哪些条件下有益,在哪些条件下有害。应该采用哪种教师模式,在自我蒸馏的情况下,应该以哪种具体情境作为监督信号?不同代币的最佳选择是否有所不同?目前,解决这些问题通常需要昂贵的训练运行,其总体性能指标掩盖了单个代币级别的动态。我们推出了免培训...
Path-Constrained Mixture-of-Experts
稀疏专家混合 (MoE) 架构通过每层的专家子集独立路由每个令牌。我们建议通过专家路径的视角来看待 MoE 计算——令牌在所有层上进行的专家选择序列。这种观点表明,尽管 N 个专家跨 L 层有 N^L 条可能的路径,但实践中的标记会聚集成一小部分与语言功能一致的路径,但绝大多数路径仍未被探索,这代表了统计上的低效率。这激发了限制有效路径空间的架构……
TopoPrimer: The Missing Topological Context in Forecasting Models
我们引入了 TopoPrimer,一个框架,使序列总体的全局拓扑结构成为任何预测模型的显式输入。 TopoPrimer 提高了不同领域的准确性,稳定了季节性需求高峰下的预测,并缩小了冷启动差距。 TopoPrimer 通过持久同源性和谱束坐标对每个域进行一次预计算,将每个令牌部署为经过充分训练的模型,并作为预训练主干的轻量级适配器。在这两个组件中,层坐标是主要的精度驱动因素。跨越 Chronos 的四个公共基准和……
VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization
视觉分词器将高维原始像素映射为下游建模的压缩表示。除了压缩之外,标记器还决定保留哪些信息以及如何组织信息。视频标记化事实上的标准方法是将视频表示为标记的时空 3D 网格,每个标记捕获原始信号中相应的局部信息。这需要使用令牌的下游模型(例如文本到视频模型)学习“逐像素”预测所有低级细节,而不考虑视频固有的复杂性,从而导致......
Residual Context Diffusion Language Models
扩散大型语言模型 (dLLM) 已成为纯自回归语言模型的有前途的替代方案,因为它们可以并行解码多个标记。然而,最先进的分块 dLLM 依赖于“重新屏蔽”机制,该机制仅解码最有信心的令牌并丢弃其余令牌,从而有效地浪费了计算。我们证明,从丢弃的令牌中回收计算是有益的,因为这些令牌保留了对后续解码迭代有用的上下文信息。有鉴于此,我们提出了残余上下文扩散(RCD),该模块......
Learning Unmasking Policies for Diffusion Language Models
扩散(大型)语言模型 (dLLM) 现在在许多任务上与自回归模型的下游性能相匹配,同时有望在推理过程中提高效率。 dLLM 的一个关键设计方面是采样程序,该程序选择在每个扩散步骤中揭开哪些标记。事实上,最近的工作发现,与随机揭露相比,置信度阈值等启发式策略可以提高样本质量和令牌吞吐量。然而,这种启发式方法也有缺点:它们需要手动调整,而且我们观察到它们的性能......
Conformal Thinking: Risk Control for Reasoning on a Compute Budget
推理大型语言模型 (LLM) 可实现测试时间扩展,随着令牌预算的增加,数据集级别的准确性也会提高,从而激励自适应推理——在可靠性提高时使用令牌,并在额外计算不太可能有帮助时提前停止。然而,设置代币预算以及自适应推理的阈值是一项实际挑战,需要进行基本的风险与准确性权衡。我们将预算设置问题重新定义为风险控制,限制错误率,同时最大限度地减少计算量。我们的框架引入了一个上限,可以阻止......
5 AI Coding Subscription Plans That Give Developers the Best Value
这是对人工智能编码订阅计划的基于意见的看法,我认为它为开发人员提供了最佳的资金价值,从基于令牌和使用的计划到完整的编码代理生态系统。