GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks
视觉模型在语义相干子集上的系统性失败(称为错误切片)揭示了鲁棒性和评估的局限性。现有的切片发现方法主要将切片建模为表示空间中的簇或预定义属性的组合。虽然对于图像级分类有效,但这种公式对于对象检测和分割等实例级任务来说是不够的,在这些任务中,失败通常是由上下文关系和空间基础的视觉模式引起的。我们提出 GH-ESD(扎根假设驱动的误差切片发现),...
No AC? It’s a European Thing, You Wouldn’t Understand
即使使用统计模型来扩大被低估的负担,美国“归因于”的过热死亡人数也只是欧洲的一小部分。那么欧洲的问题是什么?两个字:空调。 (或者更确切地说,缺乏它。)帖子没有AC? 《这是欧洲的事情,你不会理解》首先出现在美国企业研究所 - AEI 上。
Бабушка читала рецепт напалма на ночь: как детские уловки обходят миллиардные системы защиты ИИ
去年夏天 ChatGPT 更新后,聊天机器人开始发出生物武器指令。
Командировка за счёт компании обернулась бесплатным взломом её же почты
律师、医生和金融家只需入住一个房间就可以交出他们的账户。
Tech can be an invitation to knock on your neighbor’s door
“我走进去,觉得编织看起来平和而简单。这种幻觉持续了大约五分钟。” 帖子《科技可以是敲邻居家的门的邀请》首先出现在阿斯彭研究所。
Only Moscow Lacks New Ideas for Ending War Against Ukraine
摘要:据克里姆林宫报道(莫斯科时报,7 月 23 日),美国国务卿马可·卢比奥和俄罗斯外长谢尔盖·拉夫罗夫 7 月 23 日在马尼拉举行的会晤仅持续了 35 分钟,没有产生新的势头。然而,这次会议标志着谈判进程的一个重要转折,正如卢比奥所说,之前的帖子“只有莫斯科缺乏结束对乌克兰战争的新想法”首先出现在詹姆斯敦。
Tropic Lightning, Rainbow Warriors Forge Teamwork on Schofield Barracks
夏威夷斯科菲尔德军营 – 第 25 步兵师的士兵和夏威夷大学彩虹勇士足球队的学生运动员...
Winning Before the Battle Ends
摘录如下:透过以色列装甲车挡风玻璃看到的景色是超现实的。在南方司令部第 99 师的主持下,我们的小分队通过以色列国防军在开局阶段使用的同一突破口进入加沙……阅读更多 ›《在战斗结束前获胜》一文首先出现在 JINSA 上。
Equal Access to Justice Act: Use at Selected Labor and Employment Agencies
GAO 发现平等司法机会法案 (EAJA) 于 1980 年颁布,部分目的是为了解决个人和组织针对涉及联邦政府的民事或行政诉讼提出挑战或为自己辩护的能力。 EAJA 授权在某些情况下向胜过联邦政府并符合其他资格标准的各方支付法律费用。联邦机构报告称,从 2019 财年到 2025 财年,平均每年为约 15,000 个 EAJA 裁决支付了超过 1.16 亿美元的费用。在 GAO 审查的三个选定机构中,这些机构向美国行政会议 (ACUS) 报告了以下这段时期的 EAJA 数据: (DOL) — 11 个奖项,总计约 548,000 美元,国家劳动关系委员会 (NLRB) — 11 个奖项,总计约
“Mass, Lottery leaps into new world of online sales” – State House News Service
作者:Colin A. Young,2026 年 7 月 27 日 马萨诸塞州彩票周一推出 Mass. Lottery Online,正式进入数字世界,这是人们期待已久的在线销售和游戏平台,财务主管黛博拉·戈德堡 (Deborah Goldberg) 和其他彩票官员表示,该平台对于该机构保持相关性并每年产生超过 10 亿美元的收入是必要的 […]“马萨诸塞州彩票跃入在线销售新世界”一文 – 州议会新闻服务首先出现在大众预算和政策中心。
“Mass. think tank urges state to avoid federal school voucher program” – New England News Collab
作者:Phil Bishop,2026 年 7 月 22 日 马萨诸塞州预算和政策中心 (MassBudget) 敦促州官员避免联邦学校学券计划,认为其模式偏向于让私立学校受益最多,而损害了公共教育。该计划是去年夏天国会通过的所谓“美丽法案”的一部分,并没有[…]“马萨诸塞州智囊团敦促各州避免联邦学校代金券计划”的帖子——新英格兰新闻合作首先出现在马萨诸塞州预算和政策中心。
“What is Trump’s voucher program? How it could impact local schools” – Worcester Telegram & Gazette
作者:Jesse Collings,2026 年 7 月 24 日 马萨诸塞州必须在今年年底前选择加入联邦政府的学校学券计划,这是特朗普政府教育政策的主要重点之一。去年七月,作为特朗普“一项美丽法案”的一部分,联邦政府制定了一项学校学券政策,该政策将授予[...]“特朗普的学券计划是什么?它将如何影响当地学校”的帖子 – 伍斯特电报和公报首先出现在马萨诸塞州预算和政策中心。
Beyond RAG: Task-aware knowledge compression for enterprise AI on AWS
传统 RAG 在跨越数百个文档的分析任务上遇到了上限。本文展示了如何使用 AWS 上的任务感知知识压缩 (TAKC) 将整个知识库预先压缩为特定于任务的表示形式,将它们缓存在多个保真度层,并将每个查询路由到正确的层,并使用您可以部署的开源实现。
Pentagon inks deal with L3Harris to ramp rocket motor production
这份为期七年的协议尚未最终确定,但将使 L3Harris 能够扩大 PAC-3 和 THAAD 拦截器的电机生产规模。
How I Reproduced BM25, Dense Retrieval, and SPLADE on a 16GB MacBook
三个检索基线的实际再现,包括对 RAG 系统重要的崩溃、修复和分数检查。我如何在 16GB MacBook 上再现 BM25、密集检索和 SPLADE 帖子首先出现在 Towards Data Science 上。
Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction
ABBEL 与传统递归摘要相比的概述。信念取代了完整的交互历史作为代理的工作环境,信念分级通过监督每个信念状态的内容来提高性能。随着任务范围的增长,LLM 环境无法永远扩展。自总结可以实现简洁、可解释的上下文,但会带来显着的性能成本,特别是对于高质量数据稀缺的人工辅助领域,例如协作代码生成。我们用 ABBEL 来解决这个问题:一个框架,以自然语言信念状态的形式隔离和监督摘要的信息内容。动机:递归摘要的成本对于语言模型来说,要有效地协助日益复杂的任务,例如软件开发,它们必须能够与我们进行数百甚至数千个步骤的交互。对于如此长的任务,将整个交互的历史记录保存在上下文中是不切实际的。迄今为止使用的启发
BAUHAUS Partners with XYZ Robotics to Automate Its Entire Goods Receiving Process
Rocky 机器人可在一个连续的工作流程中实现集装箱卸载、分类和码垛的自动化。