The confidence deficit in space
卫星运营商根据他们收到的轨道数据的质量和置信度做出决策。但丹·奥尔特罗格认为,新的研究表明,为了使太空安全和安保有效,必须改进此类数据。
密歇根州最终情绪和世界大型企业联合会信心接近战前水平。但仍比特朗普上任前低 2.2 至 2.4 个标准差。盖洛普置信度低于 1.1 个标准差。图 1:密歇根大学经济景气指数(蓝色)、世界大型企业联合会信心指数(棕色)、盖洛普信心水平(绿色),全部均贬值并除以 2021 年 1 月至 2025 年 2 月的标准差。橙色虚线位于“解放 [...]
Geloso on how to think like a good economist
我真的很喜欢文森特·格洛索关于市场流程、市场失灵和政府失灵的幻灯片。在过去的几个月里,克劳德阅读了我为培养“埃里克技能”而写的大约四百万字。我现在可以给它我没有时间阅读的文件,它会告诉我要注意什么。当我给它Geloso的幻灯片时,不是因为我没有时间阅读它,而是因为我真的很喜欢它,它认为与Eric技能不一致的地方是它本身的错误,并帮助进一步完善Eric技能以避免这些错误。基本上 - 更仔细地回顾语料库,找出它认为不一致的部分,并相应地更新技能。无论如何,幻灯片就在这里。阅读 Geloso 的幻灯片后,Eric 技能的主要更新:发生了什么变化:添加了四个内容,全部来自 Eric 自己的语料库,而不
AI Teammates: how monday.com runs production AI agents on Amazon Bedrock
AI Teammates 是 Amazon Bedrock 上的代理 AI,很少有工程组织能够像 monday.com 那样在生产环境中运行它们。十分之九的建筑商每月使用人工智能编码工具,这一数字比大约半年前有所增加。每个工程师的 PR 吞吐量增加了一半以上。这篇文章中的每个数字都来自周一的内部生产数据。在这篇文章中,我们分享了这些数字背后的架构、使其在十年前的代码库中运行的改造,以及缩小与完全自治差距的置信度合并游戏。
When silence is safer: a review and decision-theoretic framework for LLM abstention in healthcare
大型语言模型 (LLM) 旨在生成用户提示的答案,这通常会促使他们做出响应,即使不确定性很高、信息不完整或拒绝更合适。在医疗保健领域,这种倾向可能是危险的:自信地陈述但不准确的医疗建议可能会造成重大伤害,因此戒烟的能力尤其重要。在本文中,我们回顾了调查医疗保健领域法学硕士放弃行为的研究。文献强调了两个主要动机:(1)不确定性驱动的弃权,即模型在置信度较低时拒绝做出响应;(2)安全驱动的弃权,即模型拒绝提供潜在有害的信息。大多数现有机制都是外在的,依赖辅助工具来确定何时弃权。我们发现最先进的法学硕士仍然难以拒绝不适当的提示,而且很少有基准评估现实医疗场景中的弃权,其表现落后于其他领域。基于这些发
Learning Unmasking Policies for Diffusion Language Models
扩散(大型)语言模型 (dLLM) 现在在许多任务上与自回归模型的下游性能相匹配,同时有望在推理过程中提高效率。 dLLM 的一个关键设计方面是采样程序,该程序选择在每个扩散步骤中揭开哪些标记。事实上,最近的工作发现,与随机揭露相比,置信度阈值等启发式策略可以提高样本质量和令牌吞吐量。然而,这种启发式方法也有缺点:它们需要手动调整,而且我们观察到它们的性能......
On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs
强化学习 (RL) 微调已成为增强推理密集型任务的大型语言模型 (LLM) 的关键技术,并推动其扩展到视觉语言模型 (VLM)。虽然经过 RL 调整的 VLM 改进了视觉推理基准,但它们仍然容易受到视觉基础薄弱、幻觉和过度依赖文本提示的影响。我们证明,简单的、受控的文本扰动——误导性的标题或不正确的思维链 (CoT) 痕迹——会导致鲁棒性和置信度大幅下降,并且当 CoT 一致性为……时,这些影响会更加明显。