本文在 2026 年国际可用性、可靠性和安全性会议 (ARES) 的 AI4TCI(安全可信关键基础设施系统人工智能研讨会)研讨会上被接受。自主谈判代理越来越多地部署在保险和采购等高风险环境中。虽然加密技术可以保护明确披露的约束值,但它们无法解决更微妙的威胁:行为隐私泄露,对手从可观察的谈判动态(例如让步轨迹、时间安排和……)中推断出私人约束。
本文研究了美国限制外国工人通过 H-2B 签证从事低技能非农业工作的经济影响。雇用 H-2B 员工的主要行业包括场地维护、酒店、建筑、林业和海鲜包装。美国雇主获得此签证的机会受到联邦政府配额的限制,并部分通过随机抽签分配。作者发现,通过抽签可以雇用更多 H-2B 员工从事低技能工作的公司可以增加其产量、投资和利润。 H-2B 招聘对美国就业的影响为零或……
NASA 的双火星探测器“勇气号”和“机遇号”的使用寿命均为 90 天。机遇号靠清洁太阳能电池板的火星风维持生命,其中一艘行驶了 6 年,另一艘行驶了近 15 年,直到一场全球范围的沙尘暴使机遇号沉寂下来,机遇号的最后一条信息是:“我的电池电量低了,天色即将变暗。”美国宇航局的双火星探测器勇气号和机遇号的建造寿命分别为 90 天,但其中一艘在火星表面行驶了 6 年,另一艘则行驶了近 15 天——靠随机清洁其太阳能电池板的火星风维持了生命。 ——直到一场席卷全球的沙尘暴最终让机遇号沉寂下来,它的最后一条信息是:“我的电池电量低了,天色即将变暗。”首次出现于19FortyFive。
Randomness and representativeness are NOT the same
在研究和日常推理中,随机和代表性这两个术语经常互换使用。许多人认为,如果随机选择一个样本,它就会自动反映更广泛的总体,反之,代表性样本一定是随机选择的。然而,这是一个误解。随机性和代表性是两个根本不同的[...]
What does randomisation guarantee? Nothing!
人们常说,进行随机实验的目的是让研究人员能够根据观察到的相关性做出更强的因果推论。这一主张基于这样的想法:随机化减少了治疗组和对照组之间的系统差异,从而限制了混杂因素的影响。这种相当简单的观点的问题是 [...]
Context Engineering Isn’t Enough — A Loop Engineering Experiment With No LLM Inside the Loop
每个人都在谈论循环工程,但大多数讨论都假设法学硕士位于循环的中心。我想隔离架构本身。因此,我构建了一个确定性的、零依赖的 Python 基准测试,用简单的规则替换模型,使我能够直接衡量一个问题:目标导向控制器能否比传统线性管道更好地隔离故障?在验证了 300 个随机种子的基准测试并修复了一个最初使我自己的结果无效的微妙错误之后,我发现控制器始终完成了线性执行器从未达到的独立分支。本文介绍了架构、基准测试设计、调试过程以及一个狭隘但实用的主张背后的证据:故障隔离是控制流的一个可测量属性,与 LLM 推理无关。后语境工程还不够——循环内没有 LLM 的循环工程实验首先出现在《走向数据科学》上。
Social calibration of sycophantic AI | Science
在他们的研究文章“阿谀奉承的人工智能会降低亲社会意图并促进依赖性”(3 月 26 日,10.1126/science.aec8352)中,M. Cheng 等人。表明人工智能(AI)系统比人类更有可能在有争议的场景中支持用户的立场。随机实验设计表明,接触此类肯定反应会降低用户在人际冲突中采取亲社会纠正行动的意愿,并增加对人工智能系统的信任和依赖。这些发现在模型对齐策略和下游人类行为之间建立了因果联系,凸显了人工智能对齐核心的紧张关系:针对用户满意度进行优化可能会系统性地使模型偏向于达成一致,即使分歧可以更好地服务于用户的长期利益或社会结果。阿谀奉承不仅是一种失败模式,而且是源自用户偏好的强化信
Mathematicians are closing in on the hidden order inside chaos
一项新的突破突破了随机性的极限,使数十年之久的数学之谜更接近解决
Don't let an AI chatbot pick your password, ever
人工智能生成的密码真的是随机的吗?研究表明人工智能密码远没有你想象的那么安全。
Teachers save time with AI. Their students may pay the price
人工智能经常被宣传为提高教师效率的一种方式,可以帮助教师编写课程计划、生成课堂材料并在几秒钟内向学生提供反馈。但在真实教室中测试人工智能的首批随机试验之一发现,它也会破坏学习。教师有权访问的学生 […]教师通过 AI 节省时间。他们的学生可能要付出最先出现在《赫金格报告》上的代价。
What is this thing called probability?
现代概率计量经济学依赖于概率的概念。为了完全服从计量经济分析,经济观察据称必须被视为随机事件。但是,真的有必要将经济系统建模为一个只有基于先验概率概念才能分析和理解随机性的系统吗? [...]
美国趋势小组调查方法概述 本报告中的数据来自美国趋势小组 (ATP) 第 181 波,该小组是皮尤研究中心随机选择的美国成年人的全国代表性小组。该调查于2025年10月6日至10月16日进行。在12,845名样本中,共有8,046名小组成员做出了回应,[...]
奇怪的是光我想要那张桌子,我一开始就这么说。你不会在封面上看到这张桌子,有一个游戏骰子和四辆车,尽管只有其中一辆开过所有重要事件发生的地方,但这张桌子是莎拉·玛丽·格里芬整本书的催化剂,是在推出各种代理时发生的一切的关键。汉克·坎贝尔,蒙, 06/22/2026 - 12:22类别随机想法
墙也是路跳过术语表。是的,这是编辑们喜欢的事情,因为著名的沟通指南“假设缺乏词汇,但不缺乏智力”,但那是当你为广大公众写作时。科幻小说读者很聪明。Hank CampbellMon, 06/29/2026 - 09:00类别随机想法
NotebookLM: Your New AI Teaching Assistant
帖子 NotebookLM:您的新 AI 教学助理首先出现在 Shake Up Learning 上。如果您听说过 NotebookLM,但还没有真正坐下来弄清楚它的用途,那么这个会议值得观看。 Ashley Shanley 详细介绍了如何将其用作闭环人工智能研究和内容工具,该工具仅从您上传的文档中提取数据,这意味着没有幻觉,没有随机的互联网结果,继续阅读后 NotebookLM:您的新人工智能教学助理首先出现在 Shake Up Learning 上。
Man Admits to Stabbing Fellow Passenger With Homemade Shank on Alaska Airlines Flight to Las Vegas
一名男子承认在阿拉斯加航空飞往拉斯维加斯的航班上使用自制武器随机袭击一名乘客。
Learning Unmasking Policies for Diffusion Language Models
扩散(大型)语言模型 (dLLM) 现在在许多任务上与自回归模型的下游性能相匹配,同时有望在推理过程中提高效率。 dLLM 的一个关键设计方面是采样程序,该程序选择在每个扩散步骤中揭开哪些标记。事实上,最近的工作发现,与随机揭露相比,置信度阈值等启发式策略可以提高样本质量和令牌吞吐量。然而,这种启发式方法也有缺点:它们需要手动调整,而且我们观察到它们的性能......
LLMs are stuck in a groupthink groove. This startup is trying to get them out.
让我们从一个游戏开始吧。打开您选择的聊天机器人 - Claude、ChatGPT、Gemini - 并输入“给我一个 1 到 10 之间的随机数”。你会得到 7。几乎总是如此。现在输入“Another”,您将得到 3 或 4。再次输入“Another”,您将得到 8 或 9。这并不是每次都有效,但如果...