GovScape lets you easily search millions of government documents
华盛顿大学领导的研究团队创建了 GovScape,这是一个高效的期末网络档案 PDF 搜索系统。用户可以查找确切的关键字,例如“FAFSA”,或者使用语义搜索,即使页面上没有出现确切的搜索词,也可以查找有关某个主题的文档。由于研究人员使用了高效的人工智能模型,处理唐纳德·特朗普第一个任期期间在线托管的 1000 万份 PDF 的成本不到 1,500 美元,即每 47,000 页约 1 美元。
Machine Learning Rediscovers Equations Governing Ocean Biogeochemistry
研究人员使用一种称为符号回归的过程从海洋生物地球化学模型中推导出方程。
Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels
法学硕士评委小组汇总来自多个模型的投票,期望不同的模型能产生更可靠的评估。我们开发了一个框架来衡量此类小组的真实信息价值,并量化其可靠性与独立投票理想的差距有多大。在三个自然语言推理数据集(每个项目有 100 个人类注释)上测试来自 7 个模型系列的 9 名前沿法学硕士小组,我们发现 9 名评委实际上只提供了大约 2 个独立投票的信息。大约四分之三的专家组名义上的独立性......
Metric-Dependent Annotation Saturation for Learning from Label Distributions
当注释者对某个标签存在分歧时,分歧本身就带有信号,而捕获该信号所需的注释者数量取决于评估指标。我们根据从 ChaosNLI(一个为每个项目提供 100 个独立注释器判断的数据集)二次采样的标签分布来微调 NLI 模型,并识别与度量相关的饱和度。在我们的 3 类 NLI 设置中,熵相关性(模型是否识别哪些项目引起分歧)需要 N ≈ 20-50 个注释器才能收敛,而分布匹配(KL 散度)则达到 N ≈ 10 饱和(五个模型的改进为 87-95%……
5 Essential Approaches to Robust Outlier Detection
异常值很容易破坏您构建的任何预测分析模型的性能:稳健地检测和处理它们对于任何数据项目都至关重要。本文列出并比较了检测它们的五种基本方法。
AI brings object-level vision prosthetics closer to reality
图片来源:杰夫·达尔 (Jeff Dahl) – 上传者自己的作品,基于公共领域文档:[1],CC BY-SA 3.0,斯蒂芬妮·帕克 (Stephanie Parker) 链接这项研究来自马丁·施林普夫 (Martin Schrimpf) 的 NeuroAI 实验室(隶属于 EPFL 计算机与通信科学和生命科学学院),使用人工智能模型来准确预测在何处刺激 [...]
Inclusion without a structural lens just reproduces exclusion
由于大学依靠披露模型和赤字框架来解决奖励差距,艾玛·冈特 (Emma Gaunt) 认为种族主义和体能歧视并不是对系统的扭曲 - 它们是内置的
Building Explainable AI with Beth Rudden - CEO at Bast AI
本周,Trending in Ed 节目的主持人 Mike Palmer 与 Trending in Ed 全明星、Bast AI 首席执行官 Beth Rudden 一起参与节目。从作为一名考古学家在泥土中挖掘,到作为 IBM Managed Services 首席数据官管理一个价值 340 亿美元的部门,Beth 为人工智能对话带来了根深蒂固的技术视角。在这场内容广泛且富有洞察力的对话中,迈克和贝丝跳过了典型的人工智能炒作,探索构建可解释的、值得信赖的技术实际上需要什么。 Beth 分享了 Bast AI 如何充当与 LLM 无关的可解释层 - 使用独特的饮用巧克力类比来演示他们如何验证
Русский спам и мат заполонили AUR-ресурс Arch Linux
对存储库的攻击影响了使用 Python 和 Llama 语言模型的脚本。
Building pay-per-intelligence for AI agents: How Ampersend uses Amazon Bedrock AgentCore Payments
在本文中,您将了解 Ampersend 如何在 Amazon Bedrock AgentCore Payments 之上构建按智能付费的路由层。人工智能代理自动将任务路由到最有效的模型,按请求付费,并在支出预算内运行。您还将了解两跳支付模式如何端到端工作以及如何开始您自己的实施。
Embed the world: Multimodal AI for searchable aerial imagery at scale
在这篇文章中,我们将介绍问题空间、我们在 Amazon Bedrock 和 Amazon OpenSearch Serverless 上的架构、我们在 OpenStreetMap 基础事实上构建的评估方法、比较嵌入模型、融合策略、字幕和搜索方法的四个实验,以及构建类似系统时可以应用的实用指南。您将了解哪些设计选择推动了地理空间语义搜索,包括为什么 Amazon Nova Multimodal Embeddings 在我们的评估中的两个基准查询中提供了最高的 F1 分数。这里描述的工作演变成 Vexcel Intelligence,一种可搜索的图像产品。
Three things to watch amid Anthropic’s latest feud with the government
这个故事最初出现在我们关于人工智能的每周通讯《算法》中。要首先在您的收件箱中收到此类故事,请在此处注册。对于那些正在享受夏天而不知道 Anthropic 与美国政府最近不和的人来说,这里有一个回顾:四月份该公司表示它已经建立了一个名为 Mythos 的人工智能模型......
The Legal AI Scaffold Changes Everything – Claude Study
咨询公司 Legal Nodes(其中包括 MikeOSS)的一项研究表明,无论通用模型看起来有多好,它都是合法的人工智能......
What Is Physical AI? How AI Moves From Chatbots to Robots
人工智能近年来取得了令人瞩目的进步。大型语言模型可以回答问题、生成代码、撰写文章以及进行复杂的对话。然而,大多数人工智能系统仍然完全存在于数字世界中,仅通过屏幕和网络处理信息、生成输出和交互。物理人工智能代表着下一个前沿领域。而不是简单地 [...]
Automate 2026 上的现场演示展示了该集成,其中包括由 NVIDIA Isaac 开放机器人平台提供支持的 Vention 快速操作员 AI,以及由 Universal Robots 的 UR12e 和 UR20 协作机器人模型支持的高级焊接应用。
A Good Article About the AMOC, Just in Time for the El Niño
这就是我们现在的位置。厄尔尼诺现象将会到来,温度将会飙升,AMOC 濒临崩溃的故事也将随之飙升,因为创纪录的热度年份是该类型销量最好的时候。塌陷预测将导致统计估计器无法区分真实信号和噪音,并且模型运行需要的融水量超过了格陵兰岛所能提供的量,并且他们将忽略二十年来的系泊系统,显示出一个剧烈摆动且趋势温和的系统,并且拒绝被测量者称为关闭。然后,过了一会儿,读数将报告另一次摆动,有人会悄悄地提取一条平滑线,并且重新评估将像往常一样跟随警报进行。一篇关于 AMOC 的好文章,正好赶上了厄尔尼诺现象,首先出现在 Watts Up With That? 上。
A Decade-Long Physics Mystery May Finally Be Solved
研究人员精确测量了质子的尺寸,解决了质子半径难题,增强了对粒子物理标准模型的信心。氢是宇宙中最简单的元素,也是元素周期表中的第一个元素。每个氢原子的原子核中仅包含一个质子和一个绕其运行的电子。因为 [...]