Building a Foundation Stack for General-Purpose Robots
本文由 X Square Robot 为您带来。大型语言模型为人工智能提供了可行的方案。在广泛的数据上预训练大型模型,一般能力随之而来。机器人技术没有这样的秘诀。机器人系统长期以来都是由单独的感知、规划和控制部件组装而成,这些部件很少能增加机器人可以从一项任务转移到另一项任务,或从一台机器转移到另一台机器的智能。实体人工智能的核心问题是找到等效的配方,而该领域尚未就它是什么达成一致。X Square Robot,一家中国实体人工智能公司,下了一个异常明确的赌注。它认为,配方是一个集成堆栈,涵盖机器人学习的数据、预测物理世界变化的世界模型,以及将感知、规划、推理和决策结合在一起以生成可执行机器人
Scientists Just Challenged a 70-Year-Old Myth About the Human Brain
一项新的研究挑战了人们熟悉的观点,即大脑是通过在原始情感系统之上堆叠理性系统而进化的。无数的选择背后隐藏着一个熟悉的困境:遵循你头脑中的仔细推理,还是相信你直觉的感觉。流行文化经常将这种紧张感转化为一个关于两个大脑的简单故事 [...]
OpenAI GPT-5.6 Sol, Terra, and Luna are now generally available on Amazon Bedrock
今天,OpenAI 的 GPT-5.6 Sol、Terra 和 Luna 在 Amazon Bedrock 上全面上市,将 OpenAI 迄今为止最智能的模型系列引入 Amazon Bedrock 专为高性能、安全性和可靠性而打造的下一代推理引擎。
Deploying quantized models on Amazon SageMaker AI with Unsloth
在本文中,您将学习四种部署模式,用于采用已使用 Unsloth 量化的模型并将其部署在 AWS 基础设施上。这些模式使用 Amazon Elastic Compute Cloud (Amazon EC2) 进行直接实例访问,使用 Amazon SageMaker AI 推理终端节点进行托管服务,并在推理需要适应现有容器框架时使用 Amazon Elastic Kubernetes Service (Amazon EKS) 或 Amazon Elastic Container Service (Amazon ECS)。您还可以学习生产部署的操作实践。
Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why
在策略蒸馏为训练推理模型提供密集的、按令牌的监督;然而,目前尚不清楚该信号在哪些条件下有益,在哪些条件下有害。应该采用哪种教师模式,在自我蒸馏的情况下,应该以哪种具体情境作为监督信号?不同代币的最佳选择是否有所不同?目前,解决这些问题通常需要昂贵的训练运行,其总体性能指标掩盖了单个代币级别的动态。我们推出了免培训...
Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
多模态大语言模型 (MLLM) 最近在视觉理解方面表现出了强大的性能,但它们往往缺乏时间意识,特别是在以自我为中心的环境中,其中推理取决于事件的正确排序和演变。这种缺陷部分源于训练目标未能明确奖励时间推理,而是依赖于帧级空间快捷方式。为了解决这个限制,我们提出了时态全局策略优化(TGPO),这是一种具有可验证奖励的强化学习(RLVR)算法,旨在激励时态……
长上下文处理仍然是语言模型的核心挑战:即使具有扩展的上下文窗口,模型通常也无法跨长上下文可靠地提取、推理和使用信息。最近的工作,如递归语言模型(RLM),通过推理时的编程交互将长上下文分解为递归子查询的代理方式来应对这一挑战。尽管前景广阔,但 RLM 的成功关键取决于如何选择这些情境交互程序的轨迹,而这一点尚未得到探索。在本文中,我们研究这个问题......
Securing AI Data Center: Architecture, Security Posture, and Emerging Standards
人工智能(AI)是一项应用广泛的变革性技术,其突破性进展正在重塑全球力量平衡。人工智能数据中心,支持人工智能训练、推理和计算的基础设施
Run MiniMax models on Amazon Bedrock
在这篇文章中,我们将介绍如何开始在 Amazon Bedrock 上使用 MiniMax 模型,包括这些模型支持的功能、可用的服务层、按需推理如何扩展以处理您的工作负载,以及您可以用来访问它们的不同 API。使用这些模型,客户可以构建代理应用程序、长上下文文档分析管道和软件工程工作流程,所有这些都得到 AWS 的安全和运营保证的支持。
Automatically redact PII in images with Amazon Nova
在这篇文章中,我们介绍了一个由 Amazon Nova 指导的多步骤管道,该管道使用其上下文视觉推理来协调互补工具,包括部署在 Amazon SageMaker AI 上用于像素级分割的 Meta 开源 Segment Anything Model (SAM 3) 和用于光学字符识别 (OCR) 的 Amazon Textract。该管道旨在提供全面且合规的 PII 编辑,即使是具有挑战性的边缘情况,例如任意方向的指纹、身份证或车牌。
著名流行病学家和统计学家桑德·格陵兰 (Sander Greenland) 在评论我之前的帖子时写道: 我发现自己完全同意格陵兰的观察结果,因为它打破了科学界普遍存在且根深蒂固的自欺欺人的现象。 “科学”的标签永远不应该与“确定”同义。经验推理,就其本质而言,是放大性的——它 [...]
Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
这项研究的重点是文本到声音视频 (T2SV) 生成,旨在生成具有文本同步音频的视频,两种模式都与文本条件一致。尽管联合音视频训练取得了进展,但仍然存在两个关键挑战:(1)文本调节是一个瓶颈——共享字幕(TV = TA)触发模态干扰,而密集的训练字幕和简洁的推理用户提示之间仍然存在差距;(2)跨模态特征交互的最佳融合机制仍不清楚。为了解决第一个挑战,我们首先提出......
LensVLM: Selective Context Expansion for Compressed Visual Representation of Text
视觉语言模型 (VLM) 提供了将文本处理为渲染图像的令人兴奋的可能性,无需将文本标记为长标记序列。由于 VLM 图像编码器将固定大小的图像映射到固定数量的视觉标记,因此不同的渲染分辨率提供了细粒度的压缩旋钮。然而,随着压缩率的增加,准确性会迅速下降:字符缩小到低于视觉编码器的有效分辨率,使它们难以区分。为了解决这个问题,我们提出了 LensVLM,这是一个推理框架和训练后配方,使 VLM 能够扫描……
Intelligence is Free, Now What? <br> Data Systems for, of, and by Agents
...民有、民治、民享的政府... — 亚伯拉罕·林肯,葛底斯堡演说 (1863) 人工智能的成本正在迅速下降。到 2023 年初,GPT-4 级功能的成本约为每百万代币 30 美元;如今,同样的价格低于 1 美元,一些提供商将成本压低到 0.10 美元以下。在各个基准中,推理价格每年下降 9 倍到 900 倍,下降中位数接近 50 倍。即使是前沿型号也每一代都变得越来越便宜,开源型号紧随其后。至关重要的是,即使“诺贝尔奖获得者天才级”智能还没有出现,但足以满足绝大多数知识工作的智能今天已经存在,而且每个月都在变得更便宜。按照这个速度,我们很快就会进入几乎免费的智能时代——这种智能对于日常知识
AI Agents Explained: What Is a ReAct Loop and How Does It Work?
代理如何推理、行动和观察最终答案,一次一步人工智能代理解释:什么是 ReAct 循环及其工作原理?首先出现在《走向数据科学》上。
Learning Unmasking Policies for Diffusion Language Models
扩散(大型)语言模型 (dLLM) 现在在许多任务上与自回归模型的下游性能相匹配,同时有望在推理过程中提高效率。 dLLM 的一个关键设计方面是采样程序,该程序选择在每个扩散步骤中揭开哪些标记。事实上,最近的工作发现,与随机揭露相比,置信度阈值等启发式策略可以提高样本质量和令牌吞吐量。然而,这种启发式方法也有缺点:它们需要手动调整,而且我们观察到它们的性能......
On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs
强化学习 (RL) 微调已成为增强推理密集型任务的大型语言模型 (LLM) 的关键技术,并推动其扩展到视觉语言模型 (VLM)。虽然经过 RL 调整的 VLM 改进了视觉推理基准,但它们仍然容易受到视觉基础薄弱、幻觉和过度依赖文本提示的影响。我们证明,简单的、受控的文本扰动——误导性的标题或不正确的思维链 (CoT) 痕迹——会导致鲁棒性和置信度大幅下降,并且当 CoT 一致性为……时,这些影响会更加明显。
Run NVIDIA Nemotron and OpenAI GPT OSS models on Amazon Bedrock in AWS GovCloud (US)
我们很高兴在 AWS GovCloud(美国)中引入基于美国的前沿开放权重模型。通过此版本,Amazon Bedrock 现在支持 OpenAI 的开放权重 GPT OSS 模型(120B 和 20B)和 NVIDIA Nemotron(Nano 9B v2、Nano 12B v2、Nano 30B、Super 120B)模型。在这篇文章中,我们将介绍这些模型及其功能、数据驻留的推理选项、可用的服务层以及如何开始。