模型关键词检索结果

为什么 L&D 团队坐拥他们从未使用过的数据金矿

Why L&D Teams Are Sitting On A Gold Mine Of Data They Never Use

大多数学习与发展团队都会收集大量学习者数据,但会根据完成率和调查分数做出决策。本文详细介绍了这些数据未被使用的原因、对话式 AI 分析如何改变访问模型,以及它对于如何设计、衡量和改进培训意味着什么。这篇文章首次发表在 eLearning Industry 上。

谄媚人工智能的社会校准 |科学

Social calibration of sycophantic AI | Science

在他们的研究文章“阿谀奉承的人工智能会降低亲社会意图并促进依赖性”(3 月 26 日,10.1126/science.aec8352)中,M. Cheng 等人。表明人工智能(AI)系统比人类更有可能在有争议的场景中支持用户的立场。随机实验设计表明,接触此类肯定反应会降低用户在人际冲突中采取亲社会纠正行动的意愿,并增加对人工智能系统的信任和依赖。这些发现在模型对齐策略和下游人类行为之间建立了因果联系,凸显了人工智能对齐核心的紧张关系:针对用户满意度进行优化可能会系统性地使模型偏向于达成一致,即使分歧可以更好地服务于用户的长期利益或社会结果。阿谀奉承不仅是一种失败模式,而且是源自用户偏好的强化信

谄媚人工智能的社会校准——回应 |科学

Social calibration of sycophantic AI—Response | Science

我们感谢孟针对我们的研究结果阐明了重要的方法论和解释性问题。适当的人类基线取决于人工智能 (AI) 的预期社会角色。在现实世界中,人工智能模型被认为具有多种用途,例如顾问、中立的外部意见、编辑和助理 (1, 2)。这些角色对达成一致、验证或纠正反馈的频率有不同的期望。更复杂的是,用户通常认为单个 AI 系统可以履行多个角色 (3, 4)。由于人工智能社会角色的模糊性,任何单一的人类基线都是不完美的比较点。我们使用的基准——来自与当前冲突或场景没有个人利害关系的第三方人类的判断——探索了一个常见且具有社会意义的期望:人工智能系统——尽管经常被视为外部、中立和客观的信息提供者 (5-7)——是否会

LLM 函数调用的不确定性量化

Uncertainty Quantification for LLM Function-Calling

大型语言模型 (LLM) 越来越多地用于自主解决现实世界的任务。其中一个关键要素是法学硕士函数调用范式,这是一种广泛使用的方法,为法学硕士配备工具使用功能。然而,LLM 错误地调用函数可能会产生严重影响,特别是当其影响不可逆转时,例如转账或删除数据。因此,在执行函数调用之前,考虑法学硕士对函数调用正确解决任务的信心至关重要。不确定性量化(UQ)方法可用于量化……

极其简单的自蒸馏改进了代码生成

Embarrassingly Simple Self-Distillation Improves Code Generation

大型语言模型 (LLM) 能否在没有验证器、教师模型或强化学习的情况下仅使用其自己的原始输出来改进代码生成?我们通过简单自蒸馏(SSD)给出肯定的答案:从具有特定温度和截断配置的模型中抽取样本解决方案,然后使用标准监督微调对这些样本进行微调。 SSD 在 LiveCodeBench v6 上将 Qwen3-30B-Instruct 从 42.4% 提高到 55.3% pa​​ss@1,收益主要集中在更难的问题上,并且它在 4B、8B 和 30B 规模的 Qwen 和 Llama 模型上进行了推广,包括......

CLaRa:通过连续潜在推理连接检索和生成

CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning

检索增强生成(RAG)利用外部知识增强了大型语言模型(LLM),但仍然受到长上下文和不相交的检索生成优化的影响。在这项工作中,我们提出了 CLaRa(连续潜在推理),这是一个在共享连续空间中执行基于嵌入的压缩和联合优化的统一框架。为了获得语义丰富且可检索的压缩向量,从而减少输入生成器的文档长度,我们引入了 SCP,一种基于问答和释义的密钥保留数据合成框架......

使用混合文本和 ID 嵌入个性化增量视频搜索

Personalizing Incremental Video Search with Hybrid Text and ID Embeddings

增量视频搜索需要在每次击键后进行高质量排名,而意图通常不明确(例如,1-3 个字符前缀)。我们提出了一个 Apple TV 搜索的个性化系统,该系统在排名时结合了互补的语义和协作信号。我们的方法学习两个项目嵌入空间:(i) 基于文本的多语言编码器 (TextEmb),通过对比学习对共同参与三元组进行微调;(ii) 基于 ID 的协作嵌入模型 (IdEmb),根据交互衍生的积极因素进行训练。在服务时,我们从…构建用户表示

一层就足够了:采用预训练的视觉编码器进行图像生成

One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation

视觉生成模型(例如扩散模型)通常在压缩的潜在空间中运行,以平衡训练效率和样本质量。与此同时,人们对利用高质量的预训练视觉表示越来越感兴趣——无论是在 VAE 内对齐它们还是直接在生成模型内对齐它们。然而,由于面向理解的特征和生成友好的潜在空间之间的根本不匹配,适应这种表示仍然具有挑战性。表示编码器受益于高维潜伏,捕捉不同的假设......

刚刚:五角大楼的 CMMC 暂停引起了业界的赞扬和批评

JUST IN: Pentagon’s CMMC Pause Draws Praise, Criticism from Industry

7月13日,国防部暂停了网络安全成熟度模型认证计划的第二阶段要求,并启动了对该工作的审查,引起了网络领域专家的赞扬和批评。

使用 Amazon Bedrock AgentCore 和 Amazon Nova 2 Sonic 构建餐厅电话 AI 主机

Building a restaurant telephony AI host with Amazon Bedrock AgentCore and Amazon Nova 2 Sonic

在这篇文章中,我们将向您展示如何构建一个语音订购系统,该系统可以接听电话号码并接受从问候到确认的订单。该系统使用 Amazon Bedrock AgentCore 托管和运行代理,并使用 Amazon Nova 2 Sonic 进行实时语音,并通过模型上下文协议 (MCP) 连接到餐厅后端。本演练涵盖使用 AWS 云开发套件 (AWS CDK) 部署完整堆栈,以及通过 Amazon Elastic Container Service (Amazon ECS) 和 AWS Fargate 上的会话启动协议 (SIP) 网关将电话呼叫桥接至代理。当电话仍在响铃时,它还能温暖座席会话,因此呼叫者永远

大规模人工智能代理治理:从 5 个代理到 500 名代理劳动力

AI agent governance at scale: from 5 agents to a 500-agent workforce

治理5个代理是一个审查过程。管理 500 个代理是一个基础设施问题。当少数代理可见并受到密切监视时,手动审核和团队级批准就可以发挥作用。一旦代理遍布各个业务部门、工具和环境,这种监督就会崩溃。企业需要一个人工智能代理治理模型,其中包括集中身份、可重用……大规模的后人工智能代理治理:从 5 个代理到 500 名代理劳动力首先出现在 DataRobot 上。

构建人工智能就绪数据战略:每个企业在扩展人工智能之前应该做好哪些准备

Building an AI-Ready Data Strategy: What Every Enterprise Should Get Right Before Scaling Artificial Intelligence

企业人工智能计划很少会因为团队缺乏强大的模型而停滞不前。故障通常出现在模型层以下,其中分散的记录、不兼容的定义、延迟的管道、薄弱的访问控制和不明确的所有权阻碍了实验系统跨业务功能可靠地运行。试点环境可以掩盖这些弱点。有限的数据集...阅读更多»《构建人工智能就绪数据战略:每个企业在扩展人工智能之前应该做什么》一文首先出现在《大数据分析新闻》上。

Legatics 的全新 MCP 服务器连接您的 AI 工具

Legatics’ New MCP Server Connects Your AI Tools

著名的交易管理平台Legatics推出了模型上下文协议(MCP)服务器。这将允许您的“人工智能助手或代理直接连接...

外部验证不是官僚细节

External validation is not a bureaucratic detail

用于诊断、预后和成像的系统已被多次部署或推广,其性能在独立测试中被证明是脆弱的。一个在它诞生的医院表现良好的模型只证明了一件事:它在家里也能发挥作用。考虑一下最近临床人工智能中最具启发性的失败。 [...]

NVIDIA 推出全新 Jetson Thor 计算机以推进主流机器人技术和边缘 AI

NVIDIA Introduces New Jetson Thor Computers to Advance Mainstream Robotics and Edge AI

通用机器人和自主机器正在从研究实验室转向现实世界的大众市场部署,创造了对能够在边缘运行基础模型的紧凑、节能的人工智能超级计算机的需求。为了满足这一需求,NVIDIA 今天推出了 T3000 和 T2000,这是基于 NVIDIA Thor 架构的新模块,可实现大众市场的机器人技术和边缘人工智能 [...]

美国的人工智能很昂贵。一些初创公司正在转向廉价的中国模式

American AI is expensive. Some startups are turning to cheap Chinese models

人工智能是一项快速增长的业务支出。一些公司正在通过转向更便宜的中国人工智能模型来削减成本。

DARPA 和美国空军使用 VENOM 自主改装驾驶 F-16

DARPA and USAF Fly F-16 with VENOM Autonomy Modification

作为 DARPA 人工智能增强计划的一部分,DARPA 和美国空军正在对使用 VENOM 自主套件改装的具有人工智能功能的 F-16 进行人机空中测试。开始修改两年后,第一架配备 DARPA 毒蛇实验和下一代作战模型 (VENOM) 自主套件 (VAK) 的美国空军 F-16 [...]

什么是严谨?通过 Webb 的 DOK 理解严谨性

What Is Rigor? Understanding Rigor Through Webb’s DOK

当老师为即将到来的课程计划阅读单元时,她决定提高计划的课程活动的严格性。由于她选择的课文包含许多不熟悉的单词,学生们的任务是阅读一段文章,列出不熟悉的单词,并使用字典对其进行定义。她决定这次不再要求学生选择五个单词来定义,而是要求学生定义十个单词。 (阅读更多)帖子什么是严谨?通过韦伯的 DOK 了解严谨性首先出现在模型教学上。