详细内容或原文请订阅后点击阅览
当 AI 开始阅读房间时
重点不在于人工智能交互模型拥有公正的旁观者或获取公正旁观者的手段。相反,这些模型通过测量所说和未说的内容,让我们更接近真正的人机对话。 文章《当人工智能开始阅读房间》首先出现在美国企业研究所 - AEI 上。
来源:美国进取研究所信息Mira Murati 的思维机器实验室本周宣布,它正在构建“交互模型”,这是一种新型人工智能,旨在同时处理音频、视频和文本并以对话速度做出响应。据报道,最初的系统 TML-Interaction-Small 的响应延迟约为 0.4 秒,接近人类自然对话的时间,并且比 OpenAI 和 Google 的同类模型更快。预计几个月内将发布有限的研究预览,并于 2026 年晚些时候发布更广泛的版本。
当今领先的人工智能系统在默认的文本和语音模式下都在单线程中运行。人类打字,模型等待,然后模型做出响应。真正的人类对话并不是这样进行的。我们会打断、犹豫、调整句子中间的内容,并在任何一方完成一个想法之前阅读对方的表情和语气。阿尔伯特·梅赫拉比安的研究表明,当意思不明确或情绪化时,听众会严重依赖面部表情和语气,而不仅仅是语言。到目前为止,人工智能系统还无法解码这些不言而喻的信号。
这就是 Murati 的工作意义所在。交互模型旨在使人机交流更加顺畅。该技术方法直接处理音频和视觉信号,结果是人工智能可以记录手势或犹豫,并在句子结束之前进行调整。
Anthropic 一直在从不同的角度研究相关问题。 Claude Code 最近添加了 a/btw 命令,允许用户在系统处理主要任务时插入附带问题,而不会中断正在进行的工作。这是一个有用的工作流程功能,但它不是同一件事,因为它仍然涉及显着的延迟。 Thinking Machines 正在解决这个问题的更难版本:不是并行的通信通道,而是同时在两个方向上运行的单一通信通道。
