The Operating Layer: Memory, Skills, Todos, Voice, Channels, and the Approval Boundary
人工智能助手的作用取决于其周围的操作层。在 Hermes 之旅的第二部分中,Rob 介绍了 Storm 从聪明的特工转变为可靠的数字参谋长的过程,以及使其可以安全实际使用的批准边界。
Attackers Use Vishing Attacks to Distribute New Android Malware
攻击者正在通过电话社会工程攻击分发名为“WindRelay”的新型Android恶意软件。攻击者冒充银行员工致电受害者,指示他们安装恶意应用。
Read Speaker, Text-to-Speech & Inclusive eBooks: Building Accessibility Into Your Catalog
无障碍不是单独的产品线。文本转语音电子书和离线访问等功能应内置到K-12出版目录中。这些功能还必须跨设备兼容,不论个人学习偏好和需求如何。包容性电子书平台现已成为K-12出版的基础,而非高级附加功能。……阅读更多……
Sonos' improved Voice Control points to an intriguing smart home future
报告显示,Sonos 正准备在不断发展的智能音箱市场竞争,准备新硬件并对其语音助手进行人工智能支持的彻底改革。
I tried the free Wispr Flow voice dictation tool everyone's talking about - and I'm hooked
Wispr Flow 专为 Windows、MacOS、iOS 和 Android 设计,与其他语音听写应用程序相比,使用起来很愉快。方法如下。
FAA Updates Cockpit-Control Guidance for Touchscreens, Voice Commands
随着驾驶舱控制装置超越开关和旋钮,指南草案解决了人为因素问题。
Gemini voice calling on Android Auto keeps failing me - and Google has until September to fix it
随着 Google Assistant 今年秋天关闭,Android 用户将面临质量较差的语音通话,这要归功于 Gemini。
1849 年,一位出生于意大利的发明家开发了一种早期的语音通信设备,但由于经济困难而无法获得完整的专利。安东尼奥·梅乌奇 (Antonio Meucci) 在亚历山大·格雷厄姆·贝尔 (Alexander Graham Bell) 获得电话专利之前几年就发明了 Telettrofono。经济困难、受伤和未支付的专利续展费影响了他的索赔。 2002 年,他的工作因帮助奠定了语音通信技术的基础而获得了美国众议院的认可。
AI on the Pi: Build Your Own Local Voice Agent
当我收到第一个 Raspberry Pi 时,我就知道这将是一个将人工智能带入物理世界的绝佳平台。由于最初的硬件对快速算术没有良好的 CPU 支持,我最终编写了在 GPU 上运行的代码,这样我就可以获得我需要的速度 [...]
Building Voice-Controlled AI Agents
构建语音控制的 AI 代理并不难,本文将管道分解为其实际组件:流式语音识别、转弯检测、流式生成、中断处理和语音约束下的工具调用,并展示了每个组件的职责。
Reduce ASR inference costs by 75% with NVIDIA MPS on Amazon EC2
当每个请求仅使用 GPU 的一小部分时,大规模提供自动语音识别 (ASR) 模型的成本高昂。了解 Amazon EC2 GPU 实例上的 NVIDIA CUDA 多进程服务 (MPS) 与 NVIDIA Triton 推理服务器如何将 GPU 基础设施削减 75%,同时将亚秒级延迟保持在每个 GPU 每秒 92.1 个请求。
Deepgram deepens Amazon SageMaker AI observability with Enhanced Metrics
自托管语音 AI 需要进行可观察性权衡:驱动容量规划和成本管理的数字被锁定在供应商容器内。 Deepgram 通过两项功能缩小了 Amazon SageMaker AI 的这一差距,这些功能可将计费、使用情况和每个 GPU 指标直接存入您自己的 Amazon CloudWatch 账户中。
Bishnu S. Atal: The Indian-born scientist whose breakthrough helped make mobile phone calls possible
Bishnu S. Atal 是一位来自印度的杰出工程师,在数字电话和蜂窝技术领域做出了卓越的贡献。他的开创性研究集中在语音处理和数据压缩上,这大大降低了数据传输的要求。他开创了线性预测编码和码激励线性预测等创新,为 TDMA、CDMA 和 GSM 等蜂窝系统奠定了基础。
Natera’s intelligent appointment scheduling with Amazon Bedrock AgentCore
了解Natera如何在Amazon Bedrock AgentCore上构建自动语音代理,让患者通过自然对话预约移动抽血服务。文章涵盖了双WebSocket桥接、事件驱动延迟掩蔽和渐进信任机制。
New Maryland Plant To Build Equipment For FAA’s Air Traffic Control Overhaul
马里兰州的一家新工厂将为美国联邦航空管理局全国空中交通管制现代化项目制造数字语音交换机。
New Facility Could Help FAA Address ATC Staffing Woes
现代语音交换机技术将使该机构能够重新分配管制员人员,而无需实际调动他们。
语码转换 (CS),即同一话语中的不同语言,由于 CS 训练数据有限,给自动语音识别 (ASR) 带来了重大挑战。本文首次将迭代伪标记训练方法应用于 CS-ASR,证明了其在利用未标记数据来提高 CS-ASR 性能方面的有效性。该方法包括三个阶段:伪标签生成、两阶段双语模型训练和迭代改进。它首先从大型未标记语料库生成伪标签,创建半监督数据集。这……