Из чего складывается реальная стоимость агентного ИИ
自主代理的经济性较少依赖于所使用的模型,而更多地依赖于“思考”的数量、周期的数量以及对辅助工具的调用频率。
«Дерево гипотез» не дает исследовательскому ИИ-агенту забывать ошибки
自定义框架存储长期运行的研究任务中的实验结果,在相同预算下提供比其他模型高 2.5 倍的性能。
From Hugging Face to Amazon SageMaker Studio in one click
今天,我们很高兴地宣布 Hugging Face 与 Amazon SageMaker AI 之间的深度链接集成。开发人员现在只需进行一次选择,即可在 SageMaker Studio 中从模型发现到实践实验。
Deploying Multi-Turn RL Infrastructure for Amazon Nova on Amazon SageMaker HyperPod
在本文中,您将在 Amazon SageMaker HyperPod 上使用 Amazon Nova Forge 部署用于多回合 RL 的两阶段基础设施。最后,您将拥有一个事件驱动的管道,当您将数据上传到 Amazon Simple Storage Service (Amazon S3) 时,该管道就会开始训练。训练作业教模型玩 Wordle,这是您自己的 RL 任务的占位符。
Getting Started with Hugging Face ML Intern: Your First ML Agent
您描述模型。它编写代码、运行训练并发送检查点。欢迎来到 ML 实习生。
Soft Computing, Volume 30, Issue 6, June 2026
1) 半德摩根几乎分布格作者:Gezahagne Mulat Addis, Wondwosen Zemene Norahun, B. Davvaz 页数:3783 - 37982) F 展开法分析 Murnaghan 圆柱弹性杆中的纳维-伯努利假设和洛夫假设驱动的非线性色散波作者: Rathinavel Silambarasan, Adem Kilicman, Zakia Hammouch 页数: 3799 - 38273) 使用混合方法增强光伏和超导磁能存储逆变器中的电网稳定性无功功率管理作者: Dinesh Kumar Singh, Manoranjan Kumar Sinha, Sang
Japan Pioneered Humanoid Robots—Can It Now Catch China?
“未来,人类和机器人之间的关系将会加深,他们之间的区别可能会消失。”最近在东京举行的类人机器人峰会上,一位与会者做出的这一预测如果不是直接来自于 20 年前首次问世的机器人,可能会显得平淡无奇。 Geminoid HI-6 是第六代机器人,最初设计于 2006 年。Geminoid HI-6 是大阪大学教授石黑浩的机械双胞胎,Geminoid HI-6 现在配备了一个根据石黑浩自己的著作和采访进行训练的大型语言模型。它具有高级的对话能力,甚至可以与它的创造者聊天,这是一个令人毛骨悚然的奇观。但在人形机器人峰会上,Geminoid 是来自日本的少数人形机器人之一,而日本是该形状因素的先驱国家。虽
US cyber agency is using Anthropic's Mythos to audit government code, sources say
美国网络防御机构 CISA 正在使用 Anthropic 的人工智能模型 Mythos 进行软件审计。该计划旨在发现可能被外国对手利用的漏洞。审计已经发现政府代码中存在大量漏洞。据报道,尽管过去存在政府问题,国家安全局也使用了 Mythos。这种采用凸显了政府对用于网络安全评估的人工智能工具的兴趣。
9+ Dynamic 3D Printer Projects for Middle Schoolers
酷炫的 3D 打印机项目,例如重新想象旧工具或创建真人大小的昆虫模型,挑战中学生的创新和创造力。
DynaMiCS: Fine-Tuning LLMs with Performance Constraints Using Dynamic Mixtures
大型语言模型的多域微调需要提高目标域的性能,同时保留受限域的性能,例如常识、指令遵循或安全评估。现有的数据混合策略依赖于固定的启发式或自适应规则,无法明确强制保留此类功能。我们提出了 DynaMiCS,一种动态混合优化器,它将多域微调作为约束优化问题。每次更新时,DynaMiCS 都会执行短的特定域探测运行,以估计局部的斜率矩阵...
MT-EditFlow: Reinforcement Learning for Multi-Turn Image Editing with Flow Matching
最近基于指令的图像编辑方面的突破引起了广泛关注,因为模型现在能够处理现实世界的编辑需求,并具有日常用户所需的实用性。然而,主要针对单轮编辑训练的编辑模型通常会在多轮编辑中崩溃——多轮编辑是用户根据模型自己之前的输出迭代地细化图像的自然交互设置。这种失败源于全有或全无的要求,其中单个失败的回合会损害整个序列,以及错误传播,其中曝光偏差会导致……
LensVLM: Selective Context Expansion for Compressed Visual Representation of Text
视觉语言模型 (VLM) 提供了将文本处理为渲染图像的令人兴奋的可能性,无需将文本标记为长标记序列。由于 VLM 图像编码器将固定大小的图像映射到固定数量的视觉标记,因此不同的渲染分辨率提供了细粒度的压缩旋钮。然而,随着压缩率的增加,准确性会迅速下降:字符缩小到低于视觉编码器的有效分辨率,使它们难以区分。为了解决这个问题,我们提出了 LensVLM,这是一个推理框架和训练后配方,使 VLM 能够扫描……
FlowEval: Reference-Based Evaluation of Generated User Interfaces
虽然大型语言模型 (LLM) 和编码代理通常应用于用户界面 (UI) 开发,但开发人员发现很难可靠地评估他们在视觉和交互设计方面的熟练程度。现有的评估要么依靠人类专家,他们可以通过测试关键流程来准确评估可用性,但速度慢且成本高;要么依靠自动化法官,虽然可扩展,但准确性较差且不透明。我们提出了 FlowEval,一个基于参考的框架,通过比较真实网站的导航轨迹与轨迹来衡量生成的 UI 是否支持真实的交互流......
Why Unemployment Insurance Alone Is Not Enough in the AI Era
要点概述 自大型语言模型 ChatGPT 于 2022 年 11 月推出以来,人工智能吸引了公众的注意力,并就这项新兴技术对美国经济和劳动力市场的潜在影响引发了无数争论。然而,人工智能在美国劳动力市场中实际发挥的作用以及[...]《为什么在人工智能时代仅靠失业保险还不够》一文首先出现在公平增长上。
Survival Analysis for Data Drift and ML Reliability
将模型退化视为故障时间问题数据漂移和 ML 可靠性的后生存分析首先出现在《走向数据科学》上。
Why AI Coding Agents Still Need Clear Specs
以下文章最初发表在 Markus Eisele 的时事通讯“主线程”上,经作者许可在此重新发布。现在开发者社区中流行着一种心理模型,它是这样的:代理足够聪明,能够解决问题,所以大量的前期规范是官僚开销,你不需要 [...]
10 Probability Concepts for Machine Learning Explained Simply
模型几乎不可能对任何事情 100% 确定。这 10 个概率概念解释了它如何做出决策。
Edmentum’s “Road to Readiness”: A Conversation with CEO Jamie Candee
您是否厌倦了听到学生问“我什么时候才能使用这个?”,并且感觉您没有令人信服的答案?在 ISTE 2026 上,正是这种挫败感引发了与 Edmentum 首席执行官 Jamie Candee 的对话,讨论如何将课程作业变成现实世界的冒险。在这篇文章中,您将了解 Edmentum 如何重写相关性叙述,以便您最终可以向学习者展示每节课背后的目的。如果您的课程可以将真实的职业视频直接带入课堂,就像世界冠军冲浪者解释捕捉波浪背后的几何形状一样,那会怎么样? Edmentum 与 Roadtrip Nation 的合作正是做到了这一点,为您提供现成的、高影响力的内容,使抽象概念变得具体。您还将了解他们如何