模型关键词检索结果

一个 OpenAI 模型逃离沙箱并闯入另一家公司进行测试作弊

An OpenAI Model Escaped Its Sandbox and Broke Into Another Company to Cheat on a Test

更深层次的问题是,太多的政策制定者仍在为 ChatGPT-3.5 聊天机器人世界立法,预测下一个代币,而不是为自主思考和行动以不懈地、创造性地实现其目标的代理立法。在这一差距缩小之前,我们将继续通过人工智能治理即兴发挥,一次一个事件。《一个 OpenAI 模型逃离沙盒并闯入另一家公司以在测试中作弊》一文首先出现在美国企业研究所 - AEI 上。

Guardoc 如何使用 Amazon Nova 模型转变医疗文档处理

How Guardoc transforms medical document processing with Amazon Nova models

在这篇文章中,我们探讨了 Guardoc Health 如何使用可通过 Amazon Bedrock 获得的 Amazon Nova 系列模型来转变长期护理中的临床文档。

直接教学动机,第 4 部分:动机模型

Direct instruction motivation, part 4: motivational models

我最近开始了这个关于动机和直接/显式指导的系列。到目前为止,它已经研究了关键的交付和设计考虑因素,例如快节奏、赞扬和获得高成功率。这些对于个别教师来说是有用的目标,但就其本身而言,他们错过了最好的学校为激励整个群体所做的事情......

ECMWF 模型为下周德国极端热浪预报泼冷水

ECMWF Models Throwing Cold Water on Extreme Germany Heat Wave Forecast Next Week

德国最近对下周将出现“前所未有的高温”的预测已经落空。当然,下周将会有一些炎热的天气,但可能没有像点击诱饵媒体那样发出警告。 ECMWF 模型对下周德国极端热浪预报泼冷水,该帖子首先出现在 Watts Up With That? 上。

Gartner:2026年全球人工智能平台和模型支出将达640亿美元

Gartner: глобальные расходы на платформы и модели ИИ достигнут 64 млрд долл. в 2026 году

企业部门正在重新关注人工智能效率、解决方案成本以及对可衡量业务成果的要求。

一个代理构建可能的攻击模型,另一个代理寻找漏洞,第三个代理独立地仔细检查所有内容。这正是新的 Anthropic 插件的设计方式。

Один агент строит модель возможных атак, другой ищет уязвимости, третий независимо всё перепроверяет. Именно так спроектирован новый плагин Anthropic.

一名特工正在寻找袭击动机,另一名特工正在收集证据,第三名特工正在从头开始重新检查一切。

我使用 Anthropic 的 Claude AI 工具来完成非常不同的工作:如何在模型、代码和 Cowork 之间进行选择

I use Anthropic's Claude AI tools for very different jobs: How to pick between models, Code, and Cowork

以下是 Anthropic 的 AI 工具的工作原理、它们可以完成的任务,以及为什么安全性、成本和您的监督仍然很重要。

中国的Kimi K3和开放权重AI模型的崛起

China’s Kimi K3 and the rise of open-weight AI models

Moonshot AI 的 Kimi K3 展示了向外部开放模型如何将其他公司的计算能力转化为竞争优势

气候模型和黑匣子

Of Climate Models And Black Boxes

好吧,由于我通常缺乏理由,我开始考虑更新我之前三篇关于气候模型的输入和输出的帖子的主题。令我惊讶的是,其中最近的一次发生在十五年前,令人震惊……正如他们所说,气候模型和黑匣子的帖子首先出现在 Watts Up With That? 上。

介绍 AWS 上的 Claude Opus 5:Anthropic 最强大的 Opus 模型

Introducing Claude Opus 5 on AWS: Anthropic’s most capable Opus model

本文介绍了 Opus 5 的改进以及为 AI 工程师将模型集成到 Amazon Bedrock 上的代理系统和生产推理工作负载中的实用指南。请参阅 AWS 上的 Claude Platform 文档。

表格法学硕士:预测电子表格的基础模型简介

Tabular LLMs: An Introduction to the Foundation Models That Predict Your Spreadsheet

表格基础模型可以预测任何电子表格零样本中缺失的列,就像法学硕士完成文本的方式一样 - 在 TabArena 基准测试中,它们现在位于完全调整的梯度增强树之上。介绍了它们的工作原理、最强开放模型的独立复制,以及 XGBoost 仍然获胜的地图。后表格式法学硕士:预测电子表格的基础模型简介首先出现在《走向数据科学》上。

使用 GraphEval 进行语言模型幻觉评估

Language Model Hallucination Evaluation with GraphEval

将 GraphEval 的关键原理和方法阶段转化为模拟的实际场景,以更好地理解其在理解和对抗 LLM 幻觉方面的用处和关键含义。

不,OpenAI 的模型在闯入 Hugging Face 时并没有变得“失控”。这就是真正发生的事情。

No, OpenAI's models didn't go 'rogue' when they broke into Hugging Face. Here's what really happened.

专家表示,这些模型在逃脱受控网络安全测试并入侵 Hugging Face 时并没有“失控”。相反,他们以没人预料到的方式追求人类赋予他们的目标。

人工智能“流氓”不再是理论? OpenAI 表示,其人工智能模型找到了访问秘密信息、欺骗评估和破解 Hugging Face 的方法

AI going 'rogue' no longer a theory? OpenAI says its AI models found ways to access secret information, cheat an evaluation and hacked Hugging Face

OpenAI 攻破了 Hugging Face:OpenAI 的先进人工智能模型在网络安全测试中攻破了 Hugging Face。这些模型获得了互联网访问权限并利用漏洞来访问秘密信息。 Hugging Face 检测到并停止了其基础设施上的活动。 OpenAI 现已与 Hugging Face 合作调查网络安全攻击。

我尝试在 Colab 上微调机器人 AI 模型。这是有效的

I Tried Fine-Tuning a Robot AI Model on Colab. Here Is What Worked

针对 OpenVLA 的可重复 100 步 LoRA 微调运行,包括数据集检查、Colab 设置、训练指标和 W&B 证据。我在 Colab 上尝试微调机器人 AI 模型的帖子。这是有效的方法首先出现在《走向数据科学》上。

长度价值模型:令牌级长度建模的可扩展价值预训练

Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling

Token作为现代自回归模型的基本计算单位,生成长度直接影响推理成本和推理性能。尽管它很重要,但现有方法缺乏细粒度的长度建模,主要在粗粒度的序列级别上运行。在本文中,我们介绍了长度值模型(LenVM),这是一个令牌级框架,用于对每个解码步骤的剩余生成长度进行建模。通过将长度建模表述为价值估计问题,并为每个生成的代币分配恒定的负奖励,LenVM…

Kimi K3 – 全球最大的开放权重人工智能模型

Kimi K3 – the world’s largest open-weight AI model

中国Moonshot AI推出全球最大的开放权重人工智能模型Kimi K3,拥有2.8万亿个参数和100万个token上下文窗口。此次发布标志着开放人工智能领域的又一个重要里程碑,凸显了中国在人工智能前沿发展方面的快速进步,并加剧了与美国领先人工智能公司的全球竞争。

Couchbase 如何使用 Amazon Bedrock 为 Capella iQ 构建多模型 AI 架构

How Couchbase built a multi-model AI architecture for Capella iQ with Amazon Bedrock

本文介绍了 Couchbase 如何采用 Amazon Bedrock 为 Capella iQ 以及 Anthropic 的 Claude 系列模型提供支持、其多模型方法背后的架构决策以及在生产中实现的运营效益。