ICRA 最近举行的题为“在论文洪流中幸存”的小组聚集了领先的机器人研究人员,他们一直在努力应对当今发表的大量机器人论文。讨论范围从出版物增长的硬数据、大型语言模型 (LLM) 的承诺和风险,到重塑同行评审的激进建议,因为我们 [...]
LLMs in Security Research - AI, Standards, and Why Evidence Still Matters
追溯信息来源是安全研究的核心内容。如果您无法使用原始材料证明您的主张,那么您就有麻烦了。人们很困惑,有些人会开始叫你出来。进一步说,人们可能还会对引用或分享你的研究的出版物变得警惕。从长远来看,这不利于公众的信任。
现代人工智能系统正在被部署在医学、科学和法律等复杂领域,根据观察到的证据,这些领域通常没有一个正确的答案。当新证据出现时,此类系统必须能够代表和更新关于世界的不确定信念,以做出理性决策。我们引入了将法学硕士作为信息处理规则进行研究的新技术,并利用信息处理差距(与贝叶斯更新的偏差)来研究法学硕士如何根据证据更新其概率信念的内部(内)一致性。我们广泛的实验评估...
大型语言模型 (LLM) 表现出广泛的类人行为,从表达思想和情感,到与用户建立关系,再到拒绝请求和维护边界。尽管法学硕士很普遍,但研究人员和从业者缺乏方法和经验见解来就法学硕士应该表现出何时以及何种类型的类人行为做出明智的决定。为了填补这一空白,我们使用法学硕士作为法官和人类评估,对这些行为的普遍性、潜在影响和可控性进行了多维分析。超过 21,000 个……
How to Utilize OKF Efficiently to Enable Knowledge Exchange Among LLMs
Google 的开放知识格式 (OKF) 是一个 Markdown+YAML 框架,用于在人类和 AI 代理之间共享知识。这篇文章在一项非常具体的工作中重用了该框架——在三个 Qwen2.5-Coder 模型(7B、3B、1.5B)之间进行预标记化整数数组的代理到代理的交接,并显示了 28-37% 的 TTFT 减少以及一个确保整个安全的全词汇等效性检查。如何有效利用 OKF 来实现 LLM 之间的知识交换的文章首先出现在 Towards Data 上科学。
These startups are chasing the next big thing in LLMs
《麻省理工科技评论》的“下一步是什么”系列着眼于各个行业、趋势和技术,让您对未来有一个初步的了解。您可以在此处阅读其余内容。早在 2017 年夏天,谷歌的人工智能研究人员就发表了一篇名为《注意力就是你所需要的》的论文,其中他们描述了一种新的……
Building Multimodal Workflows with a Local LLM
使用 Gemma 4 和 Ollama 进行图像输入和结构化输出The post Building Multimodal Workflows with a Local LLM 首先出现在 Towards Data Science 上。
Build a Reasoning LLM from Scratch: A Complete Guide to GRPO, RoPE & Pretraining.
使用 GRPO、RoPE 和现代变压器构建推理法学硕士。帖子从头开始构建推理法学硕士:GRPO、RoPE 和预训练的完整指南。首先出现在Spritle软件上。
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
偏好对齐已成为提高大型语言模型 (LLM) 性能的关键组成部分,但其对多模态大型语言模型 (MLLM) 的影响仍相对未得到充分研究。与语言模型类似,用于图像理解任务的 MLLM 也会遇到幻觉等挑战。在 MLLM 中,幻觉不仅可以通过陈述不正确的事实而发生,还可以通过产生与图像内容不一致的响应而发生。 MLLM 对齐的主要目标是鼓励这些模型将响应与图像信息更紧密地对齐。最近...
Chilling Political Dissent: Are LLMs Censoring Output Criticizing Restrictive Regimes?
Meta 监督委员会最近的一份报告对基金会法学硕士在被要求生成有关言论限制政治政权、其领导人和执政党的负面内容时可能进行的审查提出了严重担忧。令人不寒而栗的政治异议:法学硕士是否审查批评限制性政权的产出?首先出现在美国企业研究所 - AEI 上。
5 Free Courses to Learn Modern AI and LLMs
了解如何在工作中使用生成式 AI、构建 RAG 和代理应用程序、微调模型、使用 Hugging Face 生态系统以及利用实践资源制作 AI 产品原型。
A fundamental flaw leaves LLMs strikingly vulnerable to attack
一个研究小组在本月顶级人工智能会议国际机器学习会议上发表的一篇论文中指出,由于大型语言模型工作方式存在根本性缺陷,因此不可能使大型语言模型完全免受黑客攻击。该声明对该技术的安全性具有巨大影响,其中......
How Much Does a Local LLM Actually Cost to Run? I Measured Every Watt on Apple Silicon
五种型号,持续发电,真正的壁式插座能源为 0.31 美元/千瓦时 - RTX-3090 数字预测的惊喜,只会更大。帖子本地 LLM 实际运行成本是多少? 《我测量了 Apple Silicon 上的每一瓦特》首先出现在《迈向数据科学》上。
Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction
ABBEL 与传统递归摘要相比的概述。信念取代了完整的交互历史作为代理的工作环境,信念分级通过监督每个信念状态的内容来提高性能。随着任务范围的增长,LLM 环境无法永远扩展。自总结可以实现简洁、可解释的上下文,但会带来显着的性能成本,特别是对于高质量数据稀缺的人工辅助领域,例如协作代码生成。我们用 ABBEL 来解决这个问题:一个框架,以自然语言信念状态的形式隔离和监督摘要的信息内容。动机:递归摘要的成本对于语言模型来说,要有效地协助日益复杂的任务,例如软件开发,它们必须能够与我们进行数百甚至数千个步骤的交互。对于如此长的任务,将整个交互的历史记录保存在上下文中是不切实际的。迄今为止使用的启发
How to encourage smarter AI use in the classroom
本文来自《麻省理工学院技术评论》的限量版时事通讯《Making AI Work》,探讨如何在各行业应用法学硕士。要在您的收件箱中接收它,请在此处注册。几年前,聊天机器人的发布令许多学校感到惊讶。突然间,学生们的手机里装了一个应用程序,它可以神奇地回答几乎任何问题……
TR Launches Thomson 1.0 – Its Own LLM
经过几个月的工作,TR 推出了 Thomson 1.0,它自己的法学硕士,根据自己的数据进行训练 - 它显示出...
TR CEO Steve Hasker on Thomson 1.0
正如Artificial Lawyer刚刚分享的那样,汤森路透推出了汤森路透1.0,这是自己的开放权重法学硕士,使用自己的数据进行训练。在这里,AL深入探讨...
What to Expect From LLM Customization Services
LLM 定制服务可帮助组织调整语言模型应用程序以适应特定的业务任务、知识源、术语、工作流程和安全要求。这项工作可以包括即时设计、检索增强生成、工具集成、微调、评估、部署和持续优化。定制不应从必须训练新模型的假设开始。在...阅读更多»法学硕士定制服务的期望一文首先出现在大数据分析新闻上。