Context Engineering Isn’t Enough — A Loop Engineering Experiment With No LLM Inside the Loop
每个人都在谈论循环工程,但大多数讨论都假设法学硕士位于循环的中心。我想隔离架构本身。因此,我构建了一个确定性的、零依赖的 Python 基准测试,用简单的规则替换模型,使我能够直接衡量一个问题:目标导向控制器能否比传统线性管道更好地隔离故障?在验证了 300 个随机种子的基准测试并修复了一个最初使我自己的结果无效的微妙错误之后,我发现控制器始终完成了线性执行器从未达到的独立分支。本文介绍了架构、基准测试设计、调试过程以及一个狭隘但实用的主张背后的证据:故障隔离是控制流的一个可测量属性,与 LLM 推理无关。后语境工程还不够——循环内没有 LLM 的循环工程实验首先出现在《走向数据科学》上。
Embarrassingly Simple Self-Distillation Improves Code Generation
大型语言模型 (LLM) 能否在没有验证器、教师模型或强化学习的情况下仅使用其自己的原始输出来改进代码生成?我们通过简单自蒸馏(SSD)给出肯定的答案:从具有特定温度和截断配置的模型中抽取样本解决方案,然后使用标准监督微调对这些样本进行微调。 SSD 在 LiveCodeBench v6 上将 Qwen3-30B-Instruct 从 42.4% 提高到 55.3% pass@1,收益主要集中在更难的问题上,并且它在 4B、8B 和 30B 规模的 Qwen 和 Llama 模型上进行了推广,包括......
CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning
检索增强生成(RAG)利用外部知识增强了大型语言模型(LLM),但仍然受到长上下文和不相交的检索生成优化的影响。在这项工作中,我们提出了 CLaRa(连续潜在推理),这是一个在共享连续空间中执行基于嵌入的压缩和联合优化的统一框架。为了获得语义丰富且可检索的压缩向量,从而减少输入生成器的文档长度,我们引入了 SCP,一种基于问答和释义的密钥保留数据合成框架......
TuxBot v3: The IoT Botnet Built With AI – Bugs, Disclaimers and All
TuxBot v3,一个适用于 17 种架构的人工智能构建的物联网僵尸网络,附带了开发人员从未删除的 LLM 错误和安全免责声明。 Palo Alto Networks 的 Unit 42 发现了一个先前未记录的模块化 IoT 僵尸网络框架,称为 TuxBot v3 Evolution,它具有一个不寻常的细节:开发人员使用大型语言模型来编写重要部分 [...]