第一篇关键词检索结果

约束 SLM 狭义自动化优化的输出空间

Constraining Output Space for SLM Narrow Automation Optimization

本文将启动一系列关于 SLM 的狭义自动化优化,第一篇文章将介绍一种最有用的技术:限制输出空间而不是解析生成的文本。

后训练的两大支柱:强化学习和监督微调

The Two Pillars of Post-training: Reinforcement Learning and Supervised Fine-Tuning

这是Sharon Zhou培训后系列的第二篇文章。请在此处阅读第 1 部分。在本系列的第一篇文章中,您了解了培训后如何通过使法学硕士以某种方式表现来缩小其可用性的根本差距。在这篇文章中,您将探索可用于更改模型的 [...]

训练后介绍

Introduction to Post-training

这是有关后期培训的系列文章中的第一篇文章。跟随雷达。在培训后之前,法学硕士存在一个主要问题:几乎没有人可以使用它们。培训后的故事也是人工智能如何从研究好奇心变成约十亿人使用的产品的故事。训练后是[...]

2026 年 8 月星期五的电子链接:不仅仅是事实

August 2026 Friday’s e-links: More Than the Facts

对于我们 8 月的第一篇电子链接,我们建议您使用来自史蒂夫·鲍尔默 (Steve Ballmer) 的精心策划的、无党派的有关美国的事实来源。2026 年 8 月星期五的电子链接帖子:超越事实首先出现在 Econlife 上。