详细内容或原文请订阅后点击阅览
约束 SLM 狭义自动化优化的输出空间
本文将启动一系列关于 SLM 的狭义自动化优化,第一篇文章将介绍一种最有用的技术:限制输出空间而不是解析生成的文本。
来源:KDnuggets应用人工智能的大部分注意力都集中在前沿推理上;然而,工业中实际生产工作负载的很大一部分远没有那么吸引人:狭隘的自动化。属于此类别的任务包括正确路由支持票证、从表单中提取字段、标记文档以及标记记录以供人工审核。这些任务都有共同的特点:输入受限、输出空间固定、调用量巨大。它们也正是非常适合小语言模型 (SLM) 的任务类型。与对大型语言模型 (LLM) 的 API 调用相比,一个模型可以轻松地适合一个 GPU,甚至受 CPU 限制,并且能够在几毫秒内返回答案,这通常是正确的工程选择,而大型语言模型 (LLM) 的 API 调用的成本可能要高出千倍。
问题在于团队倾向于将前沿模型的习惯转移到小型模型上。他们编写长对话提示,让模型生成自由格式的文本,然后使用正则表达式进行搜索。他们从 Python 循环内部一次调用一次模型。对于本地 SLM,这些类型的低效率会加剧:当单个前向传递需要 10 毫秒时,围绕该前向传递的所有内容都会成为瓶颈;松散的输出处理直接转化为可测量的错误率。
本文将启动一系列关于 SLM 的狭义自动化优化,第一篇文章将介绍一种最有用的技术:限制输出空间而不是解析生成的文本。
为了建立公平的竞争环境,以下所有基准测试均通过 Hugging Face Transformers 在 float16 中使用 Qwen2.5-0.5B-Instruct,在配备 24GB RAM 和 16 核神经引擎的 M2 Macbook Air 上运行。
首先,设置 Python 环境并安装您的要求:
pip install torch Transformers 加速
为什么要限制输出空间?
解析自由文本
输出:
