使用 llama.cpp、DFlash 和 Pi 运行 Muse Glimmer 进行本地 Vibe 编码

使用 llama.cpp、DFlash 推测性解码和 Pi 在 RTX 3090 GPU 上本地运行 Muse Glimmer,以实现快速、私密、代理的 AI 编码。

来源:KDnuggets

Muse Glimmer 正在当地 AI 社区中引起关注,并被与 Qwen 的 27B 级模型进行比较。在许多情况下,它的性能更好,特别是对于本地编码和代理工作流程。

Meta 在开放模型领域看起来很强大,并且通过更多的迭代,这样的模型可以开始与专有系统紧密竞争。作为一名人工智能爱好者,能够在本地运行这种级别的人工智能是令人兴奋的。

在本指南中,我们将使用 llama.cpp 运行 Muse Glimmer,使用 DFlash 加速它,并将其连接到 Pi 进行本地振动编码。它将能够直接从终端构建、测试和调试项目。

1. 下载 Muse Glimmer

首先,从 Hugging Face 下载 Muse Glimmer 主模型及其 DFlash 绘图器。

安装 Hugging Face CLI:

curl -LsSf https://hf.co/cli/install.sh |巴什

echo 'export PATH="/root/.local/bin:$PATH"' >> ~/.bashrc

源〜/ .bashrc

登录:

hf 身份验证登录

创建模型目录:

mkdir -p /workspace/muse-glimmer

下载16.8 GB主模型:

hf 下载元模型/Muse-Glimmer-30B-GGUF \

缪斯-glimmer-30B-kquant-17gb.gguf \

--local-dir /workspace/muse-glimmer

下载 1.63 GB DFlash 起草器:

hf 下载元模型/Muse-Glimmer-30B-GGUF \

dflash-kquant.gguf \

--local-dir /workspace/muse-glimmer

两个文件都会保存在/workspace/muse-glimmer中。

2.安装并运行llama.cpp接下来,安装支持 CUDA 的 llama.cpp,并使用它通过 DFlash 草稿器为 Muse Glimmer 提供服务。安装并构建 llama.cpp:cd /工作区git 克隆 https://github.com/ggml-org/llama.cpp.gitcd 骆驼.cppgit pull origin 大师cmake -B 构建 -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=发布cmake --build 构建 --config Release -j$(nproc)ln -sf "$(pwd)/build/bin/llama-server" /root/.local/bin/llama-server检查安装:git pull origin mastercmake -B 构建 -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=发布cmake --build 构建 --config Release -j$(nproc)ln -sf "$(pwd)/build/bin/llama-server" /root/.local/bin/llama-server打开: