VibeCoding 法学硕士在硬件及其自己的流程方面撒谎:当天的笑声

Vibecoding 幻觉,一个非常困惑的人类/克劳德/作品试图描述我的 MacStudio 上发生的事情。人工智能内部可以编写代码、误读顶部并产生幻觉……

来源:Brad DeLong
Vibecoding 幻觉,一个非常困惑的人类/克劳德/作品试图描述我的 MacStudio 上发生的事情。在人工智能内部,它可以编写代码,误读顶部,并对你的硬件产生幻觉。最先进,但自我意识为零:如果这就是 Anthropic 所说的具有“灵魂”的意识 AGI,那么现在就简称 Anthropic 吧!

我想这是我应得的。尝试在性能严重不足的硬件上运行近前沿模型(即使是高度量化和“提炼”的模型)是一件愚蠢的事。一年前,我有一些额外的研究预算,我认为我应该用它来购买面向未来的台式机。但它是一款合理的、面向未来的桌面,而不是一个过于强大的桌面。

哈!未来就是现在!被压倒是新的不足。

因此我尝试对其进行调整,使其既能快速响应简单的查询,又能保持管道相当满。这需要我真正了解负载和负载平衡。然后事情就走下坡路

分享

一个进程看起来非常滞后。所以我启动了另一个来帮助我查看系​​统。

因此我开始交换:

现在 macstudio 上的 cpu、gpu 和 npu 核心的状态如何?他们被锤打了吗?

现在的情况是:

CPU:平静 — 整个系统大约 19% 繁忙(80% 空闲)。 Ollama 运行程序的 CPU 利用率为 0%,这意味着它目前没有主动进行推断。

RAM:非常紧张。总共 192 GB 中已使用 184.6 GB,只有 1.1 GB 可用空间和 10.7 GB 压缩(交换)空间。仅 Ollama 运行程序在加载时就消耗了约 96 GB(总 RAM 的 50%)。

GPU/NPU:没有 sudo 就没有直接指标,但由于 Ollama 在 CPU 模式(不是 Metal GPU)下运行,GPU/NPU 核心基本上不参与其中。

实际问题:q4_K_M 处的 gemma4:26b 负载约为 96 GB — 仅用于模型权重,它就占了 Mac Studio RAM 的一半。这就是为什么说“pong”需要 131 秒。如果您希望 Hermes 可以通过 Telegram 使用,则 llama3.2:3b(快,约 2 GB)或将 Hermes 指向 API 提供商会更快响应。