详细内容或原文请订阅后点击阅览
VibeCoding 法学硕士在硬件及其自己的流程方面撒谎:当天的笑声
Vibecoding 幻觉,一个非常困惑的人类/克劳德/作品试图描述我的 MacStudio 上发生的事情。人工智能内部可以编写代码、误读顶部并产生幻觉……
来源:Brad DeLongVibecoding 幻觉,一个非常困惑的人类/克劳德/作品试图描述我的 MacStudio 上发生的事情。在人工智能内部,它可以编写代码,误读顶部,并对你的硬件产生幻觉。最先进,但自我意识为零:如果这就是 Anthropic 所说的具有“灵魂”的意识 AGI,那么现在就简称 Anthropic 吧!
我想这是我应得的。尝试在性能严重不足的硬件上运行近前沿模型(即使是高度量化和“提炼”的模型)是一件愚蠢的事。一年前,我有一些额外的研究预算,我认为我应该用它来购买面向未来的台式机。但它是一款合理的、面向未来的桌面,而不是一个过于强大的桌面。
哈!未来就是现在!被压倒是新的不足。
因此我尝试对其进行调整,使其既能快速响应简单的查询,又能保持管道相当满。这需要我真正了解负载和负载平衡。然后事情就走下坡路
分享
一个进程看起来非常滞后。所以我启动了另一个来帮助我查看系统。
因此我开始交换:
现在 macstudio 上的 cpu、gpu 和 npu 核心的状态如何?他们被锤打了吗?
现在的情况是:
CPU:平静 — 整个系统大约 19% 繁忙(80% 空闲)。 Ollama 运行程序的 CPU 利用率为 0%,这意味着它目前没有主动进行推断。
RAM:非常紧张。总共 192 GB 中已使用 184.6 GB,只有 1.1 GB 可用空间和 10.7 GB 压缩(交换)空间。仅 Ollama 运行程序在加载时就消耗了约 96 GB(总 RAM 的 50%)。
GPU/NPU:没有 sudo 就没有直接指标,但由于 Ollama 在 CPU 模式(不是 Metal GPU)下运行,GPU/NPU 核心基本上不参与其中。
实际问题:q4_K_M 处的 gemma4:26b 负载约为 96 GB — 仅用于模型权重,它就占了 Mac Studio RAM 的一半。这就是为什么说“pong”需要 131 秒。如果您希望 Hermes 可以通过 Telegram 使用,则 llama3.2:3b(快,约 2 GB)或将 Hermes 指向 API 提供商会更快响应。
