OctoNews

30B 的 agent 模型,宣称 24GB VRAM 就能跑?

技术和认知提升Agent开源

30B 的 agent 模型,宣称 24GB VRAM 就能跑?

Muse Glimmer 开源了(Apache 2.0,权重在 Hugging Face):规划、工具调用、自检、失败恢复内建。
4-bit 量化把内存压到 20GB 以下,还留空间给 KV cache 与 drafter。

本周起可走 ollama / LM Studio / vLLM / sglang 等路径,也兼容 llama.cpp、MLX。
自架 agent 的门槛又下一截——真假强弱仍以你机器上的实测为准。

模型卡在第二条。

huggingface.co/meta-models/Muse-Glimmer-30B