30B 的 agent 模型,宣称 24GB VRAM 就能跑?
30B 的 agent 模型,宣称 24GB VRAM 就能跑?
Muse Glimmer 开源了(Apache 2.0,权重在 Hugging Face):规划、工具调用、自检、失败恢复内建。
4-bit 量化把内存压到 20GB 以下,还留空间给 KV cache 与 drafter。
本周起可走 ollama / LM Studio / vLLM / sglang 等路径,也兼容 llama.cpp、MLX。
自架 agent 的门槛又下一截——真假强弱仍以你机器上的实测为准。
模型卡在第二条。