今天折腾三台机器,累到不行。
今天折腾三台机器,累到不行。
跑的是 Qwen3.6 27B,context 全放 256k,测了几个组合:
1️⃣ RTX Pro 6000 + Intel B70(1200w)
B70 跑 Gemma 4 12B,速度很快,还没仔细测
2️⃣ RTX 5060 Ti × 3(1000w / 48GB)
12-17 tok/s,跑 Claude Code CLI 体感够用,不卡顿
3️⃣ RTX 4080 + 5070(1200w / 28GB / cxt 140k)
意外的强:22-27 tok/s,本来以为 PCIe 带宽会拖后腿
先睡了。
补充:
第一台: RTX Pro 6000 94GB Qwen3.6 27B Q8 cxt win 256k 至少有 50-70 tok/s
Intel B70 32GB
Qwen3.6 27B Q4 cxt win 256k
速度大约 7 tok/s
第二台:
RTX 5060 Ti × 3 = 48GB
Qwen3.6 27B Q4 cxt win 256k — 出 token 13-17 左右
第三台:
RTX 5070 12GB + RTX 4080 16GB = 28GB 目前还在组装 256k 预计 token 也在 10-20 附近
Intel B70 有可能拿来跑 agent 用的小模型,例如 Gemma 4 12B,晚一点测试。