OctoNews

今天折腾三台机器,累到不行。

技术和认知提升大模型

今天折腾三台机器,累到不行。

跑的是 Qwen3.6 27B,context 全放 256k,测了几个组合:

1️⃣ RTX Pro 6000 + Intel B70(1200w)
B70 跑 Gemma 4 12B,速度很快,还没仔细测

2️⃣ RTX 5060 Ti × 3(1000w / 48GB)
12-17 tok/s,跑 Claude Code CLI 体感够用,不卡顿

3️⃣ RTX 4080 + 5070(1200w / 28GB / cxt 140k)
意外的强:22-27 tok/s,本来以为 PCIe 带宽会拖后腿

先睡了。

补充:

第一台: RTX Pro 6000 94GB Qwen3.6 27B Q8 cxt win 256k 至少有 50-70 tok/s

Intel B70 32GB
Qwen3.6 27B Q4 cxt win 256k
速度大约 7 tok/s

第二台:
RTX 5060 Ti × 3 = 48GB
Qwen3.6 27B Q4 cxt win 256k — 出 token 13-17 左右

第三台:

RTX 5070 12GB + RTX 4080 16GB = 28GB 目前还在组装 256k 预计 token 也在 10-20 附近

Intel B70 有可能拿来跑 agent 用的小模型,例如 Gemma 4 12B,晚一点测试。