4款本地大模型实测:双5070 Ti跑出160 tok/s,谁才是性价比之王?
测试背景手头有一台 2×RTX 5070 Ti(32GB 显存)的机器,本地装了 4 个开源大模型: 模型 参数量 架构 量化 大小 gemma4-12B 12B Dense Q8_0 12GB gemma4-26B 26B (4B active) MoE Q4_K_XL 15GB Qwen3.5-27B 27B Dense AWQ 21GB Qwen3.5-9B 9B D