推測解碼在可負擔硬體上到底有沒有用?RTX 3090 / V100 / vLLM 的三組可重現 benchmark

在 llama.cpp + 消費級 Ampere 上,推測解碼對 MoE 沒有淨加速,即使草稿接受率 100%;同型的 3090 換到 vLLM + MTP 卻是 +27.5%。決定效益的是引擎與方法,不是硬體等級。

July 6, 2026 · 2 分鐘 · 蔡秀吉 Tsai Hsiu-Chi