vLLM团队于8月23日在官方博客发布了一篇超过9万字符的技术博文,系统性地展示了投机解码技术在AMD Instinct MI300X和MI355X GPU上的实测表现。这是首次公开的、针对AMD硬件平台的投机解码大规模基准测试,涵盖了五种不同的草稿生成方法和多个主流大语言模型家族。
投机解码的核心思想是:在标准自回归解码中,每一步只能生成一个新token,模型需要顺序执行多次推理才能产生完整的输出序列。投机解码通过引入一个轻量级的"草稿模型"同时预测多个候选token,再由目标模型在一次验证前向传播中批量接受或拒绝这些候选,从而在不改变输出质量的前提下显著提高解码吞吐量。
此次测试涵盖的五种草稿生成方法各有特色。原生MTP(多token预测)利用目标模型自身的多token预测头进行并行候选生成;Gemma 4 MTP则为Google Gemma 4系列模型提供的专用草稿助手;EAGLE-3基于目标模型的隐藏状态进行自回归草稿生成;DFlash从目标模型隐藏状态出发进行并行块级草稿生成;DSpark在DFlash基础上添加了轻量因果校正和基于置信度的前缀选择机制。
测试在两套AMD硬件平台上进行:第一套配备8块MI300X GPU(gfx942架构)和2颗AMD EPYC 9654 96核处理器;第二套配备8块MI355X GPU(gfx950架构)和2颗AMD EPYC 9575F 64核处理器。软件环境为ROCm 7.2.53211、vLLM 0.23.1开发版、PyTorch 2.11.0和Transformers 5.13.1。
模型测试覆盖了Google Gemma 4系列、阿里Qwen 3/3.5/3.6系列、MiniMax M3 MXFP8以及月之暗面Kimi K2.5等多个模型家族。测量指标包括输出token吞吐量、相对非投机基线的加速比、平均接受长度以及draft token接受率。结果表明,不同配置之间的性能表现存在显著差异:某些设置带来了可观的吞吐量提升,而另一些配置的加速比低于预期甚至低于未使用投机解码的基线。
在参数调优方面,vLLM团队建议从已知支持的配置开始,持续监控接受行为的变化,根据实际工作负载调整候选token数量和草稿模型设置。团队特别强调,投机解码的收益高度依赖于目标模型、草稿模型、提示词分布和采样参数的组合,不存在一种通用的最优配置,实测是目前唯一可靠的优化路径。
预训练草稿模型的可用性也在持续扩展。Google提供Gemma 4的MTP助手,Z-Lab维护了DFlash检查点集合,Red Hat AI开源了EAGLE-3、DFlash和DSpark多种草稿模型,而DeepSeek的DeepSpec项目则提供了配套的投机解码检查点。这些资源的逐步丰富降低了投机解码的部署门槛。
此次合作涉及AMD的Hongxia Yang和Peng Sun,以及Embedded LLM的Pin Siang Tan、Jun Kang Chow和Ye Hur Cheong。团队表示,未来工作将包括测试n-gram推测和后缀解码等非学习型方法,尤其是在代码编辑和智能体循环等token模式重复率较高的场景中进行更广泛的评估。
从产业竞争格局来看,投机解码在AMD硬件上的成熟度直接关系到AI推理市场的多元化进程。长期以来,NVIDIA凭借CUDA生态和TensorRT推理引擎在推理性能上保持显著领先,而ROCm生态的投机解码支持一直是AMD追赶路线图上的关键缺口。此次vLLM实测结果表明,在合适的模型和工作负载组合下,AMD MI300X和MI355X配合ROCm平台已经能够展现出具有竞争力的投机解码性能。随着ROCm 8.x版本对vLLM集成的进一步优化以及更多预训练草稿模型的开源,AMD有望在大规模LLM推理部署场景中缩小与NVIDIA的差距,为云服务商和企业提供更灵活的硬件选择。