作为上一代王者游戏显卡,4090应该还在不少玩家的主机中运转着但负载还没吃饱吧。

本文就基于现今非常火热的用家用显卡部署本地大模型思路,看看这个前任王者显卡是否还能引领风骚?是否能给你的个人小龙虾openclaw、爱马仕hermes等自动化智能体场景提供无限子弹?

测试说明

本次使用了llama.cpp和vllm两种推理引擎来进行测试,vllm的部署可能有些折腾,所以着重测试了llama.cpp最新版。

另外还详细测试并对比了Qwen3.6系列的MTP、草稿小模型这两个投机采样加速方法,看看在速度方面是否满足你的场景需求。

注:相关细节与之前的测试文章一致,已了解的可以跳过这部分直接看速度分析。

测试模型为:

  • Qwen3.6-27B (Q4_K_M) (AWQ-4bit)
  • Qwen3.6-35B-A3B (Q4_K_M) (AWQ-4bit)
  • gemma-4-31B-it (Q4_K_M) (AWQ-4bit)
  • gemma-4-26B-A4B (Q4_K_M) (AWQ-4bit)

均为目前热门的30B参数级别开源本地大模型,由于显存限制,这里都采用4bit量化方法的模型,Q4_K_M量化为llama.cpp测试对象,AWQ-4bit是vllm的测试对象。

Vllm:0.20.2

llama.cpp:b9130

Gpu:4090

测试时,模型参数、kvcache等都放在gpu上,以达到最佳性能。

测试内容还是每次请求6个中文prompt(文本分别长度分别为1000,5000,10000,20000,40000,80000),用来模拟不同长度的上下文,然后让大模型生成最大200个token,这样就能测试出预填充prefill速度(即大模型理解分析上下文的速度)和生成token速度。

整体表现

经过较为全面的测试,提取了精准的多个维度132条数据来进行如下的分析对比。

下面先从整体出发,再逐个角度去看4090显卡的预填充和生成token速度。

先说结论,预填充速度惊人,27B模型的MTP加速很猛,不考虑智力要求很高但用来跑不生成大量内容的场景(如分析网页等输出简短场景)是完全没问题的,具体速度内容请往下看。

各模型在两个推理引擎下的整体表现如下:

这里,Vllm和llama.cpp跑的都是4bit量化模型,两种推理引擎适配量化的模型不同,分别是awq-4bit和Q4_K_M。

从上图可以看出预填充速度,只有Qwen3.6-27B两者差不多,其他模型都是vllm的预填充速度快很多,有的甚至快80%+。生成速度则差不多,互有胜负,除了Qwen3.6-35B-A3B的llama.cpp要稍微快一点之外。

草稿小模型投机采样

llama.cpp自带的草稿小模型功能,草稿小模型的选型要求很简单,和主力大模型是同样的tokenizer,再加上是模型大小明显要小即可,这里选用的是qwen3.6-0.8b-Q4_K_M和qwen3.6-2b-Q4_K_M两个,主力模型就只选了qwen3.6-27b-Q4_K_M。

先看看使用这两个草稿小模型后,速度如何?

其中,这两个模式的草稿投机token数设置:--spec-draft-n-max 8 --spec-draft-n-min 1,其他都为默认值,后文未提及参数均采用默认参数值。

表中的no-draft表示没有使用草稿小模型,作为参考。(下文同理)

从上面图表中可知,草稿小模型是能小幅提高大模型推理生成速度的,但这里因为draft-n-max设置的过大效果不是最佳的,下面有分析最佳draft-n-max参数的。

再来着重看看qwen3.6-2b-Q4_K_M作为草稿模型在不同的最大投机token数下的速度如何。

可看出,随着draft-n-max的增加,接受率在下降,当draft-n-max为8时,接受率下降太多影响到加速效果了,预填充速度相对于没用草稿模型有10%的下降,生成速度则很容易提升20%左右,但最高就很难了。

MTP投机采样效果分析

MTP即多token预测技术,大模型在生成token时一次生成多个token以实现生成加速。之前的deepseek-v3在预训练中就加入此项技术,MTP的预测token个数不是越多越好,因为预测出来的多个token还要通过主力模型的接受检验才会被使用,接受率低的话会拉低加速效果。

先看看qwen3.6-27b-Q4_K_M在MTP的token最大数为1/2/3/4时的速度情况。

可以了解到,随着mtp-n-max的增加,接受率下降,但模型的生成速度提升很大,很容易提升100%,如果此时的模型能力OK,是能让其生成较长内容场景的。预填充速度大致有10%的下降,但近2000t/s的预填充速度其实能覆盖很多场景了,10%的下降没什么影响。

再看看Qwen3.6-35B-A3B-Q4_K_M在MTP的token最大数为1/2/3/4时的速度情况。

对于Qwen3.6-35B-A3B-Q4_K_M,采用MTP后,预填充速度普遍下降了14%左右,生成速度提升18%左右。都不是很明显下降或提升,后面会对这些不同mtp-n-max数测试其模型能力下降程度,然后可以决定是否采用这个模型的MTP模式。

总结

如果跟之前评测过的V100显卡来对比的话(详见>>),4090的预填充prefill速度太过恐怖了(快了8+倍),token生成速度也提升很多,qwen3.6-27b提升50%,Moe架构的qwen3.6-35b-a3b则提升了100%。

整体上,4090跑这些模型的预填充速度都是很快的,vllm下会更快,生成速度多数模型的两个推理引擎上相差不多,但MTP对Qwen3.6-27B-Q4_K_M提升很明显,草稿小模型进行投机采样提升却不大。

好了,看完上面的速度测试,你是否有想部署本地大模型来养各种龙虾的冲动呢?

以上是我个人的测试,能力有限可能有些地方需要改进,还请在评论区告知。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐