AI资讯

Qwen3.6-35B-A3B在llama.cpp上的部署与性能测试

本文详细介绍了Qwen3.6-35B-A3B模型在llama.cpp框架下的部署过程,包括MoE架构、推理速度、显存占用等方面的测试结果。

AI云图智寻编辑部2026-08-05 08:17
阅读时间:约 2 分钟访问0
Qwen3.6-35B-A3B在llama.cpp上的部署与性能测试
研究人员通过llama.cpp框架成功部署了Qwen3.6-35B-A3B模型,并对其进行了详细的性能测试。该模型总参数量为35B,但每个Token仅激活约3B参数,展示了其在不同配置下的显存占用和推理速度。

MoE架构解析

Qwen3.6-35B-A3B模型采用了Mixture of Experts(MoE)架构,将一个巨大的神经网络拆解为多个独立的子网络(专家),并配有一个“路由器”。路由器根据输入Token决定哪几个专家最适合处理当前上下文。每个Token仅激活约3B参数,显著减少了计算量。模型的具体参数包括:总参数量35B,隐藏层维度2048,层数40。这种架构使得模型在保持高参数量的同时,能够高效地进行推理。

显存占用与推理速度测试

研究者对Qwen3.6-35B-A3B模型在不同配置下的显存占用和推理速度进行了测试。结果显示,在使用单张RTX 3090显卡的情况下,通过调整KV Cache的量化精度和卸载部分权重到CPU上,可以有效降低显存占用。例如,在f16精度下,随着ncmoe参数的增加,显存占用显著减少。此外,推理速度也得到了提升,特别是在高上下文长度下,Qwen3.6-35B-A3B模型的推理速度远高于同系列的Qwen3.6-27B模型。

llama.cpp对MoE的支持

llama.cpp框架提供了多种支持MoE模型的功能,包括运行高度量化的MoE模型(如q4_0, q8_0等)。通过ncmoe参数,可以将前N层的MoE权重卸载到CPU,从而降低GPU显存占用。此外,ctk和ctv参数可以控制KV Cache的量化精度,进一步优化显存使用。这些功能使得用户能够在有限的硬件资源下,更灵活地部署和使用大型MoE模型。