Qwen3.8-27B采用稠密(Dense)架构,全部参数参与每次Token计算,在保障模型能力密度的同时,具备良好的部署友好性。
在Attention层,Qwen3.8-27B采用Gated DeltaNet(GDN)与标准Attention相结合的混合线性注意力架构,64层中48层为GDN、16层为Full Attention,每4层按"3×GDN + 1×Attention"交替排列,兼顾长序列处理效率与上下文建模能力。
同时,Qwen3.8-27B原生集成视觉编码器,支持图像与视频理解,视觉Token与文本Token统一进入语言模型处理,对多模态融合推理路径提出了更高要求。
基于昇腾实现Qwen3.8-27B的推理部署
昇腾持续深耕大模型推理关键技术,从GDN融合算子优化,到W8A8量化、MTP与ACL Graph,昇腾不断完善面向前沿模型架构的高性能推理能力,通过vLLM-Ascend开源推理引擎实现Qwen3.8-27B在昇腾AI基础软硬件上的高效部署。
线性注意力优化:GDN融合算子
Qwen3.8-27B的64层中,将48层非线性Attention演变成了Linear Attention,打破了长序列下O(n²)的复杂度,其采取的Linear Attention算法是业界最领先的Gated Delta Net(GDN),它融合了Mamba与Delta Net算法,可以兼顾全局衰减的同时,建立单键值替换的逻辑。
针对GDN的计算特点,vLLM-Ascend在Prefill阶段采用GDN融合算子,以Chunk方式高效处理长序列,并融合关键计算过程,减少中间数据搬运和算子调度开销。
W8A8量化:提升推理计算效率
相较于超大规模MoE模型以量化降低显存压力,27B稠密模型的量化核心目标在于提升推理性能。vLLM-Ascend支持Qwen3.8-27B的W8A8量化部署,将权重与激活值从BF16量化至8-bit,降低访存带宽开销与计算量,充分发挥昇腾NPU的INT8/MXFP8算力,在兼顾模型精度的同时,提升Prefill与Decode阶段的执行效率。
MTP投机推理:加速Decode生成
ACL Graph:降低Decode调度开销
注:本文转自华为计算,版权归作者所有
.png)



沪公网安备 31010702006392号