阿里巴巴发布了Qwen3.8-Flash-Next的模型权重,作为即将推出的Qwen4架构的预览版,供开发者实验和评估。这是一个多模态混合专家(MoE)模型,主模型参数量为1250亿,另附510亿N-gram嵌入参数,每个Token激活60亿参数。模型原生支持262,144 Token的上下文窗口,通过YaRN可扩展至100万Token。
NVIDIA通过SGLang、vLLM和NVIDIA TensorRT LLM提供Day 0功能支持,在NVIDIA GB300 NVL72上完成推理验证,并提供来自NVIDIA NeMo AutoModel和NVIDIA NeMo RL的后训练方案。
Qwen3.8-Flash-Next专为高并发、上下文密集型应用场景设计,包括智能体编程、文档处理和工具驱动工作流。随着上下文增长,注意力计算和KV缓存内存会成为瓶颈。该模型通过结合门控DeltaNet(GDN)与Qwen稀疏注意力(QSA)的混合架构来解决这两个问题。每四层中有三层使用GDN,将历史上下文持续压缩为固定大小的循环状态,消除序列增长带来的KV缓存膨胀;剩余一层使用QSA,在完整上下文中进行精确检索。
此前的稀疏注意力方案依赖Token级索引器,随上下文增长计算开销急剧上升。QSA将序列聚合为微块,在块级别估算重要性,仅选取最相关的区域,从而降低每层的注意力计算和索引开销,非常适合GDN与QSA交替的架构设计。
阿里巴巴公布的基准测试显示,QSA可显著提升百万Token工作负载的效率。与全量注意力相比,其注意力内核在预填充阶段实现最高7.6倍加速,解码阶段实现4.9倍加速。在100万Token上下文长度、90%前缀缓存命中率的在线服务测试中,Qwen3.8-Flash-Next的预填充吞吐量达到Qwen3.7-Plus的8.6倍。
GB300 NVL72采用机架级架构,将72块NVIDIA Blackwell Ultra GPU集成于单一平台。其72 GPU规模的NVIDIA NVLink域以130 TB/s的带宽支持高效全互联通信,消除了专家流量跨越传统网络时产生的瓶颈。在NVIDIA GB300 NVL72上运行,每GPU每秒可处理超过16,000个Token,每用户每秒超过200个Token,使开发者能够以高吞吐、低延迟的方式实验智能体编程应用。
除机架级部署外,Qwen3.8-Flash-Next还支持本地NVIDIA硬件运行,包括NVIDIA DGX Station、NVIDIA DGX Spark集群,以及配备四块NVIDIA RTX PRO 6000 Blackwell Max-Q工作站版GPU的工作站。开发者可在本地硬件上完成智能体编程工作流的原型验证,再将同一模型扩展至GB300 NVL72进行生产部署。
开发者可使用NVIDIA NeMo AutoModel对模型进行领域专项微调,这是一个原生PyTorch微调库,支持Day-0 Hugging Face检查点,无需模型转换即可直接在现有检查点上训练,支持完整SFT或内存高效的LoRA微调。用户还可进一步使用NVIDIA NeMo RL方案执行强化学习。
NVIDIA支持多种推理栈以满足不同开发需求。SGLang、vLLM和TokenSpeed为需要更精细性能控制的开发者提供开源推理方案,均运行于NVIDIA加速平台之上。
Q&A
Q1:Qwen3.8-Flash-Next是什么类型的模型?有哪些核心参数?
A:Qwen3.8-Flash-Next是阿里巴巴发布的多模态混合专家(MoE)模型,主模型参数量1250亿,附加510亿N-gram嵌入参数,每个Token激活60亿参数。原生支持262,144 Token上下文窗口,通过YaRN可扩展至100万Token,定位于高并发、上下文密集型应用场景。
Q2:Qwen稀疏注意力(QSA)相比传统稀疏注意力有什么优势?
A:传统稀疏注意力依赖Token级索引器,上下文越长计算开销越大。QSA改为在块级别聚合序列并估算重要性,只选取最相关区域,大幅降低注意力计算和索引开销。实测显示,在100万Token场景下,预填充速度最高提升7.6倍,解码速度提升4.9倍,整体预填充吞吐量是Qwen3.7-Plus的8.6倍。
Q3:开发者如何对Qwen3.8-Flash-Next进行微调?
A:可使用NVIDIA NeMo AutoModel进行微调,该库基于原生PyTorch,支持Day-0 Hugging Face检查点,无需转换模型格式即可直接训练。支持完整SFT和内存高效的LoRA两种微调方式,还可通过NVIDIA NeMo RL方案进一步执行强化学习。