在 NVIDIA GB300 NVL72 上探索 Qwen3.8-Flash-Next 的 Agentic Coding
Alibaba 发布了 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 架构预览版,供开发者试用和评估。该模型采用多模态混合专家(MoE)架构,由一个 125B 参数的主模型和额外的 51B N-gram embeddings 组成,每个 token 激活 6B 参数。模型原生支持 262,144-token 上下文窗口,借助 YaRN 可扩展至 1M tokens。
NVIDIA 通过 SGLang、vLLM 和 NVIDIA TensorRT LLM 提供尽力而为的 Day 0 功能支持,并在 NVIDIA GB300 NVL72 上完成推理验证,同时通过 NVIDIA NeMo AutoModel 和 NVIDIA NeMo RL 提供后训练方案。
面向长上下文推理的架构创新
Qwen3.8-Flash-Next 面向 Agentic Coding、文档处理和工具驱动工作流等高吞吐、上下文密集型应用。随着上下文变长,注意力计算和 KV cache 内存会逐渐成为瓶颈。为此,模型采用 Gated DeltaNet(GDN)与 Qwen Sparse Attention(QSA)相结合的混合架构。每四层中有三层使用 GDN,将历史上下文持续压缩为固定大小的循环状态,从而避免序列增长带来的 KV cache 膨胀;剩余一层使用 QSA,在完整上下文中进行精确检索。
以往的稀疏注意力方案依赖 token 级索引器,而上下文越长,索引成本就越高。QSA 会先将序列聚合为多个微区块,在区块级别评估其重要性,再仅选择最相关的区域。这样可以降低每层的注意力计算、整体计算量和索引开销,也更适合 GDN 与 QSA 交替堆叠的架构。
Alibaba 公布的基准测试显示,QSA 可以提升 1M-token 工作负载的效率。与全注意力相比,其注意力 kernel 在预填充阶段最高提速 7.6 倍,在解码阶段最高提速 4.9 倍。在上下文长度为 1M tokens、前缀缓存命中率为 90%的高缓存占用在线服务测试中,Qwen3.8-Flash-Next 的预填充吞吐量达到 Qwen3.7-Plus 的 8.6 倍。
在 NVIDIA GB300 NVL72 上运行 Qwen3.8-Flash-Next
GB300 NVL72 采用机架级架构,将 72 个 NVIDIA Blackwell Ultra GPU 集成到同一平台中。其由 72 个 GPU 构成的大型 NVIDIA NVLink 域支持 130 TB/s 的高效全互联通信,避免了专家流量跨越传统商用网络时可能出现的瓶颈。在 NVIDIA GB300 NVL72 上运行时,每个 GPU 的吞吐量超过 16K tokens/秒,每位用户的吞吐量超过 200 tokens/秒,让开发者能够以高吞吐、低延迟的方式探索智能体编程应用。
除了机架级部署,Qwen3.8-Flash-Next 也能运行在本地 NVIDIA 硬件上,包括 NVIDIA DGX Station、NVIDIA DGX Spark 集群,以及配备四块 NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition GPU 的工作站。开发者可以先在本地硬件上原型验证和评估智能体编程工作流,再将同一模型扩展到 GB300 NVL72 上进行生产部署。
对 Qwen3.8-Flash-Next 进行后训练,并使用你偏好的推理引擎提供服务
开发者可以使用 NVIDIA NeMo AutoModel 针对特定领域微调模型。这是一个原生支持 PyTorch 的微调库,并在模型发布首日提供 Hugging Face checkpoint 支持。无需转换模型,即可直接基于现有 checkpoint 训练,同时支持完整 SFT 和更节省显存的 LoRA 微调。用户还可以进一步使用 NVIDIA NeMo RL recipes 进行强化学习。
NVIDIA 提供多种推理方案,满足开发者的不同需求。SGLang、vLLM 和 TokenSpeed 都提供开源推理配置,方便开发者在 NVIDIA 加速平台上更灵活地控制性能。
开始使用 Qwen3.8-Flash-Next
前往 QwenCloud 体验该模型。
你可以从 Hugging Face 或 ModelScope 下载模型权重。