← 文章 / AI技术
NVIDIA 开发者博客 4小时前 · 2026-08-31 18:43:00 · 10 阅读

在 NVIDIA GB300 NVL72 上探索 Qwen3.8-Flash-Next 的 Agentic Coding

Alibaba 发布了 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 架构预览版,供开发者试用和评估。该模型采用多模态混合专家(MoE)架构,由一个 125B 参数的主模型和额外的 51B N-gram embeddings 组成,每个 token 激活 6B 参数。模型原生支持 262,144-token 上下文窗口,借助 YaRN 可扩展至 1M tokens。

NVIDIA 通过 SGLang、vLLM 和 NVIDIA TensorRT LLM 提供尽力而为的 Day 0 功能支持,并在 NVIDIA GB300 NVL72 上完成推理验证,同时通过 NVIDIA NeMo AutoModel 和 NVIDIA NeMo RL 提供后训练方案。

面向长上下文推理的架构创新

Qwen3.8-Flash-Next 面向 Agentic Coding、文档处理和工具驱动工作流等高吞吐、上下文密集型应用。随着上下文变长,注意力计算和 KV cache 内存会逐渐成为瓶颈。为此,模型采用 Gated DeltaNet(GDN)与 Qwen Sparse Attention(QSA)相结合的混合架构。每四层中有三层使用 GDN,将历史上下文持续压缩为固定大小的循环状态,从而避免序列增长带来的 KV cache 膨胀;剩余一层使用 QSA,在完整上下文中进行精确检索。

以往的稀疏注意力方案依赖 token 级索引器,而上下文越长,索引成本就越高。QSA 会先将序列聚合为多个微区块,在区块级别评估其重要性,再仅选择最相关的区域。这样可以降低每层的注意力计算、整体计算量和索引开销,也更适合 GDN 与 QSA 交替堆叠的架构。

Alibaba 公布的基准测试显示,QSA 可以提升 1M-token 工作负载的效率。与全注意力相比,其注意力 kernel 在预填充阶段最高提速 7.6 倍,在解码阶段最高提速 4.9 倍。在上下文长度为 1M tokens、前缀缓存命中率为 90%的高缓存占用在线服务测试中,Qwen3.8-Flash-Next 的预填充吞吐量达到 Qwen3.7-Plus 的 8.6 倍

A diagram showing how GDN and QSA with MoE reduce memory and compute for large-context inference.
图 1. Qwen3.8-Flash-Next 架构概览:包含三层 GDN 和一层结合 MoE 的 QSA,可降低长上下文推理的内存与计算开销
视频 1. Qwen3.8-Flash-Next 自动诊断并修复 Bug

在 NVIDIA GB300 NVL72 上运行 Qwen3.8-Flash-Next

GB300 NVL72 采用机架级架构,将 72 个 NVIDIA Blackwell Ultra GPU 集成到同一平台中。其由 72 个 GPU 构成的大型 NVIDIA NVLink 域支持 130 TB/s 的高效全互联通信,避免了专家流量跨越传统商用网络时可能出现的瓶颈。在 NVIDIA GB300 NVL72 上运行时,每个 GPU 的吞吐量超过 16K tokens/秒,每位用户的吞吐量超过 200 tokens/秒,让开发者能够以高吞吐、低延迟的方式探索智能体编程应用。 

A chart showing Qwen3.8-Flash-Next FP8 performance on NVIDIA GB300 NVL72 throughput vs. interactivity using TensorRT -LLM.
图 2. Pareto 曲线显示,Qwen3.8-Flash-Next 在 NVIDIA GB300 NVL72 上的峰值吞吐量超过每个 GPU 16K tokens/秒 

除了机架级部署,Qwen3.8-Flash-Next 也能运行在本地 NVIDIA 硬件上,包括 NVIDIA DGX Station、NVIDIA DGX Spark 集群,以及配备四块 NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition GPU 的工作站。开发者可以先在本地硬件上原型验证和评估智能体编程工作流,再将同一模型扩展到 GB300 NVL72 上进行生产部署。 

对 Qwen3.8-Flash-Next 进行后训练,并使用你偏好的推理引擎提供服务

开发者可以使用 NVIDIA NeMo AutoModel 针对特定领域微调模型。这是一个原生支持 PyTorch 的微调库,并在模型发布首日提供 Hugging Face checkpoint 支持。无需转换模型,即可直接基于现有 checkpoint 训练,同时支持完整 SFT 和更节省显存的 LoRA 微调。用户还可以进一步使用 NVIDIA NeMo RL recipes 进行强化学习。

NVIDIA 提供多种推理方案,满足开发者的不同需求。SGLangvLLMTokenSpeed 都提供开源推理配置,方便开发者在 NVIDIA 加速平台上更灵活地控制性能。

开始使用 Qwen3.8-Flash-Next

前往 QwenCloud 体验该模型。

你可以从 Hugging FaceModelScope 下载模型权重。

原始来源: NVIDIA 开发者博客

评论 (0)