英伟达发布文章称,阿里巴巴最新预览模型Qwen3.8-Flash-Next已获GB300 NVL72平台支持。该模型总参数1760亿,每Token激活约60亿,原生支持26.2万Token上下文,可扩展至100万Token,面向长上下文Agent应用。采用混合架构降低计算与KV缓存开销,在GB300 NVL72上单GPU吞吐超1.6万Token/秒,单用户吞吐超200Token/秒,支持SGLang、vLLM等推理框架。
其他报道 (2条)