深圳热线

阿里Qwen发布Qwen3.8-Flash-Next开源模型,采用Qwen4次世代架构 当前热议

2026-08-28 14:09:50 来源:字节漫游指南

阿里巴巴AI研究团队Qwen于2026年8月26日公开了AI模型Qwen3.8-Flash-Next。该模型使用Qwen4系列计划采用的次世代架构开发,在压低学习成本的同时实现了高性能。同一天,Unsloth也发布了对应的量子化版本。

面向极致成本效率的新架构

Qwen3.8-Flash-Next采用混合架构,整合了可高效压缩历史的Gated DeltaNet(GDN)、大幅降低注意力处理成本的Qwen Sparse Attention(QSA),以及能以少量追加计算扩展模型可表达词汇的N-gram Embedding。


(资料图)

模型总参数量为1250亿,激活参数量为60亿,N-gram Embedding参数量为510亿。标准状态下支持26万2144个token的上下文长度,通过扩展上下文的YaRN技术,最大可支持100万个token。

多项基准测试超越Claude-Opus-4.8

在Qwen3.8-Flash-Next、Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash-0731、Claude-Opus-4.8(Max)的基准测试对比中,Qwen3.8-Flash-Next在多数测试里超过了Claude-Opus-4.8(Max)。

训练效率同样突出。Qwen3.8-Flash-Next所需的训练时间仅为Qwen3.8-27B的九分之一。

长上下文处理速度显著提升

Qwen3.8-Flash-Next在长token处理时,能够抑制预填充和解码两端的吞吐量下降。以Qwen3.7-Plus为基准,在处理100万个token时,Qwen3.8-Flash-Next的速度是前者的8.6倍。

模型已作为开放模型在Hugging Face和ModelScope上公开。Unsloth的量子化版本也在发布当天上线,其中1bit版本可在配备75GB以上RAM的机器上运行,并保持全模型80%的精度。Unsloth文档称,即使加载到RAM中执行,也能实现与加载到VRAM时同等的性能。

正式版Qwen3.8-Flash将很快通过QwenCloud API提供,定价为每100万输入token 0.16美元,每100万输出token 0.47美元。

关键词: 基准 上下文 开源模型 系列模型 flash

热门推荐