【CNMO科技消息】8月27日,千问AI平台上线Qwen3.8-Flash模型,在编程、Agent等真实任务中达到极致性价比,最新价格为:输入每百万Tokens 0.8元,输出每百万Tokens 2.7元,缓存命中每百万Tokens 0.1元。
据CNMO科技了解,Qwen3.8-Flash是一个多模态混合专家(MoE)模型,采用了下一代(Next)模型架构,千亿总参数仅激活60亿(6B),创下模型效率的全球新基准。
该模型采用了与此前所有千问大模型完全不同的全新架构:
在注意力方面,引入独特的QSA(Qwen Sparse Attention)机制,形成与GDN高效融合的混合注意力架构,可显著降低计算开销,在高缓存命中的1M Tokens长上下文实际场景中可提速8倍以上,又准又快;
在模型内部分层通信方面,引入自研的Gated Residual方法,将传统Transformer的1条信息主通道拆分并拓展为4条,让模型可根据需求动态决定读写信息,信息传递更高效,训练也更稳定;
在模型参数扩展方面,引入51B的N-gram Embedding参数,为模型Transformer参数提供更高效的查表寻址,在每次token计算时无需参与,以极少的资源消耗“外挂”了一个大规模的 “记忆指南手册”,模型参数扩展效率更高;
在模型调参方面,模型结构和后期优化协同进行,收敛效率和训练吞吐大幅提升。