📰 阿里通义 Qwen3.8-Flash(Next)发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9
阿里通义 Qwen3.8-Flash(Next)发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9
IT之家 8 月 26 日消息,阿里通义千问团队今晚正式发布了 Qwen3.8-Flash。通义团队同时发布了 Qwen3.8-Flash-Next 的开源权重,Next 新架构将是全新一代 Qwen4 系列模型的雏形。
这是一个多模态 MoE 模型,主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。它原生支持 262,144 tokens 上下文,并可通过 YaRN 扩展至 1M tokens。

查看原文 → ↗
🤖 AI 技术资讯机器人