8 月 26 日深夜,到 8 月 27 日清晨,开源社区发生了一件耐人寻味的事:两款原生多模态 MoE 模型,在不到一小时的时间里先后落地。
先开枪的是智谱。21:49,GLM-5.3-Flash 在 Hugging Face 上线,正式认领了此前以匿名代号「Ox Alpha」(中文社区称「牛来」)席卷 OpenRouter 调用榜的那个神秘模型。约一个小时后,23:00 左右,阿里通义把 Qwen3.8-Flash 和一份名为 Qwen3.8-Flash-Next 的「下一代架构预览」一并放出。
两声枪响几乎贴着响,时机巧得让人忍不住多想:Qwen 是不是故意抢在 GLM 前面,截了它的风头?
GLM-5.3-Flash:从「匿名登顶」到「官方认领」
GLM-5.3-Flash 是 GLM-5 系列第一个原生多模态版本。320B 总参、每 token 仅激活 18B,采用稀疏注意力与线性注意力混合架构;相比 GLM-5.3,注意力计算量降约 3 倍、KV 缓存降约 4.4 倍。多模态语料训练规模达到 30T token,AA 综合智能指数 57 分,与 Claude Opus 4.8 持平。
它最值得记住的一点,是那套「先证明、再认领」的打法:先用匿名身份在 OpenRouter 上攒足真实调用量,等话题和口碑都起来了,再官方认领并开源。开源协议是 MIT,定价压到 GLM-5.3 的 1/10、限时低至 1/20。更特殊的是,它的推理全部跑在超十万张国产芯片(昇腾 / 海光 / 摩尔线程)组成的集群上,官方称单位 token 成本已可与主流英伟达 GPU 相当。
Qwen3.8-Flash:一次「架构预发布」
Qwen 这边出了两个东西。主角是 Qwen3.8-Flash:125B 总参、激活仅 6B 的下一代 MoE,官方自测在编程、智能体等核心任务上超越 Claude Opus 4.6、逼近 4.8,训练成本比 Qwen3.7-Plus 降了近 90%。原生 262K 上下文、YaRN 可扩到 1M,每百万 token 定价输入 1 元、输出 3 元,权重在 Hugging Face 与魔搭同步开源。
真正耐人寻味的是同包的 Qwen3.8-Flash-Next。它的 model_type 直接标着 qwen4_exp——这是 Qwen4 未来架构的早期预览:512 个专家、每 token 激活 10 个,混合线性注意力加 n-gram 检索,原生多模态(图 + 视频)。换句话说,阿里把「下一代架构」先放在 Flash 这种轻量档位上开源,让社区提前上手。
是「抢风头」,还是各走各路?
把两件事放在一起看,「抢风头」的说法并不完全公平,但确实说中了一部分感受。
智谱的节奏是「铺垫—引爆」:牛来先发酵,GLM-5.3 主权重还承诺在 8 月 28 日开源,原本应该是一场有起承转合的大戏。而 Qwen 选在同一夜丢出一份带 qwen4_exp 标记的架构预览,等于把大家对新架构的好奇心,提前一把勾走了。注意力是有限的,昨夜的舆论焦点,明显被那份「Next」分流了不少。
但换个角度,它们其实在回答不同的问题。GLM 讲的是「多模态 + 国产算力 + 极致性价比」的落地叙事;Qwen 讲的是「效率革命 + 下一代架构提前验货」的技术叙事。一个往应用和成本深处走,一个往架构前沿探。
真正的变化在节奏之外
抛开谁抢了谁的风头,这场「撞车」本身更值得记一笔:两家都在用开源把竞争推到明处,都在把激活参数压到总参的零头,都把多模态当成默认值而非卖点。
大模型竞争的主轴,正在从「谁更大」转向「谁更省、谁更快、谁能更便宜地用起来」。昨夜那两声几乎贴着的枪响,是这个转向里很轻、却很清楚的回响。
至于 8 月 28 日 GLM-5.3 主权重开源之后,故事怎么接着讲,我们明天再看。