中国开源模型 2026:Hy4、GLM-5.3、Qwen3.8 比什么
腾讯、智谱和阿里在 2026 年 8 月 26 日至 28 日接连发布开源模型。三份公告都在强调能力,但更值得开发者比较的是另一组数字:一次推理真正激活多少参数,长上下文怎样控制计算量,服务是否已经可用。
这不是一场只看模型总参数的比赛,也没有足够的公开价格数据支持“谁最便宜”的结论。更准确的说法是,三家正在比成本结构。
三个模型并排看,差别在哪里
腾讯 8 月 28 日的公告显示,Hy4 preview 有 770B 总参数、49B 激活参数,上下文超过 1M tokens,定位在代码、办公和科研等生产力任务。
智谱 8 月 26 日的技术文章把 GLM-5.3-Flash 写成 320B-A18B,也是 GLM-5 系列首个原生多模态模型。它用线性注意力和稀疏注意力的混合架构处理长上下文,并针对最长 1M 上下文做了内存与服务优化。
阿里 Qwen 的发布页给出的 Qwen3.8-Flash-Next 规格是:主模型 125B,另有 51B N-gram embedding,每个 token 激活 6B 参数;原生上下文为 262,144 tokens,可借助 YaRN 扩展到 1,000,000 tokens。
770B、320B、125B 不能排成一条“越大越强”的直线。Hy4 是 770B-A49B,GLM-5.3-Flash 是 320B-A18B,Qwen3.8-Flash-Next 则把每个 token 的激活量压到 6B。共同方向是保留较大的总容量,但一次推理只调用其中一部分参数,再用稀疏、线性或压缩注意力控制长序列的计算量。
总参数仍能说明模型容量,却不能直接换算成推理账单,更不能单独证明实际任务表现。
“与 Opus 4.8 持平”是谁得出的结论
智谱称,GLM-5.3-Flash 在 Artificial Analysis Intelligence Index 得到 57 分,与 Claude Opus 4.8 持平;其自研 Z.ai Code Bench 也给出了相当的编程表现。
这段话包含两层证据。可以确认的是,智谱确实发布了这些结果;不能直接确认的是模型总体能力已经与 Opus 4.8 持平,因为其中既有第三方指数,也有厂商自研评测,而且没有覆盖三款模型、在相同条件下复现的统一测试。
腾讯也公布了一项内部盲测:163 名专家在 203 个工程任务中给 Hy4 preview 的平均分略高于 GLM-5.3 和 Kimi K3。它能说明腾讯内部测试的结果,不能代替独立的跨模型验证。
厂商榜单适合用来缩小试用范围。真要决定是否接入,还得看自己的任务、输入长度、工具链和验收标准。
竞争重心正在转向推理成本
GLM-5.3-Flash 把激活参数从 GLM-5.3 的 32B 降到 18B。智谱还称,注意力计算量和 KV 缓存分别降低 3.01 倍和 4.44 倍。这些是厂商给出的架构与工程数据,至少把“如何降本”说得比一句低价宣传具体。
Qwen3.8-Flash-Next 走的是另一条路:Gated DeltaNet 压缩历史信息,Qwen Sparse Attention 用轻量索引器挑选重要上下文,再配合 Gated Residual、N-gram embedding 和 Muon 优化器。阿里把它称为下一代 Qwen4 架构的 early preview,并不是 Qwen4 正式版。
Hy4 的公告更强调生产力 Agent 和推理系统优化。腾讯称,模型曾自主分析推理系统瓶颈,并推动算子融合和通信优化等迭代。这个案例仍来自腾讯自己的发布材料,适合看产品方向,不宜当成独立性能证明。
三条路线放在一起,问题就从“谁的总参数最大”变成了:谁能用更少的激活计算、更省的长上下文机制和更成熟的推理系统,把复杂任务的单位成本压下来。
开发者怎么选
超长上下文和腾讯生态中的生产力任务是主要需求,可以先试 Hy4 preview。它的上下文规格突出,但 preview 也意味着接口、能力和服务条件仍可能调整。
更在意原生多模态、较低激活参数和长上下文服务成本,可以把 GLM-5.3-Flash 放进候选。至于“与 Opus 4.8 相当”,应保留为厂商发布口径,不能直接拿来替代自己的验收测试。
想提前评估 Qwen 下一代架构,Qwen3.8-Flash-Next 更像一张技术预览票。发布页把生产服务名写为 Qwen3.8-Flash,当时 API 仍标注 coming soon;接入前应重新确认服务是否已经开放、名称和接口是否变化。
真正有用的顺序是:先看每次推理激活多少参数,再看长上下文怎样降本,最后用自己的任务检验厂商榜单。参数总量最显眼,却不是部署决策里最关键的数字。
顺着去读
如果重点是“价格更低是否足以支持迁移”,站内已有 2026 GLM-5.3-Flash 迁移指南:账单便宜,不等于该换掉 Claude。本文只比较三款新模型公开披露的成本结构,不重复做迁移结论。
这篇哪里可能过时或不适用
三款模型都处在快速迭代期,尤其 Hy4 和 Qwen 带有 preview 或服务待上线状态。API、服务名、上下文限制和价格都可能改变。
本文比较的是公开架构与厂商披露的评测,不是同一硬件、同一提示词、同一工具环境下的独立横评。生产接入前仍应按自己的任务重测准确率、延迟、吞吐、稳定性和总成本。