GLM-5.3-Flash 实测:80%、63.4、58.4 该怎么比
如果你是因为“80% 代码通过率”和“少约 3 倍 Token”才想把真实项目交给 Ox Alpha,先别把这两组数当采购结论。它们足以支持试用,还不足以证明模型能稳定托管生产代码。
名字也已经变了。OpenRouter 已把匿名模型 Ox Alpha 揭晓为 ZAI 的 GLM-5.3-Flash。旧代号只存在了很短的预览期,今天评估它时,应以正式模型和现行运行环境为准。
80% 的问题在样本量
最早流传的 80% DeepSWE 成绩来自 10 个任务的社区测试,整理页面也把它标为未经确认。十道题里多错一道,成绩就会跳 10 个百分点。这类小样本能告诉你“值得跑一轮”,证明不了稳定领先。
身份揭晓后,GLM-5.3-Flash 模型卡给出的 DeepSWE 成绩是 63.4。模型卡同时交代了运行条件:mini-swe-agent、temperature 0.95、top_p 1.0、6 小时超时和 400K 上下文。这是厂商提交到模型卡的结果,不应自动当成独立复现。
另一份公开社区复现跑完 113 个任务,结果为 66/113,也就是 58.4%。它使用 pier 0.3.1、mini-swe-agent 和 Docker 后端,整轮耗时约 20 小时 39 分。
80%、63.4 和 58.4 不能排成一条“模型退步曲线”。10 题测试的任务集就不同;后两次虽然都用了 mini-swe-agent,运行器、上下文和推理设置仍没有对齐。比较不同条件下的总分,最多能看到一个大致区间,不能给出稳定的胜负顺序。
58.4% 里混着两种失败
社区复现还有一层比总分更有用的信息:90/113 个任务完成了至少 90% 的 fail-to-pass 测试;11 个任务在连续三次没有正确发出工具调用后终止,占整个任务集约 9.7%。
这两种失败对使用者的含义不同。代码逻辑没做对,可能需要换模型或缩小任务;工具调用格式不稳,则可能通过更合适的 harness、约束输出或重试策略改善。总分把两者压成同一个零,采购时却不能这样算。
这份复现每题只跑一次,作者也明确提醒结果存在随机性。58.4% 精确描述这次完整运行;模型在其他代码库里的长期成功率仍需另测。
“少约 3 倍 Token”只来自一个任务
Cline 曾公布一个真实代码库 bug 的单例对比:Ox Alpha 和 Fable 都完成了修复,Ox 的输出 Token 约少 3 倍。现有可读证据是保留原帖内容的 Reddit 转贴,因此这条只能当社区单例看。
在那一个任务里,较少输出说明 Ox 少走了弯路。它不能外推成“所有任务都省 3 倍”,也不能证明输出越少越可靠。跨模块改动、脏代码库和边缘条件更看重遗漏率、回滚次数与人工复核时间。模型的 reasoning effort 也会改变 Token 消耗,单例对比没有把这些变量固定下来。
真正该测的是失败成本
公开代码、一次性脚本和可完全重跑的原型,可以把 GLM-5.3-Flash 当成候选。先看速度、上下文是否够用,再看它在你自己的测试集上能通过多少。
内部工具、非核心仓库和测试覆盖完整的功能开发,重点应放在连续任务的通过率、遗漏文件数、回滚次数和人工 review 时间。最好再把失败分成“逻辑没做对”和“工具没接好”,否则会把工程问题误判成模型能力上限。
生产代码、客户环境、权限、账务和安全模块则要按失败成本管理。榜单再高,也不该省掉自动测试、静态检查、人工 diff review 和最小权限。一次错误上线通常比 Token 昂贵得多。
分数之外,输入数据是否适合交给模型要单独判断。社区复现作者提醒,匿名免费模型可能记录提示词用于评估;这条提醒的证据层级低于平台条款,但风险处置很明确:没有确认数据条款之前,不要把客户代码、密钥和私密材料放进免费预览。
所以,Ox Alpha 留下的是一套实用的评测顺序:先看样本量,再看任务和 harness 是否一致,再看有没有重复运行,接着拆开失败原因,最后回到自己的失败成本。十道题的 80% 是试用理由;完整任务集和真实回归测试,才接近生产决策。
顺着去读
分数之外,迁移还要算价格和替换成本。站内已有GLM-5.3-Flash 迁移指南:账单便宜,不等于该换掉 Claude,以及腾讯 Hy4、智谱 GLM-5.3-Flash、Qwen3.8 怎么选:先看成本从哪省。