Back to News

Zhipu AI open-sources GLM-5.3-Flash, a 320B multimodal model priced at 1/40 of Claude Opus 4.8

1126 points · 573 comments#glm-5.3-flash#open-weight#multimodal#zhipu-ai

Zhipu AI released and open-sourced GLM-5.3-Flash, the first natively multimodal model in the GLM-5 series, with 320B total parameters (18B active). It scores 57 on the Artificial Analysis Intelligence Index, matching Claude Opus 4.8, and is priced at one-tenth of GLM-5.3, or one-fortieth of Opus 4.8. The model uses a hybrid sparse and linear attention architecture, runs on domestic Chinese chips, and was tested anonymously as Ox-Alpha on OpenRouter and OpenCode.

Coverage timeline

  1. Hacker Newsed-is-ai
  2. 智谱 Research

    今天,我们上线并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列的首个 原生多模态模型 。 大家好像已经习惯将前沿智能与前沿价格绑定,并认为这是技术进步必须支付的成本。今天,GLM-5.3-Flash来了:320B总参数,能力超过GLM-5.2,在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中取得 57分 ,进入全球前沿模型能力区间,与Anthropic最受欢迎的模型Claude Opus 4.8得分持平。在自研Z.ai Code Bench体感评估中,其编程表现与Claude Opus 4.8相当。 与此同时,GLM-5.3-Flash定价为1/10的GLM-5.3,限时折扣内为1/20的GLM-5.3,为Opus 4.8的1/40。同样智力,1/40价格,前沿智能,第一次不需要省着用。 为收集广大用户的广泛、专业反馈,我们在正式发布前,以匿名模型 Ox-Alpha (中文社区称作牛来)在OpenCode和OpenRouter上进行了大规模测试。Ox-Alpha迅速成为当周最受欢迎的模型,创下双平台调用量新高。 而这些请求流量全部由国产芯片提供算力支持。 GLM-5.3-Flash在各项基准测试和实际使用中,全面超越参数量高出一倍的GLM-5.2,定价却仅为后者的1/10。这得益于其全新模型架构。GLM-5.3-Flash的架构专为极低成本而设计,总参数量与GLM-4.5相当(355B vs. 320B),但激活参数量(32B → 18B)与层数(92 → 45)几乎减半。结合我们最新的30T Token多模态预训练语料,GLM-5.3-Flash能够以更少的计算资源实现更强的性能。 GLM-5.3-Flash同时进行了多项架构升级,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保持精准长上下文能力的同时,大幅降低长上下文服务成本;并采用流形约束超连接(Manifold-Constrained Hyper-Connections,mHC)提升模型Scaling能力。具体技术细节见Blog:https://z.ai/blog/glm-5.3-flash。 极致低成本架构 为降低模型长上下文场景下的注意力成本,我们采用线性注意力与稀疏注意力相结合的混合架构。其中,线性注

  3. Hacker NewsPhilpax
  4. Techmeme

    Z.ai : Z.ai releases GLM-5.3-Flash, the first natively multimodal GLM-5 series model, with 320B parameters, saying it outperforms GLM-5.2 at “one-tenth the price” — We introduce GLM-5.3-Flash, the first natively multimodal model in the GLM-5 series. With 320B total parameters …

  5. Hacker Newstheanonymousone
  6. 机器之心机器之心

    编辑|Panda、山辉 8 月 17 日零点,DeepSeek 新的 API 价格正式生效。 V4 全系启用峰谷分时计费,工作日 9:00 至 12:00、14:00 至 18:00 按高峰价结算,其余时段价格减半。想不到,大模型也有需要「错峰用电」的一天。 第三方核算显示,V4 Flash 闲时缓存未命中输入价格上涨约 57%,闲时输出上涨约 136%,高峰时段的输出价格则接近旧价的 4.7 倍。 DeepSeek V4 系列 API 新旧价格对比。数据来源:Ginger Labs 涨价的不止一家。此前 OpenAI、谷歌和 Anthropic 已相继上调 API 价格或收缩免费额度。过去两年,大模型厂商一路把价格往下打,在 2026 年下半年,这条价格曲线却开始集体掉头。 原因并不复杂。推理需求的增长跑赢了算力供给的增长,而 Agent 把单次调用变成了几十次调用。当账单从「一问一答」变成「一个任务跑几小时」,此前靠补贴维持的低价就撑不住了。 能力向上,价格还能不能向下?这成了大模型真正进入生产环境前的一道必答题。 就在刚刚,阿里交出了一份让人满意的答卷:发布了 Qwen3.8-Flash ,同步开源 Qwen3.8-Flash-Next (两者为同一模型,前者是 API 版本名称,后者是开源版本的正式名称)。 它的成绩相当亮眼。在智能体编程基准 DeepSWE 1.1 上,它拿到 58.7 分,而参数规模是它三倍的前代 Qwen3.7-Plus 只有 16.5 分;长周期办公任务 CoWorkBench 和专业岗位任务 JobBench 上分别为 73.9 和 55.7 分,明显高于 Claude Opus 4.6(Max)的 68.2 和 36.6 分;多模态方面,AndroidWorld、ERQA、MathVision 等基准同样大幅领先。它并非全面占优,HLE 上的 35.9 分仍落后于 Opus 4.6 的 40.0 分,仓库级代码生成 NL2Repo-Bench 也不及 DeepSeek-V4-Flash-0731。 但真正的反差在价格。Qwen3.8-Flash 在千问 AI 平台的定价为 每百万 token 输入 1 元、输出 3 元 ,仅为本月初发布的 Qwen3.8-Max 的十二分之一,也低于 DeepSeek V4 Flash 在 8 月

  7. 晚点 LatePost

    智谱发布旨在对标 DeepSeek V4 Flash 的轻量级旗舰模型 GLM-5.3 Flash ,调用超过 10 万张国产芯片集群用于该模型推理服务。据《晚点 LatePost》了解,其算力供应商或来自华为、摩尔线程与海光,智谱官方没有评论这一信息。 GLM-5.3 Flash 拥有 300B 参数规模, 参数量约为 GLM-5.3 的 40%,与 DeepSeek V4 Flash 几乎持平。与同代小尺寸模型往往蒸馏自大模型不同,GLM-5.3 Flash 采用与 GLM-5.3 不同的架构设计,具有原生多模态能力,支持图像视频输入,这也是智谱战略聚焦 coding 以来第一次推出具有多模态能力的新模型。 随着 AI 模型能力持续提升,轻量旗舰模型能够负担越来越多的工作任务,这创造了新的增长空间,8 月 DeepSeek V4 Flash 的提价不仅证明了市场强劲需求,也预示了更激烈竞争的到来。 根据《晚点 LatePost》看到的智谱内部评测, GLM-5.3 Flash 的 Artificial Analysis Intelligence 分数为 57 分。这一分数超过上一代旗舰模型 GLM-5.2,和 Claude Opus 4.8 持平,也高于 DeepSeek 旗舰模型 V4 Pro 正式版的 53 分。 GLM-5.3 Flash 每百万 token 输入 0.8 元,输出 2.8 元,缓存命中价格 0.23 元,正好为 GLM-5.3 的十分之一。横向对比调价后的 DeepSeek V4 Flash,其谷时价格分别为 1.5 元、4.5 元 和 0.05 元。综合输入和输出成本,GLM-5.3 Flash 在绝大多数常规调用场景下更便宜。 智谱已经表示,上线前两周 GLM-5.3 Flash 会实行半价。 正式发布前智谱已在包括 OpenRouter 在内的第三方开放平台以 Ox Alpha 名义测试,5 天流量累积据悉超过 50 T,由于完全免费,刷新了 OpenRouter 与 OpenCode 流量增长纪录。 这不是智谱第一次以匿名形式发布新模型,今年春节前夕,OpenRouter 上出现一个名为 Pony Alpha 的模型,名字呼应中国农历马年,后来被证明是智谱的 GLM-5 模型。 GLM-5.3 Flash 全栈适配国产算力,线上流

  8. Hacker Newsjeudesprits

    https://twitter.com/Zai_org/status/2093354097122455713 https://z.ai/blog/glm-5.3