Back to News

Z.ai confirms Ox Alpha is GLM-5.3 Flash, releases open weights

801 points · 281 comments#z.ai#glm-5.3#ox-alpha#open-source

Z.ai confirmed that the anonymous model 'Ox Alpha', which went viral on OpenRouter, is a new iteration of its GLM series, specifically GLM-5.3 Flash, and released its weights on Hugging Face under a new license. The model, a 320B-parameter natively multimodal model running on domestic chips, topped OpenRouter's leaderboard and ended DeepSeek's 56-day streak on OpenCode. The license requires companies with over $10B in revenue to pass a security review.

Coverage timeline

  1. 机器之心机器之心

    编辑|杨文、山辉 大模型圈流行「挂马甲」测试。 近日,一款名为 Ox Alpha 的匿名模型突然出现在 OpenRouter。Ox 本身就是「牛」的意思,国内网友很快给它起了一个更接地气的名字: 「牛来」大模型。 根据 OpenRouter 披露的信息,Ox Alpha 拥有 100 万 token 上下文,支持文本、图片和视频输入,可以调用工具,目前完全免费。 上线后不久,开发者就把它接入编码 Agent,扔进真实代码仓库进行测试。 初步测试结果显示,这款来历不明的「牛来」大模型,能力已逼近当前顶级代码模型。 与此同时,有网友爆料,一款名为 korrine 的匿名模型正在 Code Arena 上进行 测试。有人猜它是 Kimi K3.1,也有人将其指向 Qwen 和 MiMo,说啥的都有。 8 月的大模型圈,突然变成了一场大型猜谜游戏。 「牛来」大模型表现抢眼 Ox Alpha 真正引发关注,靠的是代码能力。 开发者 Ben Davis 从 DeepSWE 中抽取 10 项任务进行测试,Ox Alpha 完成了其中 8 项,通过率达到 80%。其公布的对比结果中,Fable 5 Max 为 65%,GLM-5.3 Max 和 Grok 4.6 xhigh 均为 62%,GPT-5.6 Sol Max 为 52%。 DeepSWE 考察真实软件工程能力。模型需要阅读代码仓库,定位问题,修改代码,运行测试,再根据报错继续修复。相比单轮编程题,它更接近编码 Agent 的实际工作。 不过,10 项任务的样本很小。随后,其他开发者在另一组 DeepSWE 子集上测试,给出的结果约为 63%。两次测试的任务范围和运行配置并不完全相同,暂时无法据此确定 Ox Alpha 的准确排名。 不过这些结果初步显示,这款匿名模型已经表现出很强的长程编码潜力,能力逼近当前头部模型。 「牛来」大模型到底是谁家的? 「牛来」大模型的身份,目前流传最广的说法是智谱尚未发布的 GLM-5.3 Flash,或 GLM-5.3 的多模态版本。 有人还专门写了个博客进行分析: 1. 最强证据来自视频编码器。四段不同帧率、时长和分辨率的视频中,Ox Alpha 消耗的视觉 token 与 GLM-5V-Turbo 完全一致。MiMo、Qwen 和 GLM-4.6V 都呈现出明显不同的结果。 2. 文本

  2. Techmeme

    Rohail Saleem / Wccftech : Ox Alpha, a “stealth model” from an unknown AI lab with a 1M-token multimodal context and capacity for 100T tokens/day, goes viral after launching on OpenRouter — When an unknown AI lab drops an anonymous model - Ox Alpha - for free, while declaring that they have the capacity …

  3. 量子位量子位

    匿名牛来大模型被扒出智谱血缘,也有人怀疑Cursor拿开源GLM训的 衡宇 2026-08-23 17:56:12 来源: 量子位 Tokenizer、视频编码、API报错全扒一遍 衡宇 发自 凹非寺 量子位 | 公众号 QbitAI 全世界刷屏的“牛来大模型”,到底是谁家的牛? 这两天,AI圈已经快把它扒了个底朝天。 目前 讨论度最高的模型厂商候选人,一是智谱,二是谷歌。 猜智谱的人已经开始验Tokenizer、测视频token消耗、找API报错,恨不得给模型做一套数字DNA鉴定。 猜谷歌的人则主要盯着DeepMind员工最近的发言,以及那个迟迟没有正式露面的Gemini 3.5 Pro。 牛来大模型其实叫 Ox Alpha 。 因为Ox就是“牛”,又正赶上最近《牛来》梗火遍互联网,国内网友干脆给它起了个亲切的名字叫“牛来大模型”。 8月20日,它突然以匿名模型的身份出现在OpenRouter上,OpenRouter只说它来自一家暂时保持匿名的第三方提供商。 它有104.86万token上下文,单次最多吐出13.1万token,能读文本、图片和视频,专门盯着代码、长周期Agent和复杂推理。 而且OpenCode随后宣布,Ox Alpha上线OpenCode Go, 连续数天几乎不限量免费使用,而且不计入用户原本的Go额度 (公开讨论中甚至出现了每天100万亿token级别服务容量的说法)。 于是开发者们拿着代码库、终端和各种刁钻任务,一拥而上去给它出题。 然后纷纷猜测: 牛来啊牛来,你到底是谁家的大模型? 为啥猜是这两家的? 大家之所以猜牛来大模型是智谱或谷歌的,是因为它在中文深度理解、超长上下文处理或多模态融合上展现出了这两家公司的模型特色。 而且在底层工程细节上暴露出了相似的技术指纹。 为啥猜是智谱的? 智谱是这场猜谜游戏中的领先大热门。 网友已经从牛来大模型的分词器、视频编码方式一路扒到了API服务层。 先来看tokenizer。 tokenizer负责把输入内容切成模型能够处理的token。不同模型家族往往采用不同的词表和切分逻辑,所以面对一些刻意设计的文本时,token数量会留下较稳定的“指纹”。 有测试者拿不同Prompt对Ox Alpha和多款模型进行比较,结果发现,Ox Alpha与GLM-5.3的token计数呈现高度一致的关系。 一组流传较广

  4. Techmeme

    Luz Ding / Bloomberg : Z.ai confirms Ox Alpha is a new iteration of its GLM series and says it will release the weights for it tonight; Ox Alpha topped OpenRouter's leaderboard — The new AI model that's swept to the top of online usage charts with high performance at zero cost was created by China's Z.AI Co., also known as Zhipu.

  5. Hacker Newsgaro-pro
  6. 量子位量子位

    神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡 十三 2026-08-27 00:48:12 来源: 量子位 GLM-5.3 Flash 金磊 发自 凹非寺 量子位 | 公众号 QbitAI 终于,这几天在网上炒得沸沸扬扬的 神秘 模型 「牛来」 (Ox Alpha),真身曝光了! 而且果然是来自 中国玩家 —— 是 智谱 刚刚发布即 开源 的 GLM-5.3 Flash ,还是5系列里 首个 原生多模态的那种。 「牛来」在火的这几天里啊,其实已经有不少人用Ox Alpha这个版本在实测了。 其中玩儿得比较多的,便是手搓一个 SpaceX Raptor猛禽发动机3D交互网页 。 例如博主Tim Jayas时隔几日,用同样的Prompt让「牛来」做了两次这个任务后,直接发出了这样的感慨: 感觉「牛来」是一个能自己持续学习的模型。 巧了,我们刚好也拿到了GLM-5.3 Flash的内测资格,也做了同款的项目;在我们输入完Prompt之后,全程无需任何操作: 在等候片刻之后,3D猛禽引擎项目就出炉了,来感受一下这个feel: 视频地址: https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g 从效果对比来看,嗯,无需多言,GLM-5.3 Flash做出来的3D猛禽引擎,更精进了。 那为啥「牛来」模型会这么火? 单单是从各大官方的帖子中,我们就能窥知一二。 例如在 OpenRouter 上,「牛来」首日便冲上了榜首,还刷新了刷新单日tokens用量历史纪录: OpenCode 则表示,Ox Alpha一出世,即终结了DeepSeek在OpenCode连续56天霸榜的纪录: 而在智谱正式认领完「牛来」之后,我们还发现了GLM-5.3 Flash其它亮点。 在 模型尺寸 方面,GLM-5.3 Flash仅为 320B ,但在能力上 全面超越 了体量为753B的GLM-5.2。 除此之外,根据最新的AA榜单显示,GLM-5.3 Flash已经拿下 57分 ,放眼全球范围内已然是步入前沿之列,并且与Claude Opus 4.8得分持平。 在 价格 方面,GLM-5.3 Flash的定价是5.3版本的1/10,限时折扣为1/20的GLM-5.3,1/40的Opus 4.8,定价低于DS-V4-Flash。 以及,还有一件值

  7. Hacker Newsjeudesprits
  8. Techmeme

    Frederic Lardinois / The New Stack : Z.ai releases GLM-5.3's weights under a new license requiring companies with $10B+ in revenue over 12 months to pass Z.ai's security review to host the model — Z.ai put the GLM-5.3 weights on Hugging Face, but dropped the MIT license. Providers above $10 billion in revenue now need a security review.

  9. 机器之心机器之心

    刚刚,OpenClaw 2.0 来了。 官方还打趣说比 GTA 6 更快: 按项目自己的统计,这是它有史以来最大的一次更新,933 名贡献者参与,其中 569 人是第一次给这个项目提交代码,合并的 pull request 超过 1.6 万个,约等于 OpenClaw 迄今全部合并量的一半。 写发布博客的是团队成员 Hannes Rudolph,标题很有趣,叫《 OpenClaw 2.0, Accidentally 》(意外的 2.0)。按他的说法,团队本来只打算做两件事:把安装流程做简单,把浏览器端体验做成一等公民。做着做着发现改不干净,只能顺着往下清理,清到最后就成了一个大版本。 这次更新之前,OpenClaw 有将近七周没有发布新版本。而在那之前的 230 天里,它发了 106 个版本,两次发版之间通常只隔一两天。博客解释说,发版节奏慢下来的同时开发反而在加速,团队规模变大,工作量和速度同时超出了原有代码底座和发布流程能承受的范围,于是两边一起返工。 2.0 改了什么 安装被推倒重来了 。新的引导式安装会先扫描机器上已有的 AI 访问权限,可以复用已经验证过的 Codex、ChatGPT 或 Claude CLI 登录,接受 API key,走供应商自己的登录流程,或者找出本机安装的 Ollama 与 LM Studio 模型,然后先验证这个具体选择确实能给出应答,再把模型和凭据存下来。 新安装的 OpenAI 配置默认使用 GPT-5.6 ,本地侧则把 node-llama-cpp 换成了托管的 llama-server,llama.cpp 的默认上下文长度提到 64K。大量配置项被砍掉或移出初次安装,剩下的部分交给用户和智能体聊着聊着配完。 重建后的浏览器端直接打开为一个对话界面 浏览器端的 Control UI 被重写为 chat-first 结构 ,原来的 Overview 页被取消,会话进侧边栏,正在进行的那个对话居于中心。文件、审批、终端、Git 变更和一个可停靠的浏览器面板都排在对话旁边,工具调用与结果成对显示,文件改动展示聚焦的 diff。一个叫 /btw 的命令可以开一段独立的多轮侧边对话,用来问不想污染主线记录的问题。官方给出的性能数字来自一个模拟测试环境(mocked Gateway,50 毫秒 HTTP/1.1 延迟),JavaScri