Mostik team with Fields Medalist claims hybrid 4B Qwen + 753B GLM boosts ARC-AGI 3 via efficient inter-model communication
A four-month-old team called Mostik, which includes Fields Medalist Stanislav Smirnov, claims that combining a 4B Qwen model on-device with a 753B GLM-5.2 in the cloud achieves high ARC-AGI 3 scores by improving inter-model communication efficiency. The team says their bridge method reduces the performance gap between the small and large models by about 50%, boosts the small model's accuracy by 25%, and cuts the large model's inference cost to roughly one-twentieth. Technical details are withheld because the competition is still ongoing.
Coverage timeline
量子位量子位
菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3 衡宇 2026-09-07 16:36:30 来源: 量子位 “在两个模型之间找到数学上的共同基础其实非常困难” 衡宇 发自 凹非寺 量子位 | 公众号 QbitAI 就离谱? GPT-6 Astra刷到快满分的ARC-AGI 3, 一个手机能跑的4B小模型也能刷爆 。 更准确地说,是4B Qwen+753B GLM 5.2的组合。 其中,GLM-5.2待在云端,手机端只需运行4B的Qwen-3.5。大模型全程不输出一个字,小模型负责把最终答案写出来。 具体技术细节尚未公开,背后团队Mostik拒绝在此刻披露,“因为比赛还没结束”。 但他们公开了核心发现: AI模型之间一直在用一种极其低效的方式交流。 Mostik认为,他们搭了一座桥,让模型之间的信息传递效率提升了几个数量级。 按团队披露的实验结果,这套方案能让4B模型补上与753B模型之间约50%的性能差距,自身准确率提高25%。在大小模型差距更明显的难题子集上,提升达到2倍。 而大模型侧的推理成本,被压到了原本约二十分之一。 Mostik成立仅4个月,团队共15人,其中12名博士。 团队里还有一位菲尔兹奖得主——2010年证明了统计物理中“渗流模型”和“平面Ising模型”的共形不变性的俄罗斯数学家 Stanislav Smirnov (斯坦尼斯拉夫·斯米尔诺夫)。 两兆字节与十七比特 大模型生成一个token的过程中,内部会构建超过一百个隐藏向量,总共包含大约一百万个数值,约两兆字节的内部状态信息。 然后,它从大约15万词的词表中挑出一个token输出。 17个比特离开模型,两兆字节被丢弃,不会再被使用。 目前所有让多个模型协作的系统,包括编程子智能体、模型委员会、路由调度,全部建立在这17个比特之上。 模型之间唯一的沟通渠道就是文本。 那么被丢掉的两兆字节里到底装着什么? 近两年的可解释性研究给出了明确答案,是深层计算的核心内容。 一篇ICLR 2026发表的论文显示,Qwen-3在写出“accountant”这个词之前好几个token,内部就已经携带了这个词的表征,正是这个表征让模型提前选对了冠词“an”而非“a”。 而且 模型越大,这种提前规划的能力越强,内部状态中携带的”未说出口”的信息越多。 Anthropic的可解释性团队
