MiniCPM5-2B open-sourced, claims top open-model rank in agent benchmarks
On September 8, 2026, ModelBest (面壁智能) open-sourced MiniCPM5-2B, a 2-billion-parameter end-side language model, along with training recipes, a reinforcement learning framework called Meshy, the JustRL II policy, and some SFT data. The company reports it ranks first among open-source models on the Artificial Analysis Intelligence Index with a score of 23, and first on agent workflow benchmarks with a score of 20, outperforming larger models such as Gemma 4 12B and Qwen3.5 9B.
Coverage timeline
机器之心机器之心
编辑|陈陈 过去几年,端侧大模型一直在不断突破能力边界。 最初,人们关注的是手机等设备能否运行一个基础语言模型;随后,长文本理解、数学推理、代码生成、多语言能力逐渐被压缩进更小的模型。如今,随着模型能力进一步提升,一个新的问题开始浮现:Agent 能力,是否也能从云端走向端侧? 这并不是简单地把一个聊天模型放进设备,一个 Agent,需要理解目标、拆解任务、调用工具、根据反馈调整策略,并在多轮交互中持续推进任务。 随着端侧模型能力不断提升,过去属于云端的复杂工作流,开始具备在设备侧独立运行的可能。 面壁智能正是在这一方向上的代表性机构。 9 月 8 日, 面壁智能开源新一代端侧语言基础模型 MiniCPM5-2B,让端侧通用 Agent 能力开始具备雏形 。该模型将 工具调用、深度搜索、代码生成 等智能体核心能力引入端侧,为复杂任务在设备侧运行提供了新的可能。 另外,团队此次开放的不只是模型权重和算法,还包括部分 训练 Recipe(如 RL recipe)、自研强化学习框架 Meshy、基于奖励的强化学习策略 JustRL II,以及一批 SFT 数据 。这在当前大模型开源生态中并不常见。 端侧模型轻装上阵,Agent 能力正在成形 MiniCPM5-2B 轻量但不代表能力弱。 根据 Artificial Analysis Intelligence Index 榜单,MiniCPM5-2B 在开源模型类别中排名第一。该榜单综合了 9 项评测,覆盖知识推理、代码能力以及 Agent 任务执行等多个维度。结果显示, MiniCPM5-2B 以 23 分领先 Gemma 4 12B、Qwen3.5 9B 等参数规模更大的模型 。 在衡量模型在 Agent 工作流中的榜单中, MiniCPM5-2B 以 20 分排名第一 ,领先于 Granite 4.2 8B(9 分)、Qwen3.5 9B(7 分)等参数规模更大的模型。 MiniCPM5-2B 在推理效率上也展现出优势 ,完成单个任务平均仅需要约 21K output tokens,与同规模模型相比处于较低水平。 值得注意的是,MiniCPM5-2B 在 真实工作任务评测中取得接近人类基准的成绩 ,这一结果表明,端侧模型的能力边界正在从简单问答进一步延伸到真实任务处理。 MiniCPM5-2B 也展现出 较高的智能密度
