Open-source Kimi K3 with multi-agent harness nears Claude Opus 5 in AI research benchmark
Prime Intellect research shows that an open-source model (Kimi K3) paired with their multi-agent harness nearly matches Claude's flagship Opus 5 in an autonomous AI research task (nanoGPT optimizer speedrun). Kimi K3 achieved 2930 steps, surpassing GPT-5.6 Sol (3042) and close to Opus 5 (2920), challenging the assumption that only top closed-source models can excel at AI-driven AI development.
Coverage timeline
量子位量子位
闭源RSI的严父:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5 henry 2026-08-20 17:46:23 来源: 量子位 经典RSI剧本开始动摇 henry 发自 凹非寺 量子位 | 公众号 QbitAI 刚刚,闭源RSI的 钦点严父 来了! 开源AI基础设施公司 Prime Intellect 在最新的一项研究中提出: 借助 多智能体Harness ,可以把监控和具体实现交给更小、更便宜的 开源模型, ,从而让“AI开发AI”变得更便宜,甚至效果更好。 在实验中,他们把Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3等18个前沿模型,扔进了一场nanoGPT优化器速通。 结果,开源权重模型Kimi K3搭配Prime Agent Harness后,在原始结果页中跑出了2930步的成绩。 这不仅超过了GPT-5.6 Sol的3042步,距离Claude的旗舰模型Opus 5的2920步也只差10步。 换句话说,在AI研究这件事上, 一套由开源模型和Harness组成的系统,已经能够超过部分顶级闭源模型,甚至逼近第一梯队。 这一方面开始动摇过去那个最经典的RSI剧本: 某个最强闭源模型率先跨过“AI开发AI”的临界点,然后不断自我迭代,把其他玩家越甩越远,最终赢家通吃。 另一方面,Prime Intellect也展示了另一种可能: 模型不一定非得最强,只要底下这套科研机器足够高效,开源模型同样可以靠更高的试错吞吐量追上来。 而这,也进一步展示了Harness这类Agent编排框架,在AI4AI、AutoResearch上的潜力。 这是怎么做到的? nanoGPT优化器速通 简单来说,这次Prime Intellect的实验,就是让十几个前沿大模型,去速通Karpathy那套著名的 nanoGPT训练任务。 不过先澄清一点。 这次并不比谁能凭空发明一个多么原创的新算法。 Prime Intellect做的,是直接把AI扔进一个 目标明确、反馈快速的真实训练任务 里,看它能不能像人类研究员一样,不断提出假设、跑实验、看结果,再继续往下改。 Agent一开始会拿到一份带有baseline超参数的训练脚本,同时只得到一个提示: 现在这套方案还不够好。 至于哪里能变好,怎么变好,没人告诉它: 究竟是换一种更好的预条件方法
