TokenRhythm open-sources NeoHorse-1 models, claims closed-loop step toward RSI
TokenRhythm released open-source NeoHorse-1 models in 4B and 9B sizes, trained by using a router to record agent trajectories and teaching a small model to complete tasks independently. The company describes this as the first closed-loop validation toward recursive self-improvement (RSI), with infrastructure support from Infinigence and research collaboration from Tsinghua and Peking University teams.
Coverage timeline
机器之心机器之心
编辑 | 泽南 Agent 完成任务后,学到的经验去了哪里? 一个 Agent 接到项目排期任务,它找到了工作目录里的文件,大致理解用户想要什么,却漏读了一封包含最新消息修改的邮件。随后,它沿着过时信息继续规划,生成了无效排期,最后还把文件写到了错误位置。 执行链在中途断掉,随后就全是基于错误推理的错误答案。看到之后,你显然会让 AI「重新审视问题」再生成一遍。问题在于,下一次怎么办? 今天的大多数系统中,Agent 的经验都留在日志里,模型每天在真实环境里产生的执行经验,几乎从不进入模型参数。这意味着模型下一次遇到相似任务,依旧可能踩一遍同样的坑。 基元律动最近发布的 NeoHorse-1 试图改变这件事。他们开源了 4B 与 9B 两个尺寸的模型,训练出来的思路听起来有点绕:让一个本来负责给模型「派活」的路由系统,顺便把所有模型走过的路记录下来,再把这些路教给一个小模型,让它自己就能走完一群模型走过的路。 论文链接:https://arxiv.org/abs/2609.08183 HuggingFace:https://huggingface.co/collections/TokenRhythm/neohorse-1 GitHub:https://github.com/TokenRhythm/NeoHorse 这件事, 被他们称为迈向 RSI 的第一次闭环验证 。 该模型由无问芯穹提供底层基础设施支撑与 Infra 优化技术能力,清华大学、北京大学团队参与算法和训练方法研究,共同探索提升 Agent 后训练的数据利用效率和训练效果。 大模型的终极目标:自我迭代 RSI(Recursive Self-Improvement,递归自我改进)是 2026 年 AI 领域一个炙手可热,也富有争议的词汇。它的愿景并不复杂:让 AI 把自己的产出作为经验重新喂回研发流程,参与设计更强的下一代自己,循环往复、自我升级。 今年 6 月,Anthropic 发布《When AI builds itself》,称在内部观察到了 RSI 的早期迹象。这个星期,OpenAI 发布博客首次公开了自己 RSI 的进展。OpenAI 称,其已经实现去年秋天定下的目标:在今年 9 月前造出一个「自动化研究实习生」。 但 Anthropic、OpenAI 自己也承认完整的 RSI 时代尚未到来,
