Back to News

NTU Study: Agent Harness Quality Depends on Model-Task Combination

#agent#harness#model-evaluation#ntu

A team led by An Bo at Nanyang Technological University published a report systematically studying model-harness interactions across agent tasks. The study compared four configurable harnesses (OpenHands, DSH, PI, openJiuwen) with five models and two native pairings, concluding that harness quality is not a fixed property but depends on the specific model-task combination, recommending joint evaluation over seeking a universal harness.

Coverage timeline

  1. 机器之心机器之心

    开发 Agent 应用时,大家一定都为选择 Harness 纠结过:同一个模型接入不同 Harness,工具调用、上下文管理和错误恢复的方式都会发生变化,最终表现也可能相差很大。一套 Harness 在某类任务上表现突出,换到另一类任务后,却未必仍是最佳选择。 那么,不同任务究竟该选择哪套 Harness?是否存在一套能够稳定适配多种任务的通用方案?模型厂商提供的原生 Harness,又是否一定更适合自家模型? 新加坡南洋理工大学安波教授团队在最新报告《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》中,对这些问题进行了系统研究。 报告链接: https://arxiv.org/abs/2610.00917 实验代码仓:https://github.com/liyix/finding-the-right-fit 数据集:https://huggingface.co/datasets/yixuanli97/finding-the-right-fit 这篇报告不是在做一张简单的 Harness 排行榜,而是把模型与 Harness 视为一个整体进行比较。实验覆盖 OpenHands、DSH、PI 和 openJiuwen 四套可配置 Harness,并将 Codex–GPT 与 Claude Code–Claude 两组原生搭配作为参照。报告最终指向了一个很实际的结论:Harness 的好坏并不是固定属性,而是取决于它与模型、任务之间的具体组合。与其寻找一套 “放之四海而皆准” 的 Harness,不如围绕真实任务,对模型与 Harness 进行联合评估。 01 实验背景 为了考察 Harness 对 Agent 表现的影响,研究首先选取了四种可自由配置模型的 Harness: OpenHands、DeepSeek Harness(DSH)、PI 和 openJiuwen。 实验分别为这四种 Harness 接入 Claude Opus 5、GPT-6 Astra、GLM-5.3、Kimi K3 和 DeepSeek V4 Pro。这样的交叉设计,可以观察同一个模型更换 Harness 后的表现变化,也能比较同一套 Harness 面对不同模型和任务时是否依然稳定。 除此之外,研究