Back to News

15 Academic Institutions Release HarnessEval for AI Agent Evaluation

#ai-agents#benchmark#evaluation#harness

On August 18, 2026, MirroS, together with Tsinghua, Peking University, Berkeley, MIT, xbench, NVIDIA, and other research institutions, released HarnessEval, a benchmark harness for evaluating AI agent systems. It aims to shift evaluation from static metrics to executable evaluation systems, organizing how assessments form credible judgments with traceable scores.

Coverage timeline

  1. 机器之心机器之心

    8 月 13 日,DeepSeek 开源 Agent Harness dsh,将 “Harness” 这个原本更偏工程语境的概念,推到了整个 AI 行业讨论的中心。 模型之外,为什么还需要 Harness? 答案其实来自 Agent 正在发生的重要变化。 今天一个 Agent 的最终能力,早已不能简单等同于底层模型能力。模型之外还有上下文管理、工具调用、记忆、任务拆解、执行环境、权限管理和结果验证。真正决定一个 Agent 能不能稳定完成复杂任务的,是这些组件能否被组织成一套稳定、可执行的工作流系统。 Harness 描述的,正是这一层能力。 显然,如果只把 Harness 理解为 Coding Agent 一种产品形态,其实严重低估了它的意义。几乎所有复杂智能流程,都需要一个负责规划、协调与验证的系统层。Agent 如此,Evaluation 同样如此。 近日, MirroS 联合清北,Berkeley, MIT,xbench,英伟达等研究机构共同发布 HarnessEval,将 Harness 这一概念进一步带入评测系统。 它试图回答一个比 “如何让模型完成任务” 更基础的问题: 如果被评测的 AI 已经从一个模型变成了一套复杂系统,什么样的 Evaluation 才足够有效? Blog: https://mirros.ai/blog/harnesseval Code: https://github.com/mirros-lab/harnesseval-w Project Page: https://mirros-lab.github.io/HarnessEval-W HarnessEval 给出的答案,不是增加一组指标,也不是引入一个更大的 Judge 模型。它要为 Evaluation 建立自己的 Harness。 如果说 Agent Harness 负责组织模型如何完成任务,那么 Evaluation Harness 负责组织评测如何形成可信判断:理解案例、规划路径、选择技能、调用工具、搜集证据、验证推理,并让每一个分数都可以被追溯。这也是 HarnessEval 想推动的范式变化: 从 Metric 到 Harness,从静态 benchmark 到可执行的评测系统。 01|当模型成为系统,Evaluation 也必须成为系统 过去,我们习惯把模型看成一