Back to News

NeoCognition's ApprenticeBench: Fable 5.1 and GPT-6 Astra beat human testers in simulated accounting

#ai-agents#benchmark#enterprise-software#accounting

NeoCognition released ApprenticeBench, a benchmark that places AI agents in a simulated construction company to perform real accounting tasks using Odoo. Fable 5.1 and GPT-6 Astra achieved pass rates of 72% and 68%, respectively, surpassing the best human tester's 51%. The benchmark highlights a 72% vs 36% performance gap between Fable 5.1 and Opus 5, despite similar scores on other benchmarks.

Coverage timeline

  1. 机器之心机器之心

    大模型榜单越来越多,但榜单上的几分差距,到了真实工作中究竟意味着什么,并不容易判断。 在 Artificial Analysis(AA)、Terminal-Bench 4.0 和 CursorBench 4.0 等评测中,Fable 5.1 和 Opus 5 的成绩只相差几分。可如果让它们进入同一家公司,使用同样的软件、学习同样的业务,再连续处理同一批账单,结果却变成了 72% 对 36%。 完成的任务数,差了一倍。 这个结果来自 NeoCognition 最新发布的 ApprenticeBench。与常见的单项能力测试不同,它把 Agent 放进一家模拟建筑公司,让它像新员工一样入职:阅读员工手册和历史资料,使用真实企业软件,并根据主管反馈逐渐摸清公司的业务规则。 ApprenticeBench 主页链接:https://apprenticebench.com/ Agent 没有针对这份工作接受专门训练。它需要一边工作,一边从公司的历史数据和带教过程中学习。在这项评测中,Fable 5.1 和 GPT-6 Astra 分别取得 72% 和 68% 的通过率,也超过了本次表现最好的人类测试者的 51%。 Fable 5.1 和 Astra 出现明显的能力跃升,超过本次人类测试者。图源:ApprenticeBench 博客(https://neocognition.io/blog/apprentice-bench/) 这也带出了一个更大的问题:如果 Agent 能自己熟悉软件、学会业务,今天需要 FDE(前线部署工程师)为每家客户做的部署和适配,未来能不能交给 Agent 自己完成? 一份看似普通的会计工作,为什么能拉开这么大的差距?对正在训练下一代模型的团队,这些差距又意味着什么? 公司的规矩,进公司才知道 会计学知识可以提前学习,但是一家公司具体怎么做账,最近改了什么政策,任何通用模型都不可能,也不应该知道。一个新员工入职后要补的课,Agent 一样要补。 这便是 ApprenticeBench 的核心设计思路:Agent 进入一家模拟建筑公司,使用和人类员工同样的软件(Odoo)处理应付账款。入职时,它拿到员工手册、软件教程和六个月的历史账单,随后连续处理 100 张新账单。在第一个月里,主管会逐单指导,后来只在月底提供稀疏反馈。 从翻阅历史记录,到逐步独立处理