Back to News

Anthropic Opus 5.5 Test: Generates 100 HTML Pages from One Prompt

#anthropic#opus-5.5#long-horizon-tasks#autonomous-coding

A hands-on test by MiaAI Lab shows Anthropic's Opus 5.5 can autonomously generate 100 distinct HTML pages from a single open-ended prompt, demonstrating strong long-horizon task capabilities. Anthropic's usage guide recommends giving complete tasks with clear completion criteria, and official tests show Opus 5.5 reviewing and fixing about 200,000 lines of code in under three hours, and rewriting HAProxy from C to Rust in 9.5 hours.

Coverage timeline

  1. 机器之心机器之心

    编辑|山辉、杨文 Opus 5.5 发布后,网友都抢着试用。 一刷就是好几个作品,从网页、动画到游戏等等。这些都比 benchmark 的数值直观,有的还能自己上手试试。 一位名为 MiaAI Lab 的创作者直接让 Opus 5.5「做 100 个 HTML 文件」,附带三条要求:好看、设计不要重复、充分发挥创意。做出来的成品十分惊人。 https://x.com/MiaAI_lab/status/2102490829306634560 还真别说,每个点开都像模像样的。同一个模型对不同交互形式和视觉风格,有非常多元化的处理。 这个案例里,Opus 5.5 从开放要求出发,自己决定做哪些作品,并且写出页面结构、CSS 和交互代码。从创意构思、任务拆解到成品制作,Opus 5.5 展现了很强的自主性。 给模型一个开放的总目标,它来自己规划步骤,并把任务完整交出来。 这正好是 Anthropic 这次强烈推荐的用法。 一次交代整件事,真的能做完? Anthropic 在 Opus 5.5 使用指南开头就给出建议:一次交代完整任务,说清楚什么算「做完」,以及遇到什么情况需要停下来问用户,然后让模型自己工作。 指南链接:https://claude.dev/blog/getting-the-most-out-of-opus-5-5/ 指南举的例子是迁移支付接口。 交代任务之外,最重要的就是写明完成标准:所有接口都使用新客户端,旧客户端被删除,测试通过。只有碰到无法解释的测试失败时,模型才需要停下来询问。这样的要求给了模型自行推进的空间,也给最终交付留下了可核对的标准。 其实这个建议在 Opus5 发布时就提过。这次 Anthropic 特意强调的是,Opus 5.5 更能在长时间、多步骤的任务中持续推进。 官方发布材料提到,一位早期测试者让它审查并修复约 20 万行代码,不到三小时完成;同一任务中,Opus 5 花了 20 多个小时。另一项内部测试要求模型把 HAProxy 从 C 改写成 Rust,Opus 5.5 用了 9.5 小时,改写结果通过了几乎全部原项目的回归测试。 不过,工作做了很久,也未必做出了用户最急着要的东西。 科技媒体 Every 在实测中,给了 Opus 5.5 十分钟,为一场客户培训写按分钟安排的日程表。它读完需求,花了将近五分钟思考,又制作训练数