Anthropic risk report raises misalignment risk to low, details stronger internal Model 2
Anthropic's second Risk Report, dated August 2026 and totaling 186 pages, raises its misalignment risk estimate from very low to low and states it does not plan to release an internal model called Model 2. The report describes Model 2 as a Mythos-class model that is slightly stronger overall than Claude Mythos 5 in some areas, already used extensively internally for coding, data generation, and agent tasks, but lacking full external evaluation and public release plans.
Coverage timeline
Techmeme
Madison Mills / Axios : Risk report: Anthropic raises misalignment risk estimate from very low to low and says it doesn't plan to release a stronger internal model called “Model 2” — Anthropic does not plan to release an internal model that appears to be more powerful than top-of-the-line Mythos …

机器之心机器之心
编辑|Panda 刚刚,Anthropic 发布了自家的第二份《 风险报告(Risk Report) 》,共 186 页,信息量巨大。 其中最惹眼的一个关键词是 Model 2 ,这是一个能力超过 Claude Mythos 5、尚未向公众开放,却已经在 Anthropic 公司内部大量使用的模型。 Anthropic 表示, Model 2 已被大量用于编码、数据生成和其他智能体任务,也广泛参与研究与工程工作 ,既有人机交互式使用,也有持续运行的智能体部署。它与 Mythos 5 并列为公司截至 7 月 15 日能力最强、内部使用最多的两个模型。 但我们能知道的也仅止于此。报告没有公布 Model 2 的参数规模、训练成本、上下文长度和架构,没有解释它与 Mythos 5 是否共享权重或训练路线,甚至没有说明「Model 2」究竟是内部真实代号还是临时标签。能够确定的是,报告把它归为「Mythos-class model」,称它 在部分领域强于 Mythos 5、部分领域稍弱,但总体略强 。 Anthropic 目前「没有对外发布它的计划」。这句话也明示了一种正在形成的新常态:前沿模型的真正能力边界,可能先存在于实验室内部,深度参与下一代模型的研发,却不再与面向消费者的产品线重合。 下面我就来具体看看这份报告的内容。 报告地址:https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf Model 2 到底有多强? Anthropic 对 Model 2 的定性比较克制。报告称,它在许多与内部工作有关的任务上,相比 Mythos 5 是一次「明显改进」,但进步幅度没有从 Claude Opus 4.6 跳到 Mythos Preview 时那么大。由于它没有完成通常面向外部部署的全套评估,Anthropic 也承认,对其能力判断的信心低于公开模型。 Anthropic 在报告中给出了两个内部指标,应该值得一看。 第一个是 CoBench。这是一套由 449 个真实 Anthropic 研发问题组成的内部评测:模型被放回某个历史时间点,只能查看当时的代码库、日志、内部消息和文档,然后寻找后来
