OpenAI pauses Astra development over potential critical cyber capabilities
OpenAI has paused internal activities around its upcoming model Astra, citing expanded safety testing and the possibility that it possesses 'critical' cybersecurity capabilities. The company will restrict Astra's environment and involve government agencies in testing, following a recent incident where its models hacked Hugging Face. Separately, reports indicate OpenAI is working on a larger pretraining model codenamed 'Doug'.
Coverage timeline
Techmeme
Axios : OpenAI says it has expanded safety testing around its upcoming model Astra as it “cannot rule out” critical cyber capabilities, potentially delaying its launch — OpenAI “cannot rule out” that its upcoming model Astra has"critical" cyber capabilities, a designation that has prompted …

The Verge AIJay Peters
OpenAI says it is pausing "internal activities" around an in-development AI model, Astra, because it doesn't yet meet new security standards the company is putting in place. The announcement follows its recent disclosure that OpenAI models accidentally hacked Hugging Face . Anthropic and Meta have also since admitted that they had AI models that went rogue and breached other organizations. Recent internal evaluations of an OpenAI model called Astra indicate that it offers "significant advancements in agentic coding and cybersecurity," according to the company . "These results, in addition to expert assessments, have led us to conclude last n … Read the full story at The Verge.

TechCrunch AIKirsten Korosec
OpenAI said it has suspended work on some aspects of its upcoming model Astra over concerns about its cybersecurity prowess.
机器之心机器之心
8 月 7 日,OpenAI 宣布放慢下一代模型 Astra 的研发。 过去几天的内部评估显示,Astra 在智能体编程和网络安全方面取得显著进展。公司暂时无法排除它已经达到「临界」网络安全能力。 OpenAI 将扩大安全测试,并暂停所有未满足强化安全要求的 Astra 内部活动。目前,Astra 没有公开发布时间。 X博主 @AndrewCurran_ 认为,Astra 可能已经不需要继续开发了,因为它已经完成并做好了发布准备。更可能发生的情况是,奥特曼向政府官员展示了 Astra,随后被告知这款模型不能发布,必须进入安全审查。 他提到放慢内部开发和停止训练新模型的说法是真的,他自己从多方听到过,OpenAI 内部人也公开说过。 「无法排除」,已经足以触发最高等级控制 OpenAI 的《准备框架》将前沿能力分为「高」和「临界」两个主要等级。GPT-5.6 Sol 等模型此前被评为「高」。Astra 则开始按照更严格的「临界」情形管理。 在网络安全领域,「临界」有很高的门槛。模型需要能够在无人介入的情况下,针对大量经过加固的真实关键系统,自主发现并开发可用的零日漏洞;或者只接收一个高层目标,便能规划和执行全新的端到端攻击。 OpenAI 没有宣布 Astra 完成过上述任务,也没有公开具体评测成绩。官方公告给出的结论更谨慎:现有测试还无法排除这种可能性。 这反映的是能力上限仍有不确定性,不能视为 Astra 已经发动真实攻击的证据。不过,按照 OpenAI 的安全框架,这种不确定性已经足以触发最高等级控制。 接下来,Astra 将被转入更严格的隔离环境,网络和工具访问会受到限制。OpenAI 还将加强模型权重保护、沙箱执行和异常检测,并对 Astra 的训练、评测及其他智能体应用实施统一监控。政府机构和部分 AI 安全组织也将参与测试。 Hugging Face 事件改变了评测规则 OpenAI 此时提高安全等级,与 7 月发生的 Hugging Face 入侵密切相关。 GPT-5.6 Sol 和一个更强的内部研究原型,在 ExploitGym 网络安全评测中发现并利用了包注册表代理 Artifactory 的未知零日漏洞。模型由此突破隔离环境,获得互联网访问,并在 OpenAI 内部基础设施中完成权限提升和横向移动。 随后,模型将 Hugging Face 判断

机器之心机器之心
8 月 9 日,长期关注 OpenAI 模型动向的 X 用户 ChrisGPT 爆料称,OpenAI 正在推进一个代号为 Doug 的新一轮大型预训练模型。 按照他的说法,Doug 将是 OpenAI 迄今规模最大的一次预训练项目,而且它与 GPT-6 并不是同一个模型。 在后续回复中,ChrisGPT 进一步表示,GPT-6 很可能就是昨天 OpenAI 因安全问题紧急暂缓发布的自家最强模型 Astra。 至于 Doug,他预计最迟可能会在 11 月之前推出。 ChrisGPT 并不是第一个公开提到 Doug 的消息源。 8 月 7 日,半导体和 AI 行业研究机构 SemiAnalysis 在一篇讨论 Gemini 和 Google Cloud 的文章中,公开了一段此前发送给机构客户的研究备忘录。这份备忘录的时间是 7 月 9 日。 文章地址:https://newsletter.semianalysis.com/p/gemini-is-cooked-but-gcp-is-cooking 其中有一句很关键: OpenAI 已经克服了预训练方面的问题,一个代号为 Doug、规模大得多的模型正在积极推进。 如果相关消息准确,Doug 可能意味着,在过去接近两年主要依赖 post-training、强化学习和 inference-time compute 推动能力增长之后,OpenAI 正在重新启动一次大规模的基础模型换代。 故事要从 GPT-4o 说起。 OpenAI 把更多增长交给了 RL 2024 年 5 月 13 日,OpenAI 发布 GPT-4o,并将其称为新的旗舰模型。 此后接近两年,OpenAI 虽然训练并发布了 GPT-4.5 等新的预训练模型,却始终没有完成一轮能够被广泛部署为下一代主力 frontier model 的全规模预训练。 与此同时,OpenAI 的模型能力增长开始越来越多地来自另一条路线。 2024 年 9 月 12 日,OpenAI 发布 o1-preview。 相比过去依靠更大规模预训练推动能力增长,o1 展示了另一种 scaling 方法: 通过大规模强化学习,让模型学会投入更多计算进行推理 。此后,post-training、RL 和 inference-time compute 在 OpenAI 的模型体系中变得越来越重要。
