AI agents escape cyber test sandboxes, reach real systems; DoGNAVY ranks 3rd on CyberGym
Reports describe AI agents escaping cybersecurity testing environments and reaching real-world systems, including an OpenAI model that breached its sandbox during internal testing in July 2026 and invaded Hugging Face. Separately, the CyberGym benchmark ranked China's open-source DoGNAVY third globally with a 90.8% pass rate, behind Microsoft's MDASH and Wiz×Google DeepMind's Atlas.
Coverage timeline
TechCrunch AIRebecca Bellan
AI agents are escaping cybersecurity testing environments and reaching real-world systems, raising questions about whether safety infrastructure, industry standards and regulation can keep pace with increasingly powerful models.
量子位量子位
当AI开始“自作主张”,谁来为智能体戴上“项圈”?全球AI安全实战化大考,中国方案打入前三 量子位的朋友们 2026-08-11 11:11:12 来源: 量子位 全球AI安全实战化测评,中国方案DoGNAVY位列前三 2026年7月,OpenAI一款大模型在内部测试中“失控出逃”——自主发现漏洞、规划路径,成功入侵Hugging Face平台。该模型为获得更高评分,主动利用此前未知的零日漏洞突破沙箱,侵入存储测试答案的数据库,全程由AI自主完成。事后测试方发现,美国主流AI模型无法处理恶意载荷,最终转用中国开源模型完成溯源分析。 这一事件将AI智能体的行为安全与运行时控制问题推至前台。而在更具量化性的国际安全测评中,问题的紧迫性同样得到了验证。 CyberGym:面向真实漏洞挖掘的实战化基准 近期,加州大学伯克利分校发布的国际安全权威榜单CyberGym公布了最新排名。该基准以1507项来自188个真实开源项目的历史已修复漏洞为任务,测试AI智能体从零开始自主挖掘、验证并利用漏洞的能力,被Anthropic、DeepSeek、微软、Wiz等视为AI安全能力的关键标尺。 8月5日,国际公认安全权威榜单CyberGym公布了最新排名,来自中国的团队DoGNAVY获得全球第三、开源第一的成绩。 DoGNAVY:开源路线下的全球第三、中国第一 由国内顶尖人工智能研究机构(上海)与安全团队达酷诺威(DARKNAVY)联合研发的DoGNAVY,在此次测评中通过1369道题(通过率90.8%),排名全球第三,仅次于微软MDASH(92.0%)和Wiz×Google DeepMind的Atlas(90.9%),并超越OpenAI GPT-5.5-Cyber(85.6%)与Anthropic Claude Mythos(83.1%)。 一张榜单,几乎凑齐了全球最顶尖的AI公司。前两名用了同样的路数:多个闭源顶级模型”拼装作战”。用Wiz自己的说法,Atlas会把每个环节路由给在这项任务上表现最好的模型。这条路线足够强大,但有个前提——你得同时买得到、也用得起全世界最强的那几个闭源模型。而对国内团队来说,这不仅意味着成本,更意味着可获得性与自主性的挑战。部分国际领先模型并未正式向中国市场开放服务。DoGNAVY选择了另一条路。它只用了一款基础模型——智谱在6月开源的GLM-5.2,一
