Back to News

Anthropic report: 7 Chinese AI labs blocked from Claude distillation

#anthropic#distillation#ai-safety#claude

Anthropic released a 154-page report on September 10, 2026, stating it identified and blocked large-scale distillation of Claude by seven Chinese AI labs, using methods such as stolen credit cards and API keys. The report also noted some Chinese model companies forwarded user requests or purchased conversations to train models. Experts question the effectiveness of countermeasures, noting that while US frontier labs employ classifiers, hidden chain-of-thought, and account bans, distillation remains hard to fully prevent, and the goal is to raise costs and slow competitors.

Coverage timeline

  1. 晚点 LatePost程曼祺

    2026 年 9 月 10 日,Anthropic 发布了一份 154 页的报告,称它识别并阻断了 7 家中国 AI 实验室针对 Claude 的大规模蒸馏。 蒸馏本是一种常见的模型训练方法:开发者用更强模型生成数据,再用这些数据训练自己的模型去模仿领先模型。Anthropic 将未经授权、大规模、隐蔽提取模型能力的行为称为 “不正当蒸馏”(illicit distillation)。 Anthropic 称,相关机构在提取前沿模型的输出时,使用了一些明显违规的手段:如利用被盗的信用卡、登录凭证和 API 密钥批量建立虚假账号。 报告还称,一些中国模型公司把用户请求转发给 Claude,或从第三方路由服务购买用户对话,用这些数据训练模型。部分对话包含姓名、企业数据和有效的访问凭证。 这不是 Anthropic 第一次指控 “蒸馏攻击”。2026 年 2 月,它称 DeepSeek、月之暗面和 MiniMax 通过约 2.4 万个虚假账号,与 Claude 进行了超 1600 万次交互。此后,Anthropic 加高了防线。OpenAI 和 Google 也在持续识别和应对蒸馏攻击。 这些措施能防住蒸馏吗? 澳大利亚格里菲斯大学助理教授刘艺表示怀疑。他长期研究人工智能与网络安全,曾任 Quantstamp 人工智能研究科学家。他参与的 2023 年提示词注入研究,被全球性安全组织 OWASP 的 LLM 01 条目列为参考文献。他还曾两次获得 Anthropic 的安全漏洞赏金,并研究过顶尖商用模型的思维链窃取攻击。 刘艺分享了他的核心判断: 以 Anthropic 为例,美国前沿模型公司目前主要设置了三层蒸馏防线: (1)利用专门用于检测对抗性数据提取的分类器,让模型内生地拒绝可疑请求; (2)在架构设计上隐藏或压缩思维链再输出; (3)用外部检测器识别数据提取,随后中断请求或封禁账号。 反蒸馏是个伪命题。理论上蒸馏很难杜绝,美国前沿模型公司更现实的目标是提高数据采集成本,拖慢竞争对手,延长领先时间。 对美国前沿模型公司来说,反蒸馏保护的不只是模型能力,它们要捍卫的,还有在建立在技术领先之上的商业价值。 刘艺认为,理解美国前沿模型公司的反蒸馏行动,商业逻辑比技术逻辑更重要。 Anthropic 能识别疑似蒸馏的行为,却很难获得蒸馏确证 晚点 :Anthropic 9