Back to News

ByteDance reportedly pretraining AI model with up to 10T parameters

#bytedance#ai-model#pretraining#large-language-models

Sources told the Financial Times that ByteDance is pretraining an AI model with up to 10 trillion parameters, roughly three times larger than Moonshot's Kimi K3 and exceeding the 8T estimate for Anthropic's Mythos 5. LatePost separately reported that ByteDance is discussing training a model with over 5 trillion parameters, led by Seed Foundation head Xiang Liang, with founder Zhang Yiming emphasizing no distillation and not being swayed by short-term trends.

Coverage timeline

  1. Techmeme

    Financial Times : Sources: ByteDance is pretraining an AI model with up to 10T parameters, roughly 3x larger than Kimi K3 and larger than the 8T estimate for Anthropic's Mythos 5 — TikTok owner training a model three times larger than Moonshot's Kimi K3 — ByteDance is training an AI model that could approach …

  2. 晚点 LatePost高洪浩

    《晚点 LatePost》独家了解到,字节跳动正在讨论训练一个参数规模超 5 万亿的模型,它超过阿里的 Qwen 3.8-Max(2.4 万亿参数)和月之暗面的 K3(2.8 万亿参数),也是目前国内已知参数规模最大的模型。通常而言,模型规模越大,智能水平往往越高。不过该计划仍处于早期阶段,并不代表模型最终一定会发布。 新模型将由 Seed Foundation 负责人项亮主导,与大语言模型预训练数据负责人沈科合作。为此,Seed 正在重新梳理组织,划分职责,分配资源。 项亮与沈科均是字节跳动人工智能及大模型研发体系内的核心骨干,均出自字节的 “搜广推” 体系。项亮本科毕业于中国科学技术大学,博士就读于中科院自动化所,2016 年加入字节,曾负责机器学习中台 AML 团队,后调任豆包大模型 Foundation 团队任负责人。沈科 2018 年清华毕业后,加入字节跳动,现主要负责 LLM 预训练数据。 自字节入局大模型以来,Seed 一直被视为国内最有希望的团队之一。豆包有今天超过 2 亿日活的用户体量,很大程度上也归功于 Seed 。但今年,质疑声开始出现。 2 月中旬,吴永辉执掌 Seed 后推出的关键模型 Seed 2.0 正式发布,但市场反响有限。几乎同一时间,智谱开源的 GLM-5 被市场视为国内第一个能与 Anthropic Opus 系列比肩的模型;7 月,月之暗面的 Kimi K3 发布,多项第三方评测认为,它已接近海外闭源旗舰。 多位字节人士告诉我们,上半年,Seed 许多团队也在不断反思。这是字节讨论训练超 5 万亿参数模型的原因之一,与其在现有尺寸上继续追赶,不如把参数规模一次推到同行的数倍,争取领先位置。“像一场赌博。” 一位接近 Seed 人士说。 就在两周前,字节跳动创始人张一鸣与 Seed 负责人吴永辉共同召开了一场 Seed 全员会(All Hands)。久未露面的张一鸣也表达了自己对 seed 的支持。我们独家了解到: 张一鸣在会上安抚了 Seed 的成员。他认为,训大模型本就是一件很难的事,团队不必过度焦虑。他明确一段时间内可接受模型落后于行业,希望大家以追求智能上限为目标,期待 Seed 模型能力能跻身世界第一梯队。 他认可编程(Coding)是当前的关键方向,所以要把火山引擎、飞书和豆包的资源整合到一起,只有这样才能构筑在算力