Back to News

TensorCast: Unified Tensor Management Layer Cuts LLM TTFT by up to 93.2%

#llm-inference#tensor-management#kv-cache#ttft

Researchers from Peking University, StepFun, and Beijing University of Posts and Telecommunications propose TensorCast, a unified programmable tensor lifecycle management layer for LLM infrastructure. It decouples tensor states like model weights and KV Cache from specific systems, enabling reuse and combination of management capabilities, and reduces time-to-first-token by up to 93.2% in high-concurrency multi-turn agent scenarios.

Coverage timeline

  1. 机器之心机器之心

    过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理到算子优化,学界业界大量优化技术不断提升模型推理效率。 然而,随着模型规模持续增长、上下文长度不断扩展,以及多轮交互 Agent 等新型应用快速兴起,大模型基础设施正在面临一个新的挑战 —— 面对海量跨系统组件流动的「张量状态」,大模型基础设施如何灵活高效地管理它们? 例如: 大模型服务弹性扩容时,需要将 TB 级模型权重快速分发到新实例; 长上下文、多轮对话场景中,需要存储大量 GB 级 KV Cache,并在推理实例之间快速迁移、复用; 强化学习中,需要将训练节点产生的 TB 级新模型参数快速同步到大量 rollout 推理节点。 这些张量已经不再只是计算过程中的临时数据,而逐渐成为大模型系统中的核心状态。围绕每个需求,学界业界已经有了定制化的优化方案。然而,一个新的问题正在出现: 不同系统都在重复解决类似的张量管理问题,却缺少一个统一的基础抽象 。 针对这一缺失的基础能力, 北京大学、阶跃星辰与北京邮电大学联合提出 TensorCast ,在计算引擎、网络与存储之间引入一个 统一、可编程的张量生命周期管理抽象层,将模型权重、KV Cache 等张量状态从具体系统中解耦出来,使不同工作负载能够复用并组合统一的张量管理能力。 TensorCast 在达到专用系统性能的同时,可灵活实现新的跨系统组件张量管理策略, 针对高并发多轮对话 Agent 场景 TTFT 最高可降低 93.2% 。 论文标题:TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure 论文地址:https://arxiv.org/pdf/2608.06007 代码地址:https://github.com/tensorcast-ai/tensorcast 项目主页:https://tensorcast.ai/ 今天的大模型基建,正在重复「造轮子」 当前的大模型基础设施中,不同任务通常配备有独立的优化系统:模型加载系统负责权重分发、KV Cache 系统负责 KV 存储和迁移、Checkpoint 系统负责模型状态保存和恢复。