OpenAI previews Ultrafast API tier for GPT-5.6 Sol, up to 14x faster via Cerebras
OpenAI has previewed Ultrafast, a new API service tier for its flagship GPT-5.6 Sol model, developed with AI chip maker Cerebras. The tier claims up to 14x faster inference, delivering up to 750 output tokens per second without quality loss, and is initially available as a limited preview to select customers. Benchmarks cited include completing Humanity's Last Exam in 11 hours 11 minutes, about 7x faster than Claude Fable 5, and a 5.6x end-to-end speedup on the GDP-Val benchmark.
Coverage timeline
OpenAI Blog
Preview Ultrafast, a new OpenAI API service tier that runs GPT-5.6 Sol up to 14× faster. Powered by Cerebras, it delivers up to 750 output tokens per second.
Techmeme
Zac Hall / 9to5Mac : OpenAI previews Ultrafast, an API tier powered by Cerebras that runs GPT-5.6 Sol up to 14× faster and generates up to 750 output tokens per second — OpenAI is previewing a new way to run its most capable GPT-5.6 model at dramatically higher speeds. The company says its new Ultrafast …

TechCrunch AILucas Ropek
OpenAI is launching a preview of a sped up version of its latest, most powerful model, in an effort to court enterprise users.
机器之心机器之心
AI 开始卷信息不对等了? 8 月 14 日凌晨,OpenAI 联合 AI 芯片厂商 Cerebras 正式预览了其旗舰模型 GPT-5.6 Sol 的全新服务层级「超高速模式」(Ultrafast Mode)。 在该模式下, GPT-5.6 Sol 的输出速度最高可达 750 tokens/s ,相比目前 Standard(标准)模式约 53 tokens/s 的推理基线,速度提升最高达 14 倍,同时不降低任何质量。横向对比的话,GPT-5.6 Sol 加速后比 Fable 5 快 11 倍,比 Opus 4.8 在 Fast 模式下快 5 倍。 Ultrafast 模式将率先在 OpenAI API 中推出,当前已面向部分客户推出有限预览版。 为此,OpenAI 与 Cerebras 还对当前先进 AI 大模型现在的速度和智力对比拉了个表格,GPT-5.6 Sol Ultrafast 处于绝对领先的位置: 在 Cerebras 的博客中,工程人员介绍了在「人类最后的考试」(Humanity's Last Exam, HLE)上进行的测试,他们把 Ultrafast 后的模型与直接竞对进行了对比。我们知道,HLE 是一项具有挑战性的模型基准,包含 2500 道题,通常只有化学、经济学和文学等领域的博士才能解答。 GPT-5.6 Sol 在超快模式下仅用 11 小时 11 分钟就回答了全部问题 。而 Claude Fable 5 则需要 78 小时 27 分钟,也就是超过三天的连续计算才能得出相同的结论。GPT 超快模式仅用一个工作日就完成了人类知识的前沿领域,在准确率相近的同时,速度几乎是 Claude Fable 的 7 倍。 随着模型能力的不断提升,快速推理的应用范围也会扩大。GPT-5.6 Sol 是 OpenAI 迄今为止在法律文书、金融模型和工程报告方面表现最佳的模型。在 GDP-Val(衡量经济价值知识工作任务的基准)上,Ultrafast 实现了 5.6 倍的端到端速度提升,且质量未受影响,充分展现了更快的推理速度如何加速经济价值工作的开展。 更快的 AI 处理速度为新兴工作流增加了不少可能性,人们现在可以将智能体部署到问题的关键路径上。OpenAI 为你列举了一些应用场景: 事件响应和可靠性:当关键系统发生故障时,AI 分析应用程序日志、最近的代
