产品更新

ChatGPT一夜提速14倍:GPT-5.6 Sol新模式每秒750 token,靠Cerebras晶圆级引擎

2026年8月15日,OpenAI发布Ultrafast预览版,GPT-5.6 Sol跑在新档位下最高比标准处理快14倍,每秒吐750个token。关键在于智能水平一点没变,变的只是硬件和调度方式——不少厂商做快速版实际把大模型换成参数更小能力打折的版本,但Ultrafast跑的依然是最高档的GPT-5.6 Sol。速度靠Cerebras晶圆级引擎撑起,模型权重直接放入芯片上44GB的SRAM里不用像传统GPU反复从显存搬运数据,绕开了显存带宽这道长期卡住推理速度的瓶颈。OpenAI和Cerebras今年初签了多年协议计划部署750MW晶圆级系统,总值超100亿美元。

同日ChatGPT桌面版上线Computer History功能,记录点击、打字、快捷键、应用切换等交互事件——不用用户开口交代就能知道电脑上在忙什么,不截屏不录音不录系统音频。用户问"我上次做到哪了""今天早些时候找的那份提案文档在哪",它自己就有答案。碰上重复工作流程还能存成skill。临时抓取的事件文件最多本地保留48小时,OpenAI服务器处理完不留存也不拿去训练。

过去半年几家头部模型厂几乎同时把"更快"做成独立产品线。Anthropic 5月上线Fast Mode将响应时间中位数从2.8秒压到1.2秒;Google有Gemini Flash Live;xAI给Grok单独开了fast端点。芯片层面Cerebras中小模型每秒3000 token,Groq主打低延迟,SambaNova高并发更稳。国内字节豆包靠火山引擎主打低延迟,阿里Qwen-Turbo定位超快超长上下文低成本,小米MiMo-V2.5-Pro-UltraSpeed在8卡通用GPU上把万亿参数模型推到每秒1000 token以上。模型推理速度已卷到没人敢不做。

← 返回AI热点列表