2026-06-30 · 🧠 模型← 本期
Cerebras OpenAI deal capacity has effectively killed the waitlist for everyone else [D]
想在 Cerebras 的云上跑推理,得先申请、再等它分配产能。最近一群开发者发现,这个队伍已经停住了:新号排进去,遥遥无期。
要理解这为什么扎心,得先知道大家为什么排队。绝大多数推理跑在英伟达 GPU 上,速度够用但算不上快,模型一个字一个字往外吐,长回答就得等。Cerebras 走的是另一条路:把一整块晶圆做成单颗巨型芯片,把模型权重塞进片上高速内存,省掉芯片间来回搬数据的开销。结果就是吐字极快,同一个开源模型在它这儿能冲到每秒上千个 token,是主流 GPU 方案的好几倍。对语音助手、实时代码补全这类等不起的应用,这个速度是硬需求。
问题就出在这份速度太抢手。OpenAI 今年初签下的采购合同,如今规模已涨到 200 亿美元以上,覆盖 750 兆瓦推理算力、一路锁到 2028 年,还附带一份最高约一成股份的认股权证和 10 亿美元建数据中心的借款。换句话说,Cerebras 未来几年产出的绝大部分算力,已被一个客户预定走,剩下的散客自然排不上号。
这笔单子对 Cerebras 本身也不全是好消息。IPO 刚满六周、营收几乎翻倍,股价却在财报后跌了约一成,因为公司把季度核心毛利率指引从约 47% 下调到 36%–38%,全年经营利润率甚至给到负 28% 至负 32%。履行超大合同的边际成本越来越高:连主力订单都在贴钱做,自然没余力再照顾小客户。
放到更大的盘子看,这是 AI 算力从训练转向推理的一个缩影:谁能又快又稳地把 token 吐出来,谁就握住了实时应用的入口。OpenAI 一边斥巨资绑定英伟达算力,一边把 Cerebras 的产能包圆,本质是为未来几年的实时推理提前占坑,把对手的稀缺算力越挤越少。
需要说清的是,“排队号作废”目前主要是社区和开发者的体感,Cerebras 官方并未承认把小客户挤了出去,也没给出恢复放号的时间表。产能会随数据中心扩建慢慢补上,合同里也留了 2030 年扩到 2 吉瓦的选项。但对已经把技术选型压在 Cerebras 速度上的初创公司来说,“以后会好”救不了眼下就要上线的产品——这才是巨头包场之外,真正被动的那部分人。