Cerebras

Cerebras 是快速、轻松进行 AI 训练的首选平台。访问 cerebras.ai 了解更多。

Cerebras Hot Chips 2026:CS-4架构揭秘与CS-5/CS-6路线图

Cerebras在Hot Chips 2026上公开了CS-4芯片的架构细节,并预告了CS-5和CS-6的技术路线。CS-4采用Nexus机架级平台,供电距离仅0.5毫米(GPU的1/100),单WSE-3T提供53.5 PB/s片上带宽,是NVIDIA Rubin 72卡机架NVLink带宽的200倍以上。 CS-5目标2027年,对开源模型单用户输出10,000 token/秒,对Kimi等万亿参数模型5,000 token/秒。CS-6将引入3D堆叠DRAM,在保持片上数据局部性的同时大幅提升内存容量。
评论点赞收藏34 天前

Cerebras CS-4:号称比GPU快30倍的晶圆级AI推理系统

Cerebras发布CS-4晶圆级AI推理系统,宣称比GPU快30倍,每瓦吞吐比CS-3提升10倍,10万亿参数模型可达每秒1000+ token。采用三片WSE-3 Turbo晶圆架构,晶圆间互联延迟降至2微秒,模块化设计将部署时间从数天缩短至数小时,本季度开始发货。
评论点赞收藏42 天前

Cerebras 联合 OpenAI 推出 GPT-5.6 Sol Ultrafast 模式:7 倍于 Claude Fable 5 的推理速度

Cerebras 与 OpenAI 联合推出 GPT-5.6 Sol Ultrafast 模式,输出速度达每秒 750 token,官方称比 Claude Fable 5 快 7 倍、比 Opus 4.8 Fast 模式快 5 倍。 在 HLE(2500 道博士级难题)基准测试中,Ultrafast 模式 11 小时 11 分钟完成,Claude Fable 5 需 78 小时 27 分钟。底层依赖 Cerebras Wafer-Scale Engine 的 44GB SRAM 单片架构,避免 GPU 的显存带宽瓶颈。 目前仅限部分客户预览,开放范围将逐步扩大。
评论点赞收藏47 天前

AMD与Cerebras联手推出异构AI推理解决方案

AMD与Cerebras宣布合作,推出基于AMD Helios与Cerebras晶圆级引擎的异构AI推理方案。该方案将AMD的高吞吐量与Cerebras的低延迟解码结合,旨在解决实时智能体等场景对低延迟的需求,宣称能效提升5倍。 预计2026年下半年通过Cerebras Cloud上线。
评论点赞收藏67 天前

Cerebras 如何构建其内部知识库

Cerebras 分享内部知识库构建细节。针对 Slack 非结构化数据,采用混合检索策略:全文搜索匹配错误码,Embedding 处理语义 paraphrase,IDF 过滤废话,年龄衰减保证答案时效。 代码库使用 CocoIndex 进行语言感知的递归分块与增量同步。检索层通过 RRF 融合多路结果,并暴露 MCP 工具供 Agent 直接调用,实现检索与编排解耦。
评论点赞收藏73 天前

Cerebras 取消免费套餐,转向付费试用模式

Cerebras 宣布取消免费层级计划,转为提供 $5 免费信用的试用模式。其开发者 API 定价显示 GPT OSS 120B 输入 0.35美元/M tokens,输出 0.75美元/M tokens,速度约 3000 tokens/s。 ZAI GLM 4.7 将于 2026 年 8 月 17 日停用。Cerebras Code Pro 和 Max 版本已售罄。
评论点赞收藏75 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。