Cerebras 发布 CS-4:晶圆级 AI 加速器推理速度比 GPU 快 30 倍
Cerebras Systems 今日正式发布全新一代晶圆级 AI 加速器 CS-4,号称是业界速度最快的 AI 推理加速器。CS-4 采用了三颗第三代晶圆级引擎 WSE-3 Turbo,每一颗晶圆的性能均比上一代产品提升 2 倍,系统整体推理速度相比传统 GPU 方案最高提升 30 倍之多。这一发布正值 AI 推理需求爆发式增长之际,各大云服务商都在积极寻求 GPU 之外的高效替代方案,以应对日益增长的推理成本和功耗压力,Cerebras 的晶圆级方案因此备受关注和期待。
CS-4 的核心创新在于其全新的 Nexus 机架级平台架构。该架构将计算、供电和 I/O 三大核心模块完全解耦,每个晶圆级背包都集成了晶圆、电源转换、液冷散热、高速 I/O 和控制器于一体,组件数量相比上一代减少 50%,部署时间从过去的天级缩短到小时级。供电模块距离处理器仅 5 毫米,比传统 GPU 板的 50 毫米缩短了近 100 倍,几乎完全消除了板级功耗损失,使得更多能量用于实际计算任务,大幅提升了系统的整体能效比和性能表现。
在性能方面,CS-4 支持超过 10 万亿参数级别的超大模型推理,晶圆间互连延迟低至 2 微秒,可实现每秒 1000 个 Token 以上的交互式解码速度,确保了大模型推理时的流畅用户体验。新一代可编程 I/O 子系统将带宽翻倍、延迟大幅降低,为大规模分布式推理提供了关键基础设施支持。Cerebras 表示,CS-4 每瓦特吞吐量比上一代 CS-3 提升了 10 倍,在同等功耗预算下能够处理更多 AI 工作负载,对于追求绿色计算的数据中心运营商来说极具吸引力,有望大幅降低 AI 推理的运营成本。
这一发布进一步巩固了 Cerebras 在专用 AI 芯片领域的领先地位,也为超大规模数据中心提供了一条 GPU 之外的差异化技术路径。随着大模型参数规模持续膨胀,从数千亿到数万亿甚至十万亿参数,传统的 GPU 集群在互连带宽和内存容量方面面临越来越严峻的瓶颈。CS-4 的晶圆级方案通过极致的集成度和创新的互连架构解决了这些挑战,可能成为下一代 AI 数据中心的核心计算单元,开辟 AI 计算的全新范式,改变现有 AI 芯片市场格局。
业界将密切关注 CS-4 在实际部署中的表现和客户采用情况。如果 Cerebras 能够兑现其性能承诺,CS-4 有望在 AI 推理市场占据重要份额,特别是对于那些对推理延迟和吞吐量有极致要求的超大规模应用场景。与此同时,这也将对 GPU 市场的现有格局产生深远影响,推动整个 AI 芯片行业加速创新和竞争,最终促使整个行业向着更加多元化和高效化的方向发展。