Chips and Cheese

RSS: https://chipsandcheese.com/feed
Chips and Cheese,深度解析计算机硬件与软件交互细节的半导体分析博客。

DAC 2026专访Synopsys:芯片设计的多物理场签核与800V供电变革

Synopsys与AMD合作推进3DIC设计,芯片签名验证从单一电气签核转向机械-电气、热-电气、电迁移、电磁多物理场联合签核。数据中心供电架构正从54V向800V演进,Nvidia主导、Bosch等支持标准化组件,电流降低大幅减少I²R损耗。400G SerDes标准仍在制定中,预计还需1.5到2年,PAM6/PAM8方案竞争激烈,Nvidia采用双向224G作为过渡。UCIe等chip-to-chip互联标准各厂商 lane 数不统一,信号完整性设计复杂度持续上升。
评论点赞收藏4 天前

英伟达Vera白皮书有个漏洞

英伟达Vera CPU白皮书被指存在多处技术误导。Olympus核心本身表现强劲——Phoronix实测Geomean超EPYC 9575F 10%、超Xeon 6980P 1.55倍。但白皮书将传统SMT描绘为低效时间片轮转、把可选的32 NUMA节点配置当作x86必然结果、将SPEC整数基准重新包装为"agentic benchmarks",这些表述都经不起推敲。作者逐条拆解了SMT图示错误、NUMA拓扑选择性呈现、IPC跨ISA不可比等问题,指出白皮书硬件部分扎实、叙事部分用力过猛。
评论点赞收藏10 天前

Arm Cortex-A55 深度剖析:从分支预测到内存子系统的全面升级

Cortex-A55 是 Arm 2017 年推出的 5 系列低功耗核心,在 Mediatek Genio 1200 等芯片中作为 A78 的小核搭档使用。实测显示 A55 相比 A53 的主要改进集中在前端分支预测和内存子系统:引入了感知器预测器和 48 条目微 BTB,L1D 支持每周期同时执行一次加载和一次存储,FMA 延迟从 8 周期降至 4 周期。但 A55 仍缺乏高性能核心常见的大 BTB,分支预测精度远落后于现代乱序核心,且在某些 Clang 编译场景下预测表现反而退步。
评论点赞收藏13 天前

RosaicLabs、Atom RTL 与 32 片 AMX:拼凑 x86 拼图

Intel 向初创公司 RosaicLabs 开放 Atom CPU 的 RTL 代码,同时 Linux 内核邮件列表出现支持 32 个 AMX tile 的实现。 Intel 罕见地允许第三方获取其 x86 核心 RTL,这与其一贯的保守策略形成对比。Phoronix 发现的内核补丁显示,新实现将 AMX tile 数量从 Intel 量产版的 8 个提升至 16 和 32 个,暗示潜在的架构变更或竞争压力。
评论点赞收藏16 天前

AMD 推进 AI 2026:与首席架构师 Alan Smith 对话 CDNA5

AMD 首席架构师 Alan Smith 在 Advancing AI 2026 活动中详解 CDNA5 架构,宣布 MI455 和 Helios GPU 正式推出。CDNA5 从 GCN 转向 RDNA 架构,是数据中心 GPU 的重大技术跃迁。 Alan Smith 指出 CDNA5 针对 AI 训练和推理 workload 做了深度优化,支持更高带宽、更低延迟的芯片互联,并强调与软件栈的深度协同。相比前代,CDNA5 在能效比和单精度算力上提升显著,尤其适合大模型训练场景。 该访谈包含大量工程细节,如计算单元设计、内存层次结构、互连拓扑等,对关注 GPU 架构和 AI 硬件的读者有较高参考价值。
评论点赞收藏19 天前

AMD Instinct MI455X:瞄准太阳

Chips and Cheese 深度解析 AMD 新一代 AI 旗舰 GPU MI455X。基于 CDNA5 架构,核心从 GCN 转向 RDNA 设计,引入 WGP 概念,支持 HBM4 并提供 432GB 显存。重点在于 Helios 机架级扩展方案,通过 UALink over Ethernet 实现单 Pod 72 卡互联,提供 260TB/s 的 scale-up 带宽。文章详细拆解了 SIMD 宽度变化、多播加载技术对矩阵乘法的加速以及 Infinity Fabric 替代 PCIe 的连接方式,是了解 AMD 下一代数据中心硬件架构的高信息量一手技术分析。
评论点赞收藏23 天前

通过 LLVM 代码解析 GFX1251 与 GFX1250 的架构差异

Chips and Cheese 通过 LLVM 代码深入对比了 AMD GFX1250 与 GFX1251 架构差异。GFX1251 专为 HPC 市场优化,引入全速率 FP64、Packed FP64/U64 指令及 FP64 WMMA 矩阵运算,显著增强双精度计算能力。相比之下,GFX1250 在低精度矩阵数学上表现更佳。文章指出 AMD 在 GFX12.5 家族中对不同负载进行了高度专业化分工,GFX1251 的改进旨在满足科学计算对数值稳定性和重现性的严苛要求。
评论点赞收藏26 天前

从 LLVM 代码窥探 AMD 下一代加速器 GFX1250 架构

基于 LLVM 代码逆向分析 AMD 下一代数据中心加速器 GFX1250(MI455X)架构。该芯片移除了几乎所有图形渲染功能,成为纯计算卡。核心升级包括:支持 Wave32 模式、单 Wave 寄存器地址空间翻倍至 1024 VGPR、LDS 与 L0 缓存合并为统一的 WGP Cache。AI 方面引入类似 Nvidia Thread Block Cluster 的集群调度机制、硬件级 Tanh 加速及 128B 原子内存操作,旨在对标 NCCL 提升集群通信效率。
评论点赞收藏28 天前

x86 准备好迎接 ACE 挑战了吗?

探讨 Intel AMX 扩展在应对新工作负载时的演进,以及 x86 架构如何通过指令集扩展来加速矩阵乘法等机器学习任务。文章分析了 2D tile registers 和专用执行单元的配置机制,为理解 x86 在 AI 时代的硬件适配提供了底层视角。
评论点赞收藏33 天前

专访英特尔 Xeon 6+ 产品总监:详解 AET 硬件能耗监控与新架构

Chips and Cheese 采访 Intel Xeon 6+ 产品总监 Kira Boyko。重点介绍了新特性 AET(Application Energy Telemetry),这是一种硬件级的应用能耗遥测功能,可精确追踪核心级能耗,优于软件估算。此外还讨论了 Xeon 6+ 简化的 SKU 路线图、18nm 工艺以及服务器与客户端技术的共享机制。
评论点赞收藏63 天前

SPEC CPU2026 基准测试评估

对SPEC CPU2026这一长期确立的行业标准基准测试套件进行评估,探讨其在各类出版物中的普遍性及测试意义。
评论点赞收藏85 天前

Geekbench 6 基准测试评估

评估Geekbench 6基准测试工具,分析不同应用对系统需求的差异,探讨单一基准分数的代表性局限。
评论点赞收藏100 天前

深入解读高通下一代 Adreno X2 GPU 架构:HPM 内存与 Wave64 革新

Chips and Cheese 专访高通 GPU 团队负责人 Eric Demers,深入解析 Adreno X2 架构。核心亮点包括引入 21MB 片上高性能内存 (HPM) 以大幅降低 DRAM 带宽压力,从 Wave128 转向更高效的 Wave64 配合双发射机制,以及原生支持 DirectX 12.2 Ultimate、Vulkan 1.4 和 OpenCL 3.0。内容包含大量底层硬件设计权衡的工程细节,对关注移动端 GPU 架构和 Windows on ARM 性能的技术读者具有高价值。
评论点赞收藏222 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。