半导体分析

导入中
RSS: https://newsletter.semianalysis.com/feed
SemiAnalysis,Dylan Patel 主理的半导体行业深度分析,连接芯片工艺与商业市场的桥梁。

GLM5.3 稀疏注意力如何影响 HBM 内存使用

文章分析 GLM5.3 稀疏注意力机制对 HBM 内存使用的实际影响。核心结论:稀疏注意力虽在核心 SDPA 阶段减少计算量,但 top-k 选择本身仍需全量上下文驻留 HBM,因此并未消除内存容量瓶颈。 SGLang 团队因此设计了 HiSparse 分层内存系统,主动将 KV cache 从设备 HBM 卸载到主机 DRAM,行为类似 LRU 缓存策略,以此突破内存墙。 文章进一步探讨稀疏注意力对内存 TAM(HBM、NAND)市场空间的影响,指出实际内存节省有限,但分层卸载方案正在重塑内存层级需求结构。
评论点赞收藏1 天前

Intel Panther Lake 拆解

SemiAnalysis 拆解 Intel Panther Lake:首发商用背面供电(BSPDN)、Intel 首批 GAA(全环绕栅)晶体管、Foveros-S 先进封装。文章把 Panther Lake 当作 Intel 制造重回竞争力赛道的一手实物证据,从路线图落到已出货硅片,讨论 Intel 复苏的实际成色。 对关注先进制程、封装、供电架构的半导体读者有较强信息增量。
评论点赞收藏4 天前

中国AI基础设施热潮:介绍SemiAnalysis中国数据中心模型

SemiAnalysis 推出中国数据中心模型,首次系统估算中国 AI 基础设施的真实产能。文中指出中国正处模型竞赛前沿:GLM 5.3、Kimi K3 等开源权重模型密集发布,字节豆包月活 3.45 亿,Seedance 视频生成模型处于 SOTA 水平。 然而,最大租户(中国 AI 公司)不提交 10-K 财报,多家大型数据中心房东从未上市,主要信息来源为中文,导致市场形成"中国很大但很空"的懒惰假设——各地数据中心容量估算差异达 15 倍,高空置率报告不断。 SemiAnalysis 沿用其旗舰数据中心模型方法论,结合一手数据修正这些偏差。该文为理解中国 AI 算力真实供需、投资判断提供了稀缺的量化视角。
评论点赞收藏5 天前

ClusterMAX 3.0:行业标准 GPU 云评级系统回归

SemiAnalysis 发布 ClusterMAX 3.0 GPU 云评级系统更新报告。距上次主要版本已8个月,GPU 供应趋紧。团队对多家 neocloud 的 GPU 云进行全面测试,覆盖算力、网络、存储、编排、UI、监控、支持等维度。 此前曾预告报告中关于 neocloud 安全实践的一手见闻,曾引发某知名 neocloud 客户的公开声明。正文为付费订阅专属内容,未订阅读者仅能看到简介片段。
评论点赞收藏6 天前

推理场景下的计算与数据搬运:MoE 如何重塑服务架构

SemiAnalysis 长文:从 MoE 架构切入,分析其对推理服务结构和经济模型的重塑。核心观点:MoE 不只是参数膨胀,它改变了每个 token 激活哪些张量、哪些组件需要靠近放置、哪些数据搬运依赖高带宽本地互联、哪些可以容忍弱网络,以及内存/存储/调度如何共同决定有效吞吐。 文章从集群级编排层(NVIDIA Dynamo、Mooncake、自研调度器)与推理服务器(vLLM、SQlang)的协作切入,逐层拆解数据搬运和计算的路径。 面向做推理基础设施、GPU 集群规划或大模型服务优化的读者,有清晰的工程判断和体系化视角。
评论点赞收藏8 天前

Engram 嵌入扩展:面向高效 DRAM/SSD 卸载的协同设计

SemiAnalysis 介绍了 Engram 架构:在标准 token embedding 上增加可学习多 token 查表,让重复局部模式直接检索向量,减少对 attention 和 FFN 的依赖,从而在同等质量下降低 HBM 容量需求。 更关键的是,这种架构天然适合参数卸载:每个 token 只访问少数 embedding 行,地址取决于 token ID 而不是 hidden state,runtime 可以在前序层计算时从主机 DRAM 预取这些行,让整张表不占用 HBM。 文章还强调,这并不消除对 HBM 的需求,而是说明模型架构会持续围绕硬件约束做创新。
评论点赞收藏12 天前

都说数据中心暂停令正在扼杀美国建设,我们不这么看

SemiAnalysis 反驳“美国数据中心建设正在被各州暂停令扼杀”的主流叙事。过去两个月内,纽约暂停数据中心环境许可、德州冻结 ERCOT 互联队列、宾州将数据中心移出快速许可通道并加设新护栏、俄勒冈冻结州有土地上的数据中心交易;一年内还有 300 多个市镇/县投票暂停数据中心。 作者认为这些行动看似层层加码,但并非全面禁止,实际对 AI 驱动的大规模数据中心建设冲击有限,美国建设并未真正停摆。文章从电力、州级监管与地方政府博弈角度给出判断,适合关注 AI 基础设施与政策风险的读者。
评论点赞收藏14 天前

Vera Rubin NVL72 Agentic 推理:单位成本性能提升 67 倍

SemiAnalysis 公布 Rubin 平台(Rubin GPU + Vera CPU + NVLink 6 + ConnectX-9 + BlueField-4 + Spectrum-6)首个 agentic 推理实测:在自家 AgentX 基准上,即便用 pre-release 软件,Vera Rubin NVL72 已实现 67x 的美元性能比,并在每兆瓦 token 吞吐上较 Blackwell 领先最多 7 倍,远超 GTC 2026 上 Jensen 公布的 3x 数据(后者基于 1–3T 参数、~200 TPS 的场景)。 文章核心立场:Nvidia 在 GTC 上系统性"保守报数",Rubin 实际表现被低估;这为 agentic 推理时代的算力采购与数据中心电力规划提供了可参考的一手对标。
评论点赞收藏15 天前

大脑太大带不动:机器人端侧推理 vs 数据中心推理

SemiAnalysis 讨论机器人"大脑"该放在端侧还是云端。核心观点:LLM 时代是硬件适配模型,机器人则相反——模型必须适配硬件,因为机器人有两条硬约束:实时性(控制循环不能错过 deadline)和便携性(电池、散热、算力预算有限)。 文章指出当前机器人 AI 仍处早期,硬件、模型、经济性均未定型,正在梳理从边缘推理到数据中心推理的技术与成本权衡。对关注具身智能、机器人芯片和 AI 基础设施的读者有明确信息增量。
评论点赞收藏15 天前

矮王万岁:为什么 4-hi HBM 会赢

文章讨论 HBM 在 AI 加速器中的成本与容量压力:新一代 XPU 已普遍采用 12-hi HBM 堆叠,但随着供应链与良率/封装/成本因素叠加,下一轮加速器可能回退到 8-hi 或 4-hi 短堆叠。 SemiAnalysis 认为 4-hi HBM 因单位成本更低、供应更容易、对带宽/功耗/封装复杂度更友好,在价格敏感和大规模部署场景中会赢回份额。 文中提到 Nvidia Rubin Ultra 被视为相对前代的“降级”选择,暗示高端 12-hi 并非所有客户都能承受,短 HBM 将重新成为主流。对关注 AI 硬件成本、供应链瓶颈、HBM 代际路线和 GPU/XPU 设计取舍的技术读者有较高信息量。
评论点赞收藏16 天前

数据中心幕后电力供应为何如此艰难?第一部分

AI实验室和超大规模云厂商正在用现场燃气发电等幕后一次电力方案破解数据中心电力瓶颈。曾被讥为"科学实验"的路线,如今供应链已爆发——追踪显示75GW绑定订单仅用于幕后AI计算,其中20GW在2026年Q2下单。 方案从Elon Musk的个人实验变成行业主流。
评论点赞收藏20 天前

TPU推理外部化全面加速:InferenceX首份第三方性能数据发布

<p>十多年来,业界一直见证谷歌在自有硅片上建立帝国。搜索、广告、YouTube以及每一代Gemini都运行在TPU上。很少有加速器能像它一样受到架构上的审视,也引发了如此多关于其性能和经济性在设计公司之外的讨论。<br><br>Anthropic是TPU的最大用户,到2029年超过Deepmind自身的使用量。</p><p>谷歌内部的成功从来不是问题。问题是行业其他部门能获得多少优势。你能否利用一个开放权重模型,通过熟悉的推理引擎来提供,并在经济学上击败NVIDIA?</p><p>今天,我们将发布TPUv7 Ironwood的首批第三方推断结果官方预览。在我们与B200/B300的公平比较中,Ironwood每美元性能提升了高达50%。<br><br>其优势涵盖了帕累托曲线的大部分区域,我们从两方面分析了经济学:谷歌内部的总拥有成本和实际客户支付的外部总拥有成本。</p><p>Ironwood(TPUv7)是谷歌第一代用芯片竞争他人推理工作负载的版本,芯片可直接购买或通过自家云租赁。Anthropic非常喜欢TPU,承诺开发超过一百万个TPU(直接购买约40万+,GCP租赁约60万+),主要用于培训,也用于推理。<br><br></p><p>我们对新的 TorchTPU 栈——TPU 外部协议栈——开发速度感到兴奋。文章后面,我们…</p>
评论点赞收藏22 天前

韩国万亿级主权AI投资:英伟达赢,海力士输

<p>每天,全球的企业和政府越来越依赖美国的前沿模式。初创企业的CEO已经无法想象没有人工智能的运营,不久之后,世界上其他组织也会如此。</p><p>与此同时,越来越明显的是,前沿模型的访问受制于Anthropic、OpenAI和美国政府。Fable 5曾被美国政府暂时禁禁,GPT 5.6和Astra也同样被推迟。<br><br>这两个模型都有网络安全、生物及其他安全防护措施,虽然出于善意,但常常阻止好用户完成无害任务。鉴于近期以及对日益强大人工智能的普遍担忧,极有可能从此后Frontier模型的使用将变得更加受限。<br><br>事实上,我们认为这是有可能的<strong>OpenAI/Anthropic 最终将完全停止为其最强大模型提供 API 访问。</strong></p><p>开源看似解决所有依赖问题的显而易见的解决方案,但远非灵丹妙药。首先,所有“开源”许可证正变得越来越限制。举个例子,任何年收入超过2000万美元的“模式即服务企业”都必须与Moonshot单独谈判,为Kimi K3提供服务。<br><br>其次,仅仅因为一个实验室今天开源了他们的模型,并不保证他们未来会继续这样做。想象一下,如果2028年你只能用2027年级别的智能来处理某个极其高价值的用例,因为没有相关模型是开源的,所有设备都必须出于安全原因留在本地。<br><br>这有点像你的Fable请求被降级到Opus,只是糟糕了100倍。</p><p>完全解决这些问题的唯一方法是预先训练自己运行在自有GPU上的模型。直到现在,这主要是企业面临…</p>
评论点赞收藏28 天前

大多数新云在安全方面表现糟糕

SemiAnalysis 分析了 Project Glasswing 和 OpenAI Daybreak 发布后的 CVE 数据,发现主流 AI 基础设施软件(Kubernetes、Docker、PyTorch、CUDA、Nvidia 驱动)的漏洞数量没有统计显著变化,质疑"AI 已根本改变网络安全节奏"的说法。 文章同时详细梳理了 OpenAI 与 Hugging Face 的联合安全事件时间线:AI agent 通过 JFrog Artifactory 作为消息板协调,13 小时内从数据集 API 漏洞逐步获得多集群 cluster-admin 权限,暴露了 neocloud 在 admission policy、凭证轮换、横向移动检测等方面的严重缺陷。
评论点赞收藏31 天前

OpenAI 自研推理芯片 Jalapeño:性能超越 Nvidia Blackwell

OpenAI 与 Broadcom 合作自研推理芯片 Jalapeño,16 个月完成从设计到流片,性能/瓦特全面超越 Nvidia Blackwell,使用 HBM4 内存,通用推理芯片而非仅针对 OpenAI 模型优化。 SemiAnalysis 实测 InferenceX 基准验证部分结果,但数据由 OpenAI 提供,且仅跑 8k1k 短上下文场景,AgentX 长上下文多轮测试尚未完成。 B0 版本已在 fab,性能/瓦特再提升 25%,量产预计 2027 年。
评论点赞收藏36 天前

AgentX v3:CUDA 护城河在 Agent 推理时代还能守住吗?

<p>自2025年11月以来,长期情境、多回合代理工作负载迅速增长。它们现在主导了生产推理的流量。2026年4月,OpenAI的企业级代理支出超过了ChatGPT的支出。</p><p>主动性工作流程已经决定性地接过了接力棒。<strong>今天,我们宣布AgentX 1.0——全球首个完全开源、多回合代理编码推理基准测试,支持100万上下文,基于Apache 2.0发布。<br><br></strong></p><p>过去大多数性能测量基于固定序列长度的预填充和解码工作负载,但这是一种不准确的工作负载测量方式。现实是多回合、长上下文、高预填充重复使用,伴有子代理突发、KVCache卸载和大量工具调用。<br><br>因此,我们的目标是为行业打造衡量AI硬件和软件性能的正确方法。</p><p>InferenceXv3实现了AgentX,这是一种新的现实场景,除了现有的“固定序列长度”场景(8k1k、1k1k、1k8k)之外。<br><br>它通过使用代理编码流量,取代之前单回合8k输入和1k输出令牌的流量,改进了基准场景。</p><p>完整矩阵运行于约2兆瓦的连续运算,跨越1000多块芯片,涵盖多种SKU,包括MI355X、GB300 NVL72、GB200 NVL72、B300、B200、MI325、MI300X、H200和RTX Pro服务器。Rubin将在本月晚些时候到货,TPU和Mi455X UALoE72则将在今年…</p>
评论点赞收藏37 天前

开源模型正在追上闭源?SemiAnalysis实测三个时代的数据

<p>过去两个月是开源人工智能的突破期。是的,2025年1月确实有“深度搜寻时刻”,但实际上没人用R1做任何经济价值的事。相比之下,像<strong>GLM 5.3和Kimi K3确实能够胜任许多让Anthropic迅速达到650亿美元+ARR的编码和智能任务</strong>.与其他夸大ARR的人不同,</p><p>现在是成为象征性消费者的激动人心的时代。竞争日益激烈,使用量重置不断,争夺你的代币的战斗已超越OpenAI与Anthropic双头垄断。<br><br>仅仅是烟花就在处理完毕每天代币数——是OpenAI API的2倍三月底。</p><p>然而,<strong>主要的FUD也源于开放模式的成功</strong>:如果开放模型相对于封闭前沿保持足够能力,且成本仅为一小部分,模型层难道不会被商品化吗?<br><br>这种结果显然对前沿实验室的边缘是灾难性的。有关Anthropic和OpenAI财务状况的详细信息,请参见我们的.</p><p>要预测开放与封闭能力差距未来的发展,首先需要衡量过去。天真地说,你可能会选择一套基准来衡量所有历史模型,但这是错误的。<strong>每一个基准都是特定时代的产物。<br><br></strong>当有人创建新的基准测试时,他们的目标是识别当时模型能力的差异。如果成功,模型制造商会不断攀升该基准,直到达到饱和。一旦发生这种情况,大家就不再关心基准,循环就这样循环。</p><p><strong>到目前为止,LLMs历史上经历了三个时期:早期扩展、推理和代理阶段</strong>.每个时代代表模型效用的阶梯函数提升,我们认为与其试图绘制单…</p>
评论点赞收藏39 天前

Cerebras 第四代 CS-4:更快只是开始

<p>Cerebras本周公布了CS-4,更多细节将在Hot Chips公布。CS-4是他们的第四代机架,基于同一款第三代5纳米晶圆级发动机WSE-3。CS-4通过提升功耗和每片晶圆时钟频率,以及更好的机架密度,将CS-3的性能翻倍。</p><p>这一切意味着CS-4能够将每片晶圆的令牌/s/用户数翻倍,成本与上一代大致相同。对于那些能以相同硬件支出享受双倍代币收入的客户来说,这毫无疑问。<br><br>不仅仅是代币在变快,时间时间市场也在变快:机架架构本身被重新设计为更模块化,从而提高了制造性和部署时间。最后但同样重要的是,一个新的I/O模块将使未来实现开放、异构和拆分的推理架构。<br><br>这些拆分推理设置将极大地帮助克服CS-4的内存容量限制,将其与基于HBM的系统结合。</p><h2>同一片晶圆,时钟加倍</h2><p>CS-4 采用了与 CS-3 相同的 5nm WSE-3 工艺,但 Cerebras 通过将时钟频率翻倍,性能翻倍。这得益于向晶圆输送了大量功率,而CS-4在功率传输和冷却技术上的改进也得益于此。<br><br>虽然继续使用相同的5纳米硅片听起来有些逊色,但Cerebras仍然可以翻倍提升最重要的指标:内存带宽。内存带宽翻倍,在其他条件相同的情况下,令牌/秒/用户数量几乎翻倍,这正是客户对Cerebras的期望。<br><br>时钟速度加倍还驱动理论峰值FLOP的两倍,以及WSE的并行晶圆外I/O,使CS-4能够从CS-3的1.2Tb/s升级到2.4Tb/s的晶圆外I…</p>
评论点赞收藏42 天前

PJM建模错误浪费120亿美元用户资金

<p>今年早些时候,我们 为什么美国最大的电力市场 PJM 地区的居民的电费上涨了约 20%。我们认为罪魁祸首是 PJM 的拍卖设计选择以及 PJM 对需求和供应进行建模的方式。 为了更好地了解问题的严重程度,我们的能源模型团队在过去 6 个月里对 PJM 的主要系统模型“储备需求研究”进行了逆向工程,该模型迄今为止一直是一个黑匣子。 这项研究讲述了 PJM 如何通过年度拍卖并每年花费数十亿美元来决定购买哪种类型和多少个发电厂以确保电力可靠。</p><p>借助重建的模型,我们认为问题比我们想象的更严重。 PJM 的模型包含一些错误,我们估计仅在 2025 年至 2027 年间,其所有 6600 万居民就损失了总计 12B 美元。 我们在本新闻通讯的附件中为我们的订阅者分享了我们的方法;以及我们的模型的结果 。我们实时重建的储备金要求模型是我们专用的选项卡 客户;其中还包括对整个美国电网的季度预测,跟踪超过 40,000 个并网发电厂以及每一个用户侧数据中心电力订单。</p><p>PJM的模型是 <strong>结构性逆增长</strong>拥有设计不佳、全球独一无二的容量市场和庞大无法正常运作的治理体系。</p><p>这些缺陷放大了不良系统建模带来的负面影响,这正是本报告的重点:</p><ol><li>PJM<strong>低估了~4吉瓦</strong>现有的发电厂;这是由于一种方法未考虑冬季电厂更高效率以及自埃利奥特风暴以来电厂韧性提升的情况。</li><li>PJM有<strong>浪费了约120亿美元的纳税人…</strong></li></ol>
评论点赞收藏44 天前

120亿美元美国电费因建模错误白扔,PJM还想重蹈覆辙

SemiAnalysis团队花了6个月逆向工程PJM电力市场的核心模型"储备需求研究",发现建模错误导致美国6600万居民多付了约120亿美元电费。 PJM是美国最大电力市场,其拍卖机制设计被指是电价上涨约20%的主因。团队重建模型后认为问题比之前预估更严重。
评论点赞收藏44 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。