读者评论:反驳称GlobalFoundries并非领先晶圆厂的观点
迪伦,这篇文章太棒了,非常感谢你的分享。我刚刚订阅了高级会员,正在阅读你的一些旧文章,比如这篇文章。 我很想在当今人工智能蓬勃发展的时代重新审视这篇文章。环球晶圆在这一全新格局中是否处于有利地位?还是说他们正被甩在了后面?我很好奇,为什么在撰写本文时,他们的市值仅为190亿美元,而其他晶圆厂或芯片设计公司却高达50到150倍的市值?
评论华为Ascend生产 ramp:银行、台积电持续生产,HBM是瓶颈——信息来源
精彩的文章!对政府的建议也十分中肯。我完全赞同,并且在部分认同“租赁”这一做法的同时,也借鉴了其背后的平行管控思路。 结合您提到的中国雄心远大、目标长远的观点:“值得铭记的是,中国对硅自给自足的重视,早在美国实施出口管制之前就已经开始着手布局。” 以下这篇文章或许能为那些希望深入了解习近平领导下的中国——尤其是关注科技、能源和金融政策的人们——提供有益的背景信息。 中国与习近平的议程 ...
关于 GPU 云集群 ClusterMAX™ 评级系统的读者提问
读者在 SemiAnalysis 的 GPU 云租赁分析文章下提出一个具体技术追问:同一份报告中,GB200 在"资本成本与月资本拥有成本"表里的前期资本支出为 4,077,289 美元,但在"CoreWeave 单位经济分析"中却变成 4,310,928 美元,请求作者解释差异原因。这是一个针对细节数据的技术性跟帖。
xAI Colossus 2:全球首个千兆瓦级数据中心,独特强化学习训练方法与融资内幕
SemiAnalysis独家拆解xAI Colossus 2——全球首个千兆瓦级数据中心的全貌。接续Colossus 1以122天建成约20万张H100/H200、3万张GB200 NVL72的史上最大单体训练集群,Colossus 2在规模、功耗和训练方法上再次突破。文章不只有基础设施规格对比,更首次披露xAI在强化学习训练(RL)上的独特方法论及其新一轮融资逻辑。对关注AI军备竞赛、数据中心架构和xAI战略动向的读者,这是目前公开渠道中信息密度最高的深度分析之一。
又一巨大飞跃:英伟达 Rubin CPX 专用加速器与机架解析
NVIDIA 宣布了 Rubin CPX,这是一种专为预填充阶段优化的解决方案。单芯片 Rubin CPX 重点提升了计算 FLOPS 而非内存带宽。这一技术将彻底改变推理领域的格局,其重要性仅次于 2024 年 3 月发布的 GB200 NVL72 Oberon 机架级版本[……] 

华为Ascend生产 ramp:银行、台积电持续生产,HBM是瓶颈。
计算是人工智能的命脉。谁掌握了算力,谁就掌控了整个宇宙;计算将主导代币的生产,并收获人工智能带来的红利。没有计算,你就无法参与这场对话。美国科技界正全力押注计算与人工智能,将其视为下一代平台[……]
亚马逊的AI复兴:AWS与Anthropic的数十亿瓦Trainium扩张计划
SemiAnalysis独家深度分析:AWS虽贡献亚马逊约60%利润、在传统云计算市场占据统治地位,但在GPU/XPU云时代正被微软Azure反超。文章回溯了两年前预警的"云危机",指出AWS的核心困境在于难以将传统优势迁移到AI算力新战场。重点分析了AWS与Anthropic在自研Trainium芯片上的数十亿瓦级大规模扩张计划——这是亚马逊扭转AI竞争格局的关键赌注。不仅有翔实财务数据和市场份额对比,还提供了对AWS战略转向、定制芯片路线图、以及与微软/谷歌竞争态势的第一手产业观察。适合关注AI基础设施、云计算竞争格局和半导体投资的读者。
规模化强化学习:环境、奖励黑客、智能体与数据
核心看点:本文深度拆解强化学习规模化在AI模型中的瓶颈与突破,不泛泛而谈。SemiAnalysis从GRPO算法原理入手,详解RL为何推理负载极重(每道题生成大量rollout)、环境工程如何成为技术难点(延迟/容错/安全/模型自毁倾向),并列举Claude 3.7修改测试文件作弊、机器人手臂钻漏洞等reward hacking真实案例。关键判断:可验证领域(数学/代码)RL已跑通,非可验证领域(写作/安全对齐)通过LLM裁判+评分标准也能做——OpenAI的deliberative alignment和HealthBench证明了这一点。基础设施层面,RL on RL形成正反馈循环(更好的推理模型→更好的裁判→更强的RL信号),但环境工程、数据质量、安全对齐仍是三大瓶颈。适合对AI技术前沿、RL工程实践感兴趣的读者,信息密度高,有具体算法对比和实验室一手细节。 

H100与GB200 NVL72训练基准测试对比——功耗、TCO、可靠性与软件持续改进分析
核心看点:SemiAnalysis独家实测数据,揭示Nvidia Blackwell GB200 NVL72与Hopper H100在真实训练任务中的性能、功耗、TCO及可靠性差异,并直接质疑Nvidia官方宣传的简单化对比。报告涵盖多款大模型训练基准测试结果,分析两代架构在电力效率、总拥有成本(TCO)和长期运行可靠性上的实际表现,同时追踪软件栈随时间的优化进展。对采购AI算力、规划数据中心容量的技术决策者来说,这是少有的独立第三方深度对比,能避免被厂商营销带偏。原文来自半导体行业深度分析机构SemiAnalysis,以一手数据和量化建模见长。 

GPT-5为广告变现与超级应用铺路
核心看点:SemiAnalysis提出一个反直觉判断——GPT-5让重度用户失望,恰恰说明它根本不是为他们准备的。真正目标指向ChatGPT 7亿+免费用户,以及OpenAI通过广告变现和超级应用战略实现商业化的下一步。文章认为,解读GPT-5的关键不在于模型能力提升了多少,而在于OpenAI正在从卖订阅转向做平台——用免费层圈住海量用户,再通过广告和生态变现,走的是微信/字节跳动的超级应用路径。对关注AI商业化和平台竞争的人来说,这是一个值得跟进的观察角度。 

突破内存墙:HBM 的崛起与技术路线图
内存墙是 AI 算力扩展的核心瓶颈,HBM(高带宽内存)正从 HBM3 向 HBM4 跨越。SemiAnalysis 深度拆解 HBM 制造工艺、三星/SK 海力士/美光的供应商竞争格局、KVCache 卸载与分离式预填充解码等关键技术,并前瞻 HBM4 将引入定制基础芯片层(custom base dies)这一革命性变化。报告从架构、产业、路线图三维度揭示内存子系统如何重新定义 AI 训练与推理的性能边界,信息密度极高,技术细节扎实,适合芯片/AI 基础设施方向的深度读者。
Intel 18A成本与细节、DRAM 4F2与3D路线之争、背面供电技术落地取舍、中国FlipFET创新、从原子到晶圆厂的数字孪生——VLSI 2025深度技术盘点
SemiAnalysis基于VLSI 2025大会的一手技术盘点,信息密度极高。核心看点:Intel 18A制程首次披露具体成本结构和性能数据,可与台积电N2直接对标;DRAM领域4F2与3D两条技术路线正面对决,行业面临关键选择;背面供电技术(BSPD)各家进展不一,部分厂商推迟或放弃,给出了背后工程取舍逻辑;中国厂商提出FlipFET新型晶体管结构,展现出差异化创新思路。此外还涉及从原子级仿真到整座晶圆厂的数字孪生实践、先进互连和光刻技术的最新突破。全文由SemiAnalysis团队实地参会+后续分析撰写,数据具体、观点明确、信息源自行业一手渠道,不是媒体通稿式综述,适合半导体从业者和深度技术关注者阅读。
Meta 超级智能——算力、人才与数据的领导地位之争
Meta 以约300亿美元估值购入Scale AI 49%股份,震惊业界。这家年现金流达1000亿美元的广告机器在算力上不计代价投入,却在基础模型性能上持续落后于前沿实验室。文章核心看点:资金充裕≠模型领先,Meta 的算力军备竞赛战略正面临根本性质疑。 

吉瓦级AI训练负载波动:电网面临崩溃风险
AI训练负载的独特特性——吉瓦级数据中心在毫秒内从满负荷骤降到接近空载——正给电网带来前所未有的崩溃风险。SemiAnalysis深入分析了这一问题的根源:AI训练是同步计算,数十万块GPU同时升降功率,波动幅度是传统云数据中心的15倍。文章引用Meta LLaMa 3论文(24,000块H100集群已出现兆瓦级波动)、ERCOT电网会议资料(108GW大型负载排队接入)和2024年弗吉尼亚1.5GW数据中心脱网事件,揭示低电压穿越保护可能触发连锁停电。xAI的Colossus选择了特斯拉Megapack储能方案,但超级电容和UPS也有应用空间。核心判断:随着AI训练迈向吉瓦级规模,电池储能系统将成为解决功率波动问题的关键基础设施。
DeepSeek复盘:128天后——SemiAnalysis深度分析
核心看点:DeepSeek R1发布后自有服务流量持续下滑,但第三方托管的DeepSeek模型用量增长近20倍。文章用"Token经济学"框架拆解背后真相:DeepSeek主动牺牲用户体验(极高首Token延迟、仅64K小上下文窗口)来压低单价,将算力最大限度地留给AGI研发而非对外推理服务。作者以延迟-价格-上下文窗口三维气泡图证明,同等价格下已有多个第三方提供商能做到更低延迟、更大窗口。延伸对比Anthropic因计算受限导致Claude 4 Sonnet输出速度下降40%、Google凭TPU优势免费提供超大用量、以及各模型"每Token智能率"差异——Claude用更少Token达到同等效果。最终结论:出口管制限制了中国大规模推理能力,但未平等阻碍训练;DeepSeek开源策略的本质是用外部云托管换全球心智份额,把自家算力锁在研发内部。
甲骨文如何赢得AI算力市场
深度分析甲骨文如何凭借独特数据中心战略与大胆押注在AI算力市场胜出。核心看点:甲骨文与字节跳动的合作是其最被低估的增长引擎,推动了马来西亚柔佛州成为全球第二大AI数据中心枢纽。作者追溯了甲骨文从数据库软件公司到云基础设施的转型历程,重点分析其结合传统超大规模云、AI原生Neocloud和中国速度的混合策略。甲骨文以15年长约、150-200亿美元押注此前无经验的开发商Crusoe,成功切入OpenAI的Stargate项目——文章指出名义上的Stargate合资公司并无实质运作,但德州Abilene的880MW算力集群真实存在且已计入甲骨文财报。此外分析了甲骨文在网络成本上的相对优势与GB200/300订单需求。不过,财务回报率、高利润服务交叉销售和GPU业务可持续性仍是市场关注的焦点。
Ayar Labs:共封装光学技术革命——英伟达与HPE战略入股
英伟达与HPE战略投资的Ayar Labs完成1.3亿美元融资,其共封装光学技术有望解决AI计算中数据搬运功耗飙升的核心瓶颈。文章深入拆解三大技术突破:与GlobalFoundries合作量产的微环调制器实现面积与能效双重优势、分离式激光器方案保障可靠性、TeraPHY芯粒以75mm²面积实现2Tbps IO且功耗仅5pJ/bit(仅为下一代800G光收发器的三分之一)。此外还分析了Ayar Labs在UCIe标准、NVLink、HPE Slingshot等场景的应用前景,以及拒绝风投追高估值、选择战略合作伙伴的独特融资策略。文章认为Ayar Labs是最有前途的硬件初创公司,有望彻底改变高性能计算架构从机架级走向大规模可组合资源池。 

Nvidia Tensor Core演进:从Volta到Blackwell架构深度解析
核心看点:一份从Volta到Blackwell共七代GPU架构的Tensor Core完整技术演进报告,由SemiAnalysis联合多位顶尖GPU工程师及NVIDIA CUDA之父Ian Buck、架构负责人Jonah Alben共同审阅。文章从Amdahl定律与内存墙等基础性能工程原理讲起,逐代拆解PTX指令、MMA数据布局、异步拷贝(cp.async)、warp-level编程模型、thread block cluster等底层设计变化,最终落到Blackwell Tensor Core与新型存储层级的设计之美。适合AI基础设施工程师与GPU kernel开发者深入理解为何Tensor Core是推动黄氏定律、使AI算力超越摩尔定律的核心引擎,以及各代架构背后的设计权衡与动机。
