Zach Blog
Zach 的科技博客,关于芯片设计与技术写作,涵盖硬件、软件与科技的深度内容。
Tensordyne利用对数技术提升AI计算效率
文章分析了AI芯片初创公司Tensordyne的技术路线。不同于主流厂商通过改进内存层级(如SRAM、HBM)来提升性能,Tensordyne尝试使用对数数字系统进行计算,旨在提高乘法效率。作者指出,虽然对数运算能简化乘法,但增加了加法难度,且限制了训练能力,主要适用于推理场景。核心观点是:对于大多数生成式AI负载,瓶颈在于内存带宽而非计算效率,因此Tensordyne的优势有限。除非其更小的计算单元能允许集成更多片上内存,否则在延迟敏感型应用中竞争力不足。文章认为这是一种高风险高回报的创新,适合对能效极度敏感的批量推理工作负载。
Groq 被英伟达"技术收购"后为何还能再融资 6.5 亿美元?
一篇对 Groq 再融资 6.5 亿美元的深度拆解。去年 Groq 被英伟达"收购"——实际是技术授权加核心团队挖角,但公司实体并未消失,仍运营着 4 个数据中心和 GroqCloud 推理 API。在当前数据中心建设面临电力瓶颈、审批延迟的大环境下,已建成的数据中心成为稀缺资产:CoreWeave(43 个 DC)和 Nebius(11 个 DC)估值均达 500 亿美元,Groq 仅凭数据中心资产就可能值数十亿。但作者指出 Groq 面临核心困境:现有 LPUv1 芯片已落后七年,基于 Groq 架构的 LPUv3 正由英伟达向所有云厂商开放销售,技术独特性已丧失。高速高成本的 token 经济学在当前 AI 开支紧缩趋势下面临质疑。Groq 能否用新硬件升级数据中心保持竞争力,仍是未知数。
Crossbar 开源安全芯片被曝存在严重侧信道漏洞
硬件安全专家 Zach 以第一视角分析 Crossbar 公司开源安全芯片 BaoChip 的 RTL 代码,发现其 masked AES 实现存在致命侧信道攻击漏洞——功耗分析可恢复密钥。Crossbar 采用了 2003 年 Elena Trichina 提出的 AND 门掩码方案,但早在 2005 年学术界就已证明该方案因电路中信号传播延迟引起的毛刺会泄漏密钥信息,并已被实际攻破。作者指出,现代防护方案如域导向掩码和 OpenTitan 的开源 AES 实现可有效抵抗此类攻击;Crossbar 虽有开放芯片源代码的勇气,却未与开源社区充分协作利用已有的成熟方案。结论:该芯片不应被用于实际产品,建议用户避免购买。
为什么初创公司难以与 Cadence 竞争?
芯片设计者无不抱怨 Cadence、Synopsys 的 EDA 工具——运行慢、难用、常崩溃、界面像 2003 年产物。但为何没有新创公司能打破三大巨头的寡头垄断?作者以业内视角剖析:过去二十年,Xoomsys、Extreme DA、Rocketick 等初创要么失败,要么被巨头低价收购。真正的壁垒并非技术,而是台积电的 EDA Alliance 认证体系——你的工具必须得到台积电官方认证,芯片公司才敢在昂贵制程上使用。要获取认证需要与台积电建立紧密关系,几乎无法跨越。作者给出务实策略:初创可先做"互补工具"而非替代品,如 Silimate 的 AI 功耗预测工具,在不追求签核认证的前提下,通过加速设计空间探索积累市场,扛住专利诉讼和收购诱惑,才有望真正挑战巨头。
Untether AI 为何失败?
Untether AI 这家 AI 推理芯片创业公司在 2025 年 6 月关闭,核心工程团队加入 AMD,但芯片产品线未随收购转移。本文作者从行业视角深刻复盘其失败路径:公司 2018 年成立时瞄准网络边缘推理,第二代芯片 speedAI 于 2022 年发布,恰在 ChatGPT 爆发前夕。由于缺乏 HBM、芯片间互联和内存层次不足,speedAI 无法竞争大模型推理市场;当行业全面转向 LLM,Untether 仍押注自动驾驶、智慧城市等视觉应用和 ResNet-50 等 2015 年老模型。文章给出具体技术参数(8 TOPs/watt 到 30 TOPs/watt 演进)、关键商业决策时间线(与 GM/ARM 合作)以及明确结论:AI 芯片公司必须保持架构灵活性以应对快速变化的 AI 方向。有细节、有观点、有教训,是一篇高质量的行业案例分析。
为什么构建新IP核需要这么长时间?
这篇文章来自一位有半导体创业经历的技术博主(其创立的后量子密码学公司 Radical Semiconductor 于 2024 年被收购),围绕一个尖锐的行业痛点展开:为什么新标准发布后,商用 IP 核要等好几年才能面世?作者用 USB4(2019 年发布规范,2025 年才获完全认证)、PCIe 4.0、DisplayPort 2.0、HEVC/AV1/VVC 等大量具体案例 + 时间线,证明延迟是普遍现象而非个例。核心原因有二:一是标准本身越来越复杂,USB 1.0 规范仅 250 页,USB 4.0 超 800 页且引入扰码器、链路训练等复杂机制;二是大厂如 Synopsys(约 2 万员工)需要同时维护庞大的旧 IP 产品线,资源分散、转身慢。但这也为初创公司创造了机会——专注单一新标准、没有历史包袱的小团队可以比巨头更快出活,大部分最终被收购。文章最后展望 AI 辅助芯片设计可能改变这一格局。全文有个人经历支撑、有扎实数据、有明确立场,讨论价值高。
这些量子计算机到底有什么区别?
2025年初Google、Amazon、Microsoft接连发布量子芯片,但三家走的是截然不同的技术路线。本文清晰对比了三种量子比特方案的核心差异:Google采用最成熟的超导量子比特配合表面码纠错,用97个物理比特表示1个逻辑比特,纠错开销巨大但技术成熟;Amazon使用猫量子比特天然抑制比特翻转错误,只需简单重复码即可纠错,有望减少90%物理比特需求,但Ocelot芯片仅有9个量子比特,技术成熟度远低于Google;Microsoft押注拓扑量子比特,理论上可同时容忍两类错误、无需复杂纠错,但连一个拓扑量子比特是否真的造出来都存疑——此前微软曾因类似主张撤稿。作者以个人视角给出了清醒判断:Google受制于表面码扩展性瓶颈,Amazon和Microsoft以更大风险换取潜在规模优势,三者各有赌注。结尾幽默补刀——"要么拓扑量子比特成为未来基础,要么微软再撤一篇论文。"全文有人味、有技术细节、有论文引用,是2025年跟踪量子计算前沿不可多得的一手对比。
YC对LLM用于芯片设计的论断错了
YC声称LLM可将芯片设计成本降低10-100倍,甚至设计出更优芯片——但曾在芯片行业工作过的作者直言这是根本性误解。文章以1998年兴起的高级综合工具(HLS)为鉴:HLS也曾承诺让芯片设计更廉价更普及,最终却因生成质量远逊于人工RTL设计,除少数小众FPGA加速场景外全面失败。LLM目前同样只能产出平庸的Verilog代码,无法设计新颖架构,把赌注押在LLM开拓新硬件加速市场是经济上的死胡同。真正的机会可能在芯片验证——行业正面临验证工程师严重短缺——但需要LLM具备形式化模型推理能力,而非简单微调。这不是LLM不行,而是YC找错了方向。
Extropic、Normal Computing 和 D-Wave 有什么区别?
这篇文章的独特价值在于作者曾在 Normal Computing 担任硅工程负责人一年以上(现为顾问),他以亲身参与的行业视角,清晰梳理了"基于能量的计算"这个冷门但重要的技术路线。从1954年 von Neumann 和 Goto 发明的参数计算机讲起,逐一对比了六类方案:经典模拟退火器(Chris Kim 组用环形振荡器实现1968自旋规模)、量子退火器(D-Wave 用超导约瑟夫森结,已到5000+量子比特)、热力学计算机(Normal Computing 的 PCB 原型和 Extropic 的超导方案)、概率逻辑(Purdue 用磁隧道结构建玻尔兹曼机)、以及数字仿真退火器(富士通、日立用数字芯片模拟加速)。作者不回避各家短板——D-Wave 的量子霸权争议、超导方案的极低温成本、磁隧道结尚未规模化——并通过制造可行性分析提出预判:基于环形振荡器的模拟退火器最可能短期大规模落地,而热力学计算虽有更强能力但尚缺可扩展实现。全文带有清晰个人立场和一手经验,信息密度极高,适合关注新型计算架构的深度读者。 

边缘AI芯片领域为何至今未出现赢家?
边缘AI芯片制造成本更低、门槛更小,为何迟迟没有出现明星公司?本文系统分析了几个反直觉的原因:AI模型进化极快(GPT-2到GPT-4仅4年),而边缘设备服役多年,专用芯片很快过时;竞争极其拥挤,2021年就有60多家厂商争夺同一个市场;云端AI始终是隐形对手——对大多数消费设备而言,最有价值的AI功能在云端效果更好。作者指出,真正需要边缘AI的场景(隐私、超低延迟、离线)规模有限,而云端AI有推荐系统和生成式AI两个杀手级应用撑起千亿市场。一篇兼具技术深度与商业视角的好文。
为什么大家都在谈论 Groq?
芯片专家深度拆解 Groq:原 Google TPU 创始人的 AI 推理芯片公司,靠确定性计算架构(去除分支预测、乱序执行,全部交由编译器调度)实现了极快的大模型推理,最近借 API 服务引爆关注。但作者结合自己在 SambaNova 的工作经历指出隐患:Groq 芯片没有任何 HBM/DRAM,全靠 220MB SRAM,跑 LLaMA-70B 需要 576 块芯片、8 个机架;若未来模型更大或稀疏性成为主流,这种激进设计反而会成为瓶颈。文章提出两个推理未来图景——"多模型分散推理" vs "单一巨型模型 API 化"——并分析 Groq 在当前市场中的真实定位:API 供应商的最佳选择,但对大多数企业并不经济。作者有明确立场与真实困惑,不是泛泛资讯,而是值得讨论的深度行业分析。