微软自主研发的AI芯片在起步缓慢后,已显现出生机。

据两位直接了解相关计划的人士透露,微软正计划在明年大幅提升其自主研发的下一代人工智能芯片的产量,以期说服像Anthropic这样的大型云服务客户采用这些芯片。

尽管如此,目前由微软自主研发的最新一代芯片——即Maia 200——的普及率却一直较为缓慢。其中一位人士表示,微软计划于今年秋季正式发布全新的Maia 300芯片,甚至可能最早在下个月亮相。

另一位人士指出,这家云服务巨头已与台湾积体电路制造公司展开洽谈,力求为超过3万片该芯片争取到生产产能,以便在2027年交付使用——这一订单量远超微软迄今已生产的数万片Maia 200芯片。

微软最终希望确保能够生产逾百万片Maia 300芯片,但具体能否实现这一目标,仍可能受到零部件供应以及其与台积电持续进行的产能谈判的制约,这位人士表示。

推动Maia芯片落地,是微软降低对NVIDIA芯片依赖的关键举措之一,也是首席执行官萨蒂亚·纳德拉的首要任务。此前的努力曾遭遇诸多阻碍:去年,由于早期测试未能达到内部预期目标,Maia 200芯片被推迟投产;自那以来,这款芯片仅在少数几座微软数据中心得到应用。

微软Azure Maia业务总经理安德鲁·沃尔在一份声明中拒绝就具体生产计划发表评论,但他表示,微软最终希望年产达千兆瓦级的Maia芯片。

沃尔并未明确具体数量或时间表,但通常而言,需要数千兆瓦电力的数据中心,往往会部署数以百万计的人工智能芯片。

“微软持续投资定制化硅片,以此作为我们长期人工智能基础设施战略的一部分。虽然我们并不对外公布具体的生产规模,但所披露的数字并不能完全反映我们项目的实际规模。我们预计,Azure Maia的部署将支持以千兆瓦为单位的人工智能工作负载需求。”沃尔表示。

在推动人工智能芯片落地方面,微软相较于谷歌和亚马逊等竞争对手仍存在一定差距。谷歌和亚马逊已成功吸引了众多大型客户,分别在其云业务中采用张量处理单元和Trainium芯片;而谷歌已开始向客户销售TPU,供其在自有数据中心之外使用。

相比之下,迄今为止,微软仍是唯一一家使用自家Maia芯片的用户——这些芯片用于运行OpenAI模型,以及其内部研发的MAI模型,后者则驱动着Copilot AI软件。

不过,目前微软大部分软件仍主要依赖NVIDIA芯片来运行。

然而,微软坚信自己能够说服更多客户租用其即将推出的Maia 300芯片,甚至可能包括Anthropic——至少在一定程度上,这得益于其带来的成本优势。

多年来,Anthropic一直与微软就未来采用Maia芯片展开磋商,此前报道的信息。

纳德拉在6月表示,已有两座数据中心正在使用Maia 200芯片,且公司正计划将其产能进一步扩大,其中包括一些位于海外的数据中心。据一位知情人士透露,截至上月底,微软仍只在两座数据中心使用该芯片,且这两座数据中心均位于美国境内。

即便微软无法为Maia 300芯片拿下大客户,其备选方案是:在继续向Azure云服务客户出租价格高昂的NVIDIA芯片的同时,将更多内部人工智能应用迁移至Maia芯片。

微软上月向投资者表示,与NVIDIA的尖端芯片相比,微软的Maia 200芯片在运行OpenAI和微软模型时,运营成本可低至30%至40%;一位知情人士指出,微软内部发现,专为优化其模型而设计的Maia 300芯片性能更为出色。

微软目前考虑为Maia 300芯片下达的订单量,远低于谷歌和亚马逊等竞争对手每年的订单数量。相比之下,谷歌今年计划生产超过300万片TPU芯片,而明年则有望达到500万片,根据摩根士丹利的估计。

与此同时,微软近期在另一类芯片上也取得了更多进展——其自主研发的Cobalt中央处理器。与Maia及其他专为人工智能设计的芯片相比,CPU是一种更为传统的处理器类型,而这些芯片与NVIDIA的图形处理器竞争激烈;然而,CPU的需求如今同样呈爆发式增长。

上周,微软表示,OpenAI、Adobe等多家大型客户已在全球超过25座数据中心中使用Cobalt芯片。

近年来,纳德拉曾私下批评NVIDIA在人工智能芯片市场中占据的主导地位。在一次2022年邮件后来被公开为法庭文件中,纳德拉感慨道:“如今,我们只是NVIDIA之上的薄薄一层,所有的知识产权都掌握在OpenAI手中”,并称微软内部某部门“明年将损失40亿美元”。

尽管目前尚不清楚究竟是哪个部门遭受了损失,但一位知情人士表示,纳德拉指的是在Azure平台上运行OpenAI模型时所面临的高成本——部分原因在于,微软无法掌控芯片成本,也无法控制人工智能模型本身的成本——而这正是微软本土人工智能项目自那时起一直致力于解决的两个关键问题。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论