주메뉴바로가기본문바로가기
비즈한국 비즈한국

“AI 对半导体依然如饥似渴”——从 AMD Helios 看计算的未来

本文由AI自动翻译。与韩语原文相比可能存在误差。  Read original in Korean →

[비즈한국]  AI 怀疑论再次浮现。这并非指“AI 没有用”,而是从产业角度不时冒出的忧虑——即“AI 似乎并不像预期那样值得投入巨额资金”。无论结论如何,我们都不会质疑 AI 技术的潜力,也不会减少 AI 的使用量。事实上,未来一段时间内,使用量反而会进一步增加。

目前,AI 相关企业在计算机领域的投入已经达到了超乎想象的水平。参考谷歌近期的财报,2026 年的资本支出预计将达到 2000 亿美元。谷歌在上一季度实现了 1200 亿美元的营收,较去年同期增长了 24%。对于谷歌这样规模的企业而言,能实现这种程度的增长是惊人的。其中,云业务营收同比增长了 82%,原因只有一个:AI。

对高性能计算机的需求正在急剧增加。图片=崔浩燮(Choi Ho-seop)提供

然而,巧合的是,这份财报发布后,股票市场却莫名其妙地抛出了 AI 怀疑论。理由是虽然谷歌业绩超预期且获得了强大的增长引擎,但其资本支出占比过高。尽管观点各异,但近期市场对包括半导体在内的 AI 主导型企业的评价正在迅速冷却,程度甚至到了令人恐惧的地步。

AI 依然是目前引领产业的核心关键词。包括谷歌在内的超大规模云服务商(Hyperscalers)正在赚取巨额利润,并为了构建更优的模型而持续增加 AI 相关基础设施。事实上,它们几乎正在吸纳全球所有的计算资源。基础设施的增长比以往任何时候都更加坚定,密集的扩展正以令人畏惧的速度持续进行。

提升“单位成本代币生成率”的技术渴求

近期,我参加了在美国旧金山举办的 AMD 年度 AI 活动“Advancing AI”。这是一个介绍 AMD AI 相关新产品、发布重大战略与路线图的盛会。过去,该活动主要围绕处理 AI 的 GPU 以及用于 AI 开发的 ROCm 框架展开。原因在于,全球 AI 行业起步于英伟达(NVIDIA)的 CUDA 框架,并运行在其 GPU 上。

长期以来,AMD 强调“AMD GPU 性能卓越,ROCm 也能构建出媲美英伟达 CUDA 的简便且强大的 AI 环境”,这无可厚非。特别是由于英伟达 GPU 需求远超供应,AMD 顺势将其包括“Instinct”系列在内的 GPU 作为最强大、最现实的替代方案提出,是十分自然的。

随着推理需求的激增,“单位成本代币生成”效率已成为主要议题。图片=崔浩燮提供

然而,今年 AMD 的立场发生了微妙的变化。它不再仅仅作为英伟达的替代品,而是针对“单位成本性能”、“单位成本生成代币数”等当下最火热的议题给出了现实的解决方案。目前,主流 AI 模型的基础训练已经定型,训练基础设施的性能压力也得到了一定缓解。如今最现实的问题在于,如何满足用户需求并给出答案的“推理”环节。

AMD 首席执行官苏姿丰(Lisa Su)在主题演讲中表示:“两年前,训练与推理的比例大约是 6:4,但从今年开始,这一比例将发生逆转。”这意味着现场的 AI 需求正在爆炸式增长。如今,大型语言模型已超越了简单的文本写作,能够编写大规模开发项目的代码、分析科学实验、生成图像和视频。在高效检索、整理信息并生成更自然的文本的同时,实现这些功能最终取决于服务后端计算机的推理能力。

代理 AI(Agent AI)通过多种 AI 模型协同工作,因此需要更强大的计算能力。图片=崔浩燮提供

此外,AI 的趋势正在从各自独立处理任务转向“代理 AI(Agent AI)”,即由多个针对特定领域优化的 AI 相结合,共同完成一项大任务。这意味着要处理一件事,需要更多的 AI 模型协同运行。

今年,AMD 不仅推出了 GPU,还发布了集成了 CPU、GPU 以及 18 台服务器互联网络环境的 AI 超级计算机“Helios”。我提到这一点,是因为它不仅仅是一台性能强大的计算机,更因为它所追求的方向深刻映射了当前的 AI 现实。

这台计算机的核心在于整合数据中心内常见的扁平化刀片服务器。每个托盘内的服务器由一颗 256 核 EPYC 处理器与 4 颗被称为 Instinct MI455X 的高性能 GPU 组合而成。这些 GPU 搭配了高达 432GB 的 HBM4 内存。将 18 个此类单元组合在一起,就构成了一个像冰箱大小的机架系统。最终形成了一个拥有 4608 个核心、72 个 GPU 以及 31TB HBM 内存的统一系统。

“机架规模系统”,在有限空间内获取更大计算力的方法论

Helios 看起来与常见的数据中心机柜并无二致,那么它的特殊之处在哪?实际上,包括 AI 在内的现代计算机,衡量标准不再仅仅是单一处理速度,而是整体吞吐量。关键在于:在有限空间内塞入更多计算机。但问题不在于简单的“堆砌”。虽然服务器看起来很高端,但其基本形态与我们使用的个人电脑并无本质区别:以 CPU 和内存为中心,再连接 GPU。

像 PC 一样插入显卡形式的 GPU 是最基础的方式,但由于存在局限性,当规模扩大时需要其他方案。图片=崔浩燮提供

特别是 GPU 通过 PCI Express 总线进行数据传输,这条通道的速度和容量存在天花板。因此,在单台计算机中插入两块 GPU,工作效率并不会简单翻倍,反而会产生一定的损耗。过去曾有人尝试在单机中插入大量 GPU,但随着 GPU 数量增加,损耗也会随之扩大。此外,受限于 PCI Express 通道数量和物理空间,单机 GPU 插槽有限。因此,通常将多个服务器单元捆绑为一个系统,这便是所谓的“机架”。

然而,服务器之间的互联会引发更大的损耗。单机内部是在电路板上处理,而服务器间互联则需要将单机处理结果通过网络重新传输。由于数据传输量和物理移动延迟等多种原因,性能损失会急剧增加。常言道,连接 100 个 GPU 很难达到 100 倍性能,甚至连 50 倍都难以实现。

但这还不是全部。随着 AI 处理量激增,GPU 需求呈几何级数增长,需要将成百上千个机架连接起来形成数据中心。数据中心的目标是在有限空间内容纳更多计算机。除了增加 CPU 或 GPU 的数量,提高连接效率变得至关重要。

Helios 通过 18 台服务器整合了 4600 余个 CPU 核心、72 个 GPU 以及 31TB 的 HBM4 内存。图片=崔浩燮提供

AMD 通过 Helios 不再单独售卖 CPU 和 GPU,而是将其打包成系统化的“成品”,目的就在于提出互联的通用标准。确保 256 核 CPU 与 4 块 GPU 搭配时达到最优性能,并实现无瓶颈连接。将多个标准化的系统相连,也有利于数据中心的稳定运行。

这也是英伟达通过“Vera Rubin”平台所呈现的概念。虽然可以将其解读为通过垄断平台和销售成品来提高 GPU 利润,但在必须立即获取基础设施的背景下,这是在有限空间内最有效、最稳定地集结计算性能的方法,因此极具竞争力。

实际上,AMD 通过 Helios 在单个机架中塞入了比以往更多的 HBM4 内存。苏姿丰 CEO 表示,未来的 AI 环境必然要求更高的内存容量,因此在相同空间内获取尽可能多的 HBM 内存是市场最迫切的需求。

在有限空间内集结更多计算力一直是数据中心的课题,但其规模和难度是前所未有的。图片=崔浩燮提供

仍对内存如饥似渴的代理 AI

过去的大型语言模型主要以“聊天机器人”形态为主,但随着代理 AI 时代的开启,每个代理都需要更强大的推理能力,并将结果整合以产生价值的编排(Orchestration)变得尤为关键。这意味着不仅推理性能,需要记忆的内存容量也在同步增长。

AI 对计算能力和内存的需求永无止境。现在,我们已经在 PC 和智能手机上将宝贵的处理器和内存资源让渡给了 AI,其代价是高昂的半导体价格。而目前的 AI 市场正在吞噬比这更多的资源。AMD 的 Helios 或英伟达的 Vera Rubin 都是对此在技术层面给出的诱人方案。

Anthropic 联合创始人 Tom Brown 阐述了对 AMD 合作伙伴关系的期待。这意味着 AMD 对 Anthropic 进行了巨额的硬件基础投资。图片=崔浩燮提供

AMD 在 Advancing AI 主题演讲前夕,还公布了与微软及 Anthropic 的合作伙伴关系与投资计划。特别是对提供 Claude 服务的 Anthropic 进行了高达 50 亿美元(约合超过 7 万亿韩元)的巨额战略投资。在此基础上,Anthropic 计划在明年内引入 1GW(吉瓦)规模的基于 Helios 的 AI 基础设施。虽然基础设施的具体投入成本尚不可知,但这是一笔巨额支出,可以解读为 Anthropic 通过向 AMD 出让部分股权来换取所需的资源。而 AMD 此举并非单纯为了当下的销售额,而是通过硬件实物投资来锁定 Anthropic 的股权。近期英伟达投资 Naver 并供应 Vera Rubin 系统,也可被视为类似的逻辑。

这也证明了 AI 对半导体的需求远超以往,虽然负担沉重,但却不得不渴求下一代 GPU 和内存。AI 行业正准备吸纳更多的资源。目前的机器学习基础 AI 终究是激烈的“概率”之争,模型构建与运行的基本方法已趋于成熟。认为 AI 已触及技术天花板的说法也不无道理,仅靠目前的单一模型很难再实现质的飞跃。

然而,代理 AI 是突破瓶颈、让人们能够更放心地将任务交给 AI 的新方法论。代理 AI 构建了不同于以往大型语言模型的环境。那漫长旅程的终点,将是 40 年前首次提出的机器学习技术——人工智能的最终完成。而在这个过程中,我们必须支付“更多的半导体”作为代价。

本文由AI自动翻译。与韩语原文相比可能存在误差。
최호섭 IT칼럼니스트
writer@bizhankook.com
저작권자 ⓒ 비즈한국 무단전재 및 재배포 금지