前英特尔CEO示警AI算力瓶颈!电力、HBM存储与光互连成关键战场

来源:钜亨网 #AI算力# #HBM# #光互连#
1138

人工智能(AI)加速发展,芯片设计的门槛与时间成本正因AI工具而降低,但硬件制造、存储、能源供应及数据传输等环节,却成为限制算力扩张的新瓶颈。前英特尔(INTC-US) CEO基辛格(Pat Gelsinger)认为,AI正推动硬件产业迎来一波前所未有的创新浪潮,从电力架构、存储材料到光互连技术,都存在重大突破的机会。

硅谷创投机构 a16z 于9日播出一场深度访谈,由创投机构 Playground Global 普通合伙人基辛格,与 a16z 的 Raghu Raghuram、Guido Appenzeller 共同探讨AI基础设施的发展。

基辛格曾参与英特尔386、486处理器的设计,并见证电子设计自动化(EDA)工具的发展。他指出,当前硬件产业的创新机会,涵盖存储、光互连、电力系统与网络架构,是他职业生涯中少见的密集发展阶段。

随着AI数据中心建设加速,电力供应正成为算力扩张难以回避的瓶颈。

基辛格指出,AI时代的能源供应能力已直接关系经济产能,但美国过去15年在增加再生能源的同时逐步淘汰燃煤发电,整体能源容量几乎没有增长,即使近期增速加快,年化增长率仍仅约4%,难以满足动辄需要100万颗GPU的AI数据中心需求。

基辛格警告,若厂商投入大量资金采购GPU,却无法获得足够电力,未来可能有愈来愈多数据中心项目面临违约风险。

为应对日益严峻的电力需求,基辛格认为,数据中心的供电架构亟需重新设计。他特别提到,800伏特直流电(DC)重新受到重视,象征电力系统正迎来重大转变。

此外,从发电、输电,到运用垂直氮化镓(GaN)技术进行降压转换,以及液冷等散热技术的升级,整个数据中心电力与散热系统都可能迎来25年来少见的创新浪潮。

针对目前AI芯片高度依赖的高带宽存储(HBM),基辛格(Pat Gelsinger)提出不同看法。他直言,HBM是一种极糟糕的存储,只是现阶段市场能获得的最佳选择。

基辛格指出,HBM的比特密度不理想,带宽受限于芯片边缘,且面临功耗偏高、散热困难等问题。由于DRAM对高温相当敏感,随着AI运算对存储的需求持续攀升,现有技术的限制也日益受到关注。

他认为,这些挑战加上AI对存储运算的高度需求,正为新一波存储技术创新创造条件;过去4年,存储产业市值已增加2.5万亿美元,也反映市场对相关技术的重视。

基辛格表示,回顾过去30年,存储领域真正重大的技术创新相当有限,主要仍是DRAM、静态随机存取存储器(SRAM)与闪存(Flash)。

不过,他认为,产业可能即将迎来30年来首次重大新型存储创新,并看好铁电材料(ferroelectrics)等新材料的发展潜力,认为其有望应用于不依赖电容、具备高密度与堆叠能力的存储。他也透露,自己已投资相关的新创公司。

至于3D封装与存储堆叠,基辛格认为,堆叠层数并非愈多愈好。考虑到制程复杂度提高可能导致良率大幅下降,他不认为业界应一味追求16层或32层堆叠,反而看好2至4层堆叠。

AI工具正在改变芯片设计流程。基辛格认为,AI辅助设计的影响,可比拟早期EDA工具问世时对芯片开发带来的变革。通过AI工具,优秀团队可能只需3个月,就能完成1款AI加速器的逻辑设计。

但设计速度提升,并不代表硬件能同步投入使用。基辛格指出,芯片开发的瓶颈正逐渐转移至制造、先进封装与系统整合。

以1款AI芯片为例,设计可能需要3个月,晶圆制造至少再花3个月,复杂的3D先进封装又需要约3个月,之后还得整合至机架级系统。换言之,即使设计阶段大幅提速,从设计完成到系统可用,仍可能9个月的等待时间。

他强调,当前AI运算系统的核心已不再只是单颗芯片,而是整合运算、存储、网络与电力的整个机架(Rack)。当硬件交付速度赶不上AI模型与工作负载的变化,产品在正式部署时,就可能已不再符合原先的需求。

针对市场上大量AI推理加速器与不同芯片架构竞争的局面,基辛格预期,产业最终将逐步整合,由少数主导平台掌握市场。

他认为,未来AI工作负载可能纳入更多传统高性能计算(HPC)需求,例如分子与化学分析所需的64比特高精度运算。若芯片架构过度专门化,未必能适应未来2至4年的模型演进。

此外,打造大规模AI算力基础设施需要数100亿美元的资本支出,庞大的投资门槛也不利于数十种甚至上百种芯片架构长期并存。

OpenAI、英伟达(NVDA-US) 与Anthropic等主要厂商,也将在软硬件协同发展过程中,影响市场最终由哪些平台胜出。

在数据传输方面,基辛格则认为,铜互连的限制将推动光互连逐步普及。他指出,数据中心内铜缆的电气传输特性,使其在约5公尺距离的成本,可能高于可传输约100公尺的光纤,反映光学技术在高速传输上的优势。

他预期,2028至2029年可能成为产业转折点,届时近封装光学(NPO)与共封装光学(CPO)技术有望加速导入。

基辛格也肯定英伟达NVL72系统的工程设计,但认为其制造复杂度极高;若光学供应链能更早成熟,相关系统的发展可能更加超前。

除了光互连,基辛格也支持光路交换(OCS)技术的发展。他指出,传统网络架构主要为数据可能流向不同目的地而设计,但AI工作负载的数据流量往往规模庞大且相对可预测,因此更适合探索电路交换式的网络架构。

访谈最后,基辛格将焦点转向AI代理(AI Agent)时代的基础设施。

他以过去在VMware(VMW-US) 的经验指出,每一波技术创新都会催生新的抽象层,而虚拟机仍是运算架构中值得保留的重要概念,但服务对象正从硬件与人类使用者,逐渐转向AI代理。

他认为,下一代类似VMware的基础设施,需要重新建立虚拟化与管理机制,协助AI代理有效运作、配置安全环境并管理执行性能。

同时,系统仍须保留人类对代理行为的管理能力,包括制定政策、设置行为准则,以及通过仪表板掌握运作状态。

责编: 爱集微
来源:钜亨网 #AI算力# #HBM# #光互连#
THE END
关闭
加载

PDF 加载中...