​AMD收购Taalas:加码AI推理 全栈AI再添重要拼图

来源:爱集微 #AMD# #Taalas# #AI#
2069

生成式AI浪潮之下,算力军备竞赛的主战场正从训练端向推理端迁移。今日,AMD宣布已达成最终协议,收购总部位于加拿大多伦多的AI推理芯片初创公司Taalas。

这笔收购恰好发生在AMD交出亮眼Q2财报的两天后。二季度AMD总营收达115.36亿美元,同比增长50%,创历史新高;其中数据中心业务营收67.18亿美元,同比暴增107%,占总营收比重已升至58%。数据中心运营利润达21亿美元。AMD预计2027年数据中心销售将再翻一倍。在这样的增长势能下,收购Taalas既是乘胜追击,也是为下一阶段的推理竞争提前布局。

相较于通用GPU路线,Taalas所代表的“模型级硬化”技术路线,不依赖昂贵的HBM显存存储模型权重,而是将权重直接蚀刻进硅片,以牺牲通用性为代价,换取数量级的性能跃升与成本骤降。对于正在AI数据中心领域紧追英伟达的AMD而言,这笔收购既是推理侧的一次关键补强,也成为其全栈AI战略中的最新一块拼图。

把模型“烧”进硅片

Taalas成立于2023年,是一家极其年轻的公司,团队规模仅约25人,却在硅谷芯片圈掀起了不小的波澜。其核心技术路线与主流GPU、Groq LPU乃至Cerebras晶圆级加速器的数据流架构都截然不同——Taalas的芯片将AI模型权重直接编码到晶体管电路中,而非运行时从内存中调取。从这个意义上说,Taalas的芯片更像是一种“模型专用集成电路”(Model-SpecificIC)。

这种激进的设计带来了惊人的性能数据。今年2月,Taalas发布了首款测试芯片HC1,采用台积电6nm工艺制造,将Meta的Llama3.18B模型硬编码进硅片。初步基准测试显示,该芯片每秒可生成16,960个Token,速度是当时英伟达GPU的48倍,比Cerebras加速器快8.5倍,而成本仅为传统方案的约二十分之一,功耗降低一个数量级。

Taalas的芯片架构主要由两部分构成:用于蚀刻模型权重的掩模ROM结构,以及用于存储KV缓存和微调适配器的SRAM结构。公司计划在今年夏季推出的第二代芯片HC2中,将单芯片参数量提升至200亿。尽管单芯片容量看似有限,但通过流水线并行技术,多个加速器可以协同支撑更大规模的模型——以万亿参数模型为例,仅需约50个HC2级别的加速器即可实现,这在空间和电力效率上远优于传统GPU集群方案。

支撑这一技术路线的是一支背景深厚的创始团队。联合创始人兼CEO Ljubisa Bajic是芯片行业的老兵,他曾在AMD和英伟达担任高级架构师,参与过APU和服务器GPU的设计,此前更是AI芯片公司Tenstorrent的联合创始人。另一位联合创始人、CTO Drago Ignjatovic同样出身AMD,曾任APU和GPU的高级设计工程师,后在Tenstorrent担任硬件工程副总裁。COO Lejla Bajic则在ATI和AMD拥有多年系统工程经验。可以说,这是一支“从AMD走出去、又被AMD请回来”的团队,双方在技术语言和工程文化上的磨合成本极低。

资本层面,Taalas同样备受追捧。成立至今,公司已完成三轮融资,累计约2.19亿美元。2024年3月,Taalas走出隐身状态,宣布完成两轮共计5000万美元的早期融资,由传奇半导体投资人Pierre Lamond和Quiet Capital牵头,Eclipse Ventures等机构跟投。今年2月,公司再获1.69亿美元融资,富达(Fidelity)等大型机构入局,Quiet Capital和Pierre Lamond继续跟投。据二级市场数据显示,融资后Taalas的投后估值约为7.5亿美元。值得一提的是,Taalas仅用约3000万美元的研发投入就流片了首款测试芯片,资金效率在AI芯片初创公司中颇为罕见。

为什么是Taalas?

AMD收购Taalas的逻辑,需要放在AI推理市场爆发的大背景下来看。

随着大模型走向大规模商业化落地,推理负载正在成为算力消耗的主体。与训练阶段追求极致算力密度不同,推理场景对时延、单次调用成本和每瓦性能有着更为苛刻的要求。通用GPU虽然灵活,但在面对稳定、高频的特定模型推理时,其通用性本身就意味着大量冗余——为支持各种模型而设计的控制单元、复杂内存层次和可编程逻辑,在单一模型推理场景中很大程度上是浪费。

Taalas的技术恰好瞄准了这一痛点。通过将模型权重固化到硅片中,Taalas消除了计算与内存之间的数据搬运瓶颈,而这恰恰是GPU推理性能的最大制约因素之一。无需HBM、无需复杂的内存调度,芯片本身就是模型。

对于AMD而言,Taalas的技术并非要取代Instinct GPU,而是与之形成互补。AMD人工智能事业部高级副总裁Vamsi Boppana在声明中表示,AMD正在构建一个全栈式AI平台,让客户能够灵活地为每项AI工作负载部署合适的计算解决方案。业内普遍认为,AMD可能采用一种解耦架构:计算密集型的提示处理(prefill)仍由Instinct GPU完成,而Token生成(decode)阶段则卸载到基于Taalas技术的专用加速器上。这种“GPU+专用推理芯片”的组合,有望在保持灵活性的同时,大幅提升推理吞吐并降低成本。

此外,Taalas的技术还可以与AMD的Helios机架级解决方案深度整合。就在两天前的财报中,AMD正式宣布Helios机架级AI系统已开始向Meta、OpenAI、Anthropic、甲骨文、微软Azure等头部客户出货,并与Anthropic达成战略合作,后者将在Helios平台部署高达2吉瓦的MI450系列GPU。AMD恰好拥有机架级计算平台和内部系统设计团队,可以轻松实现多芯片的流水线并行部署,将Taalas的单芯片能力扩展到大规模集群。

当然,这一技术路线也有其局限性。一旦芯片流片完成,就只能运行特定的基础模型,任何超出LoRA适配器范围的改动都需要重新设计芯片。不过Taalas表示,模型迭代并非需要从头重来,只需更换两层金属层即可,成本和时间开销相对可控。业内分析认为,这项技术的主要客户将是大型模型开发商、其基础设施提供商以及头部推理服务商——而OpenAI、Anthropic、Meta等恰好都是AMD Instinct的重要客户,这为Taalas技术的落地提供了天然的渠道。

AI并购AMD买买买

Taalas并非AMD在AI领域的第一次出手。梳理近年来AMD的资本运作,可以清晰地看到一条从“芯片供应商”向“全栈AI解决方案商”演进的路径。

早在2022年,AMD就以490亿美元完成了对FPGA巨头Xilinx的收购,这是当时半导体行业最大规模的并购之一,为AMD带来了自适应计算能力和庞大的嵌入式客户群。同年,AMD又以19亿美元收购了DPU厂商Pensando,补齐了数据中心网络与智能网卡的短板。

进入AI时代后,AMD的并购节奏明显加快,且目标更加聚焦于AI全栈能力的构建:

2024年7月,AMD以6.65亿美元收购了欧洲最大的私人AI实验室Silo AI,补强AI模型开发和软件栈能力,增强ROCm生态。

2024年8月,AMD宣布以49亿美元收购AI服务器厂商ZT Systems,旨在获得机架级AI系统的设计能力和超大规模云客户资源。2025年3月收购完成后,AMD保留了ZTSystems的设计团队和客户关系,于2025年将制造业务以30亿美元出售给Sanmina,实现轻资产转型,集中资源做Helios整机柜AI平台。

2025年11月,AMD完成对推理软件公司MK 1的收购。MK1的Flywheel推理引擎日处理Token量超过万亿,且深度优化于AMDInstinctGPU,直接提升了AMD硬件的推理软件性能。

2026年6月,AMD宣布收购内存优化技术公司MEXT。MEXT的AI驱动预测内存技术可以让闪存“表现得像DRAM”,旨在缓解数据中心日益突出的内存瓶颈,降低AI负载的内存成本。

而此次收购Taalas,则是AMD在推理硬件层面的一次重磅加码。从软件(SiloAI、MK1)到系统(ZTSystems),从内存优化(MEXT)到专用推理芯片(Taalas),AMD正在通过密集的并购,围绕InstinctGPU构建一个多层次、多形态的AI算力矩阵。

这份密集并购的成效已经开始体现在财报上——数据中心业务同比翻倍、Helios正式出货、客户名单覆盖OpenAI、Meta、Anthropic、微软等几乎所有头部AI玩家,正是全栈策略逐步兑现的信号。

AMD的策略很清晰:不与英伟达在通用GPU上硬碰硬,而是通过差异化技术路线和全栈整合,在推理、成本效率、系统级解决方案等维度寻找突破口。Taalas的硬连线推理芯片,正是这一策略下的一枚关键棋子。

这笔交易预计将于2026年第四季度完成,尚需获得监管部门批准。当Taalas的25人团队融入AMD庞大的工程体系后,"模型刻进硅片"这一激进理念能在多大程度上改写AI推理的成本曲线,值得持续关注。

责编: 姜羽桐
来源:爱集微 #AMD# #Taalas# #AI#
THE END

*此内容为集微网原创,著作权归集微网所有,爱集微,爱原创

关闭
加载

PDF 加载中...