旧金山,圣何塞会议中心,GTC 现场。英伟达首席科学家 Bill Dally 坐在台上,对面是谷歌的 Jeff Dean。两人谈及芯片设计效率时,Dally 抛出一个震撼数字:“此前移植一个包含约 2500 至 3000 个单元的标准单元库,需要 8 名工程师耗时约 10 个月。”他稍作停顿,继续说道,“现在仅需单卡 GPU,跑一个晚上。”
台下没有惊呼,因为听懂这句话的人都明白这意味着什么。8名工程师10个月的工作,被一颗自家产的GPU一夜之间完成。Dally还补充道,AI跑出来的结果在面积、功耗、延迟等关键指标上,匹配甚至超过了人类设计。次日,便有媒体将此解读为“英伟达用AI设计GPU”。
但这事的真相,远比新闻标题更值得玩味。
内部工具链:从“辅助”到“碾压”
英伟达内部运行的并非不可知的黑箱,而是几套打磨数年的AI工具链。例如,NB-Cell是一个基于强化学习的程序,专门处理标准单元库迁移这类繁重工作;Prefix RL旨在解决芯片布局中的棘手难题。Dally表示,该系统生成的布局方案“是人类永远无法想到的”,能将关键指标提升约20%到30%。
此外,英伟达还训练了内部大语言模型Chip Nemo和Bug Nemo。公司将历史上每一代GPU的RTL代码、架构文档、设计规格等资料喂给这两个模型。用Dally的话说,这相当于将英伟达从G80到Blackwell二十年的工程“肌肉记忆”蒸馏成了一个内部模型,新工程师能直接获得二十年经验积累的辅助。
那么,这是否意味着“AI可以自主设计GPU”了?答案恰恰相反。Dally坦言:“我很希望有一天能直接说‘给我设计一颗新GPU’,但我们离那一步还很远。”英伟达并未用AI直接设计出GPU,但它所做的另一件事,可能让整个行业未来都难以离开它。
20亿美元入股,绑定EDA生态命脉
2025年12月1日,英伟达以20亿美元入股EDA(电子设计自动化)三巨头之一的新思科技(Synopsys)。双方签署联合开发协议,将英伟达的加速计算栈嵌入新思科技的整个EDA工作流程中,Blackwell及下一代Rubin GPU将与Synopsys.ai进行深度整合。
新思科技的地位举足轻重。全球几乎每一颗先进制程芯片,包括苹果M系列、AMD MI系列、谷歌TPU等,在设计阶段都依赖于新思科技或楷登电子(Cadence)的工具链。这两家公司与西门子EDA共同垄断了芯片设计的底层工具软件。
入股新思科技三个月后,英伟达进一步将楷登电子、西门子、达索系统也纳入合作阵营,宣布它们都在基于英伟达GPU开发AI驱动的芯片设计工具。英伟达公布的基准测试数据显示了惊人的加速效果:Synopsys PrimeSim在Blackwell上快30倍,Proteus快20倍。联发科使用H100将Cadence Spectre提速了6倍。
一个关键细节是:Cadence的Millennium M2000平台被标注为“专为EDA市场打造,独家基于NVIDIA Blackwell”。“独家”二字意味着,未来想要使用性能最强的EDA工具,可能必须购买英伟达的硬件。
(示意图:英伟达GPU对EDA工具的加速效果对比)
深层飞轮:让竞争工具依赖于自身硬件
公众通常理解的英伟达飞轮是:出售GPU给AI公司 -> AI公司训练大模型 -> 大模型证明GPU不可或缺 -> 带动更多GPU销售。然而,在此之下还存在更深层的飞轮。
英伟达利用其先进的内部AI工具设计下一代GPU,大幅提升设计效率,形成代际差距。同时,它将整个行业的EDA工具链与自家硬件深度绑定。竞争对手若想追赶,其追赶过程中所依赖的设计工具,却可能不得不从英伟达的生态体系中“租用”。
这造成了某种悖论:设想AMD的工程师想要设计一颗对标Blackwell的芯片,当他打开新思科技的工具时,会发现该工具在英伟达GPU上运行最快。那么,他要么接受更长的设计周期,要么购买英伟达的GPU来加速设计——即用对手的工具,来设计击败对手的产品。
国产GPU的艰难现实
在英伟达高歌猛进的同时,国产GPU厂商正面临严峻挑战。英伟达2025财年净利润突破700亿美元的同一年,被称作国产GPU“四小龙”的摩尔线程、沐曦、壁仞、燧原仍在为盈利苦苦挣扎。
根据公开数据,摩尔线程2022年至2024年累计净亏损约50亿元;沐曦三年累计亏损超过30亿元;壁仞情况更为严峻,三年半亏损超过63亿元。这些公司的研发投入强度极高,例如摩尔线程2022年研发费用占营收比例高达2422.51%,2024年仍为309.88%。
更根本的制约在于工具链。目前,国产EDA工具在先进制程支持上仍存不足。华大九天创始人刘伟平曾坦言:“国产EDA对先进工艺的支撑还存在明显不足……目前国产EDA可以做到14nm的水平,虽然掌握了7nm工艺技术,但在与实际应用的深度融合上还需要全产业链的协同发力。”这意味着,对于7nm以下先进制程的全流程设计,国产GPU公司仍严重依赖海外EDA工具。
而如今,这些海外EDA工具的最快版本,正被加速整合进英伟达的硬件生态中。
贯穿产业链的闭环
回顾过去一年,英伟达所做之事可归结为一点:将AI深度应用于芯片产业链中价值最高、护城河最深的各个环节,然后将这些工具层层“售卖”给整个行业。
在芯片设计前端,有Chip Nemo等内部模型辅助;设计中后端的单元库迁移、布局优化,由NB-Cell、Prefix RL等工具提速;整个EDA工具链,通过投资与合作,将其性能与英伟达GPU深度绑定;甚至在制造端的光刻计算领域,英伟达的cuLitho库也已被台积电(TSMC)采用。
从设计到制造,英伟达正在用AI重塑每一个关键环节。而每一个环节的优化,最终都指向同一个结论:若想使用最快的工具以保持竞争力,就需要购买英伟达的硬件。对于所有意图挑战英伟达的竞争者而言,一个尴尬的局面已然浮现:设计竞争芯片所需的最强工具、制造环节的关键计算软件、乃至训练设计AI所需的算力,其最优解都可能通向英伟达。
正如业界所观察到的:那个你想要超越的巨人,正在向你出租用以击败它的全套工具。而租金,需要按年支付,且合同价格逐年看涨。
