引言破题

一张英伟达 H100 显卡,官方售价 3.5 万美元,折合人民币接近 25 万。在二手和现货市场上,甚至一度被炒到 4 万多美元。

这是什么概念?它的毛利率超过了 75%,净利率比爱马仕、茅台这些顶级奢侈品还要夸张。

网上到处都在讨论:这到底是不是老黄的垄断收割?不就是一块沙子提炼出来的硅晶圆吗,凭什么卖出天价?

但与此同时,你又会看到一个极其诡异的现实:

全世界最有钱的科技巨头——微软、谷歌、Meta、亚马逊,手里管着上万名顶尖的芯片工程师,账上趴着千亿美元级别的现金储备。他们做梦都想把英伟达换掉,甚至每一家都在秘密自研专用 AI 芯片。但现实是,他们一边在发布会上宣传自研成果,一边连夜在黄仁勋办公室门口排长队,毕恭毕敬地送上几百亿美元的支票,只为了能多抢到几万张显卡。

为什么会这样?

一个原本用来给游戏渲染画面的芯片,到底凭什么统治了全人类最前沿的认知革命?接下来,我们直接拿开显卡散热器,把镜头对准微观硅片上的晶体管、铜线连线和热力学摩擦,看清真相。

底层拆解——晶体管面积的经济学

在展开微观物理账本之前,先测测自己的芯片直觉:

在微观硅片上,一颗主频高达 5GHz 的顶级现代 CPU,里面数以百亿计的晶体管,真正用来做加减乘除数学运算的,到底占百分之多少?

答案颠覆很多人的认知:连 15% 都不到,在很多现代多核 CPU 里,真正负责算术的逻辑单元占地连 10% 都没有。

为什么会这样?因为半导体物理第一铁律:晶体管面积预算(Transistor Area Budget)。光刻机单次曝光面积存在掩膜版极限(约 858 mm²),芯片面积不可能无限做大。晶体管总预算有限,你花在哪里,直接决定了这颗芯片的灵魂。

顶级大厨 (CPU) vs 富士康流水线 (GPU)

CPU 是一个极聪明的顶级国宴大厨。 它的目标是优化单线程低延迟(Latency-Oriented)。要服务操作系统、桌面软件、鼠标点击。这些任务充满了不可预测性(无数 if-else 分支)。为了让指令以最快速度跑完,CPU 必须把 80% 硅片面积花在大容量 SRAM 缓存、复杂分支预测器和乱序执行电路上。真正切菜炒菜的算术逻辑单元(ALU)就挤在角落里那几个。大厨应变极强,但一次只能炒一盘菜。

GPU 是一千个不知疲倦的切菜小工。 它的目标是优化总吞吐量(Throughput-Oriented)。游戏画面有几百万像素,每个像素计算彼此独立。GPU 砍掉了分支预测和庞大缓存,把 80% 硅片面积全部焊上密密麻麻的小算术单元。小工不会应变,但给它一万堆土豆同时切丝,一秒钟的总切菜量把大厨甩开几百倍!

Google AdSense / 文章信息流展示位 (文间自适应)

核心推演——矩阵乘法与内存墙死穴

2017 年 Transformer 架构横空出世后,大模型 99% 的运算量归结为:密集矩阵乘法(GEMM)。每一组乘加运算完全独立,天生与 GPU 的并行脉动阵列基因 100% 契合。

但更关键的物理死穴,是 内存墙(Memory Wall)与 Roofline 性能模型

算力只是蓄水池的容量,而决定你能喝到多少水的,是进水管的粗细——显存带宽(Memory Bandwidth)

以英伟达 H100 为例:

  • FP8 算力:3,350 TFLOPS;
  • HBM3 显存带宽:3.35 TB/s;
  • 算术强度平衡拐点:3,350 ÷ 3.35 = 1,000 FLOPs / Byte

这意味着:每从显存搬运 1 个字节的数据,核心必须执行至少 1,000 次数学运算,算力才能吃饱!

在模型预训练(Batch 大、GEMM 密集)时能达到这个强度;但在自回归生成(LLM Decode 阶段,逐字输出)时,每生成一个新 token,算术强度常常只有 1 到 5 FLOPs/Byte。此时硬件算力利用率通常不足 15%,千亿级算力完全在干等数据搬运!

生态冲击——巨头砸百亿自研 ASIC,为什么依然给黄仁勋送钱?

为什么谷歌 TPU、微软 Maia、亚马逊 Trainium 做了这么多年,依然摆脱不了英伟达?

  1. 算法演进的时差:专用芯片(ASIC)流片周期要 18~24 个月。一旦架构在硅片上固化,算法突然改写(比如 MoE 混合专家模型、FlashAttention 出现),专用芯片直接变废铁,而通用 GPU 靠驱动更新就能兼容。
  2. 微观先进封装垄断:台积电 2.5D CoWoS 封装将 HBM 显存与 GPU 裸晶互连,产能被英伟达提前锁死 70% 以上。
  3. CUDA 软件重力场:十几年来全球工程师写在 GitHub 上的数百万行开源算子库和优化工具,形成了全行业无法承受的迁移沉没成本。

个人硬件选购指南与防忽悠三问

  • 本地跑大模型:关注显存带宽与容量远大于算力峰值。Mac Studio 128G 拥有 800 GB/s 统一内存,跑 70B 大模型极其平稳;而普通单卡 4090 虽算力惊人,但 24GB 显存容量直接卡死量化模型的上限。
芯片发布会 30 秒防忽悠三问:
1. 峰值算力是在什么精度(FP8/INT8/FP16)下测的?
2. 显存带宽是多少(GB/s 还是 TB/s)?算术强度拐点是多少?
3. 软件生态(算子库和编译器)到底能不能把硬件吞吐跑满?

原始权威文献与技术来源

  1. Hennessy & Patterson, Computer Architecture: A Quantitative Approach (6th ed.)
  2. Williams et al., Roofline: An Insightful Visual Performance Model for Multicore Architectures, CACM 2009
  3. NVIDIA Corporation, NVIDIA H100 Tensor Core GPU Architecture Overview, 2022
  4. TSMC, CoWoS Technology and Advanced Packaging Roadmaps, IEEE ECTC 2022
  5. Tri Dao et al., FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness, NeurIPS 2022