引言破题
一张英伟达 H100 显卡,官方售价 3.5 万美元,折合人民币接近 25 万。在二手和现货市场上,甚至一度被炒到 4 万多美元。
这是什么概念?它的毛利率超过了 75%,净利率比爱马仕、茅台这些顶级奢侈品还要夸张。
网上到处都在讨论:这到底是不是老黄的垄断收割?不就是一块沙子提炼出来的硅晶圆吗,凭什么卖出天价?
但与此同时,你又会看到一个极其诡异的现实:
全世界最有钱的科技巨头——微软、谷歌、Meta、亚马逊,手里管着上万名顶尖的芯片工程师,账上趴着千亿美元级别的现金储备。他们做梦都想把英伟达换掉,甚至每一家都在秘密自研专用 AI 芯片。但现实是,他们一边在发布会上宣传自研成果,一边连夜在黄仁勋办公室门口排长队,毕恭毕敬地送上几百亿美元的支票,只为了能多抢到几万张显卡。
为什么会这样?
一个原本用来给游戏渲染画面的芯片,到底凭什么统治了全人类最前沿的认知革命?接下来,我们直接拿开显卡散热器,把镜头对准微观硅片上的晶体管、铜线连线和热力学摩擦,看清真相。
底层拆解——晶体管面积的经济学
在展开微观物理账本之前,先测测自己的芯片直觉:
在微观硅片上,一颗主频高达 5GHz 的顶级现代 CPU,里面数以百亿计的晶体管,真正用来做加减乘除数学运算的,到底占百分之多少?
答案颠覆很多人的认知:连 15% 都不到,在很多现代多核 CPU 里,真正负责算术的逻辑单元占地连 10% 都没有。
为什么会这样?因为半导体物理第一铁律:晶体管面积预算(Transistor Area Budget)。光刻机单次曝光面积存在掩膜版极限(约 858 mm²),芯片面积不可能无限做大。晶体管总预算有限,你花在哪里,直接决定了这颗芯片的灵魂。
顶级大厨 (CPU) vs 富士康流水线 (GPU)
CPU 是一个极聪明的顶级国宴大厨。 它的目标是优化单线程低延迟(Latency-Oriented)。要服务操作系统、桌面软件、鼠标点击。这些任务充满了不可预测性(无数 if-else 分支)。为了让指令以最快速度跑完,CPU 必须把 80% 硅片面积花在大容量 SRAM 缓存、复杂分支预测器和乱序执行电路上。真正切菜炒菜的算术逻辑单元(ALU)就挤在角落里那几个。大厨应变极强,但一次只能炒一盘菜。
GPU 是一千个不知疲倦的切菜小工。 它的目标是优化总吞吐量(Throughput-Oriented)。游戏画面有几百万像素,每个像素计算彼此独立。GPU 砍掉了分支预测和庞大缓存,把 80% 硅片面积全部焊上密密麻麻的小算术单元。小工不会应变,但给它一万堆土豆同时切丝,一秒钟的总切菜量把大厨甩开几百倍!
核心推演——矩阵乘法与内存墙死穴
2017 年 Transformer 架构横空出世后,大模型 99% 的运算量归结为:密集矩阵乘法(GEMM)。每一组乘加运算完全独立,天生与 GPU 的并行脉动阵列基因 100% 契合。
但更关键的物理死穴,是 内存墙(Memory Wall)与 Roofline 性能模型:
算力只是蓄水池的容量,而决定你能喝到多少水的,是进水管的粗细——显存带宽(Memory Bandwidth)。
以英伟达 H100 为例:
- FP8 算力:3,350 TFLOPS;
- HBM3 显存带宽:3.35 TB/s;
- 算术强度平衡拐点:3,350 ÷ 3.35 = 1,000 FLOPs / Byte。
这意味着:每从显存搬运 1 个字节的数据,核心必须执行至少 1,000 次数学运算,算力才能吃饱!
在模型预训练(Batch 大、GEMM 密集)时能达到这个强度;但在自回归生成(LLM Decode 阶段,逐字输出)时,每生成一个新 token,算术强度常常只有 1 到 5 FLOPs/Byte。此时硬件算力利用率通常不足 15%,千亿级算力完全在干等数据搬运!
生态冲击——巨头砸百亿自研 ASIC,为什么依然给黄仁勋送钱?
为什么谷歌 TPU、微软 Maia、亚马逊 Trainium 做了这么多年,依然摆脱不了英伟达?
- 算法演进的时差:专用芯片(ASIC)流片周期要 18~24 个月。一旦架构在硅片上固化,算法突然改写(比如 MoE 混合专家模型、FlashAttention 出现),专用芯片直接变废铁,而通用 GPU 靠驱动更新就能兼容。
- 微观先进封装垄断:台积电 2.5D CoWoS 封装将 HBM 显存与 GPU 裸晶互连,产能被英伟达提前锁死 70% 以上。
- CUDA 软件重力场:十几年来全球工程师写在 GitHub 上的数百万行开源算子库和优化工具,形成了全行业无法承受的迁移沉没成本。
个人硬件选购指南与防忽悠三问
- 本地跑大模型:关注显存带宽与容量远大于算力峰值。Mac Studio 128G 拥有 800 GB/s 统一内存,跑 70B 大模型极其平稳;而普通单卡 4090 虽算力惊人,但 24GB 显存容量直接卡死量化模型的上限。
芯片发布会 30 秒防忽悠三问:
1. 峰值算力是在什么精度(FP8/INT8/FP16)下测的?
2. 显存带宽是多少(GB/s 还是 TB/s)?算术强度拐点是多少?
3. 软件生态(算子库和编译器)到底能不能把硬件吞吐跑满?
原始权威文献与技术来源
- Hennessy & Patterson, Computer Architecture: A Quantitative Approach (6th ed.)
- Williams et al., Roofline: An Insightful Visual Performance Model for Multicore Architectures, CACM 2009
- NVIDIA Corporation, NVIDIA H100 Tensor Core GPU Architecture Overview, 2022
- TSMC, CoWoS Technology and Advanced Packaging Roadmaps, IEEE ECTC 2022
- Tri Dao et al., FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness, NeurIPS 2022
什么是 Roofline 性能模型?三分钟测算你的大模型是算力瓶颈还是显存带宽瓶颈
包含算术强度数学公式推导、H100 与 4090 实测拐点对比,以及 Prefill/Decoding 阶段物理瓶颈诊断。
查阅 Roofline 技术手册 ➔