一、 从“快直觉”到“慢搜索”:预训练 Scaling Law 为什么撞墙?
在 2024 年以前,大语言模型(LLM)的进步主要遵循经典的 Chinchilla Scaling Law:不断加大参数规模 $N$(从 7B 堆到 1.8T),喂入更多互联网公网语料 $D$(从 1T Token 堆到 15T Token),并烧掉数以万计的 H100 训练集群。
然而,到了 2024 年下半年,整个半导体与 AI 产业共同撞上了一堵无形的硬墙:
- 高质量人类公网语料枯竭:全网高质量的代码、论文与书籍已被完全刮取殆尽,后续合成数据(Synthetic Data)面临自噬污染(Model Collapse);
- 训练集群功耗极限:单次超大模型预训练动辄需要 10 万卡集群与百兆瓦级电网容量,边际性能提升却迅速衰减。
更重要的是,传统的 GPT-4 属于典型的“系统 1(System 1 / 快直觉)”系统:无论问题是微积分方程还是问“你好”,它在底层都是逐字做条件概率自回归采样($\prod P(w_t | w_{
OpenAI o1 的破局点,在于开辟了扩展定律的第二曲线:测试时扩展(Inference-time Scaling)。
所谓测试时计算,可以用一个极简的系统工程公式来概括:
这就意味着:对于简单问题,模型只花 100 个 Token 快速回答;对于博士级奥数题,模型在后台自言自语、穷举验证 10,000 个隐藏思考 Token(Thinking Tokens)后再给出最终答案。
算力开销的重心,正式从数据中心昂贵的一次性离线预训练,转变为每次用户提问时的动态实时搜索。
很多自媒体把 o1 的后台输出神话为“AI 在像爱因斯坦一样沉思默想”。如果从计算机微体系结构与算法的第一性原理来看,其内部结构清晰而冷静:
这套机制与十年前 DeepMind 战胜人类围棋的 AlphaGo 存在完全一致的数学同构:策略网络(生成候选落子)+ 价值网络(评估盘面胜率)+ 蒙特卡洛树搜索(MCTS 剪枝)。
不同的是,AlphaGo 的搜索空间是 $19 \times 19$ 的棋盘网格,而 o1 的搜索空间是高维自然语言与代码符号构成的无限状态转移树。
作为理性工程师,我们必须审视这项技术的物理与数学边界:
从芯片设计工程师的视角来看,推理期扩展对算力基础设施提出了完全不同的残酷要求:
这意味着大模型的显存占用(KV Cache)将呈阶跃式爆炸。当上下文长度因为思考链被拉长到数万 Token 时,自注意力机制的 $O(N^2)$ 显存复杂度将再次把 GPU 逼向物理绝境。
这也是为什么各大云厂商迫切需要更宽带宽的 HBM3e、更大容量的单机显存池以及更高效的投机采样(Speculative Decoding)算法。
推理模型(o1)绝不是通往“通用人工智能(AGI)”的魔法飞跃,它是一场极其精巧、极其务实、用搜索空间算法拯救预训练放缓的工程重构。
它没有心智,也不懂焦虑;它只是在符号与概率的深渊中,以每秒数千亿次浮点运算的执着,替人类一行行排除走不通的断头路。
二、 什么是测试时计算(Test-time Compute)?
传统生成方式:
$$y^* = \arg\max_y P(y \mid x)$$
一次性前向传播,输出消耗固定计算量。
测试时扩展方式:
$$y^* = \arg\max_{y \in \mathcal{T}(x, C_{\text{test}})} R(x, y)$$
其中 $C_{\text{test}}$ 为分配给推理阶段的算力预算,$R$ 为奖励评估函数,$\mathcal{T}$ 为在思考树空间中展开的搜索轨迹。
三、 拆开 o1 的黑盒:MCTS 与过程奖励模型(PRM)
// REASONING_SEARCH_PIPELINE (推理搜索管线)
四、 为什么推理模型能解数学代码,却在人文常识上容易卡死?
测试时计算有效的前提,是该领域存在可被客观计算检验的“物理真实锚点(Ground Truth)”。
五、 硬件账单:算力利用率(MFU)与显存墙的新风暴
// 传统推理解析 vs 推理模型解码
传统推理: 1 Token 输入 ──> 1.2 Token 输出 (主要瓶颈在内存带宽)
o1 推理: 1 Token 输入 ──> 50 隐藏思考 Token ──> 1 最终有效 Token六、 总结:看清技术的本相