引言破题
先看一个奇怪的现象。
同一个 AI,你让它整理一份几十页的技术材料,几分钟就能理出清晰结构、标出核心重点,做得比很多资深从业者都高效。
可同一个 AI,你问它一个它其实不知道的问题,它不会主动说“我不知道”。它会用同样自信、笃定的语气,给你编织一个答案——有数据、有细节,全错。
如果这是“理解”,为什么这么不稳定?如果只是“无脑猜词”,它又怎么解决得了真问题?
这两年,中文互联网一直在吵“AI 到底会不会思考”。这期内容,我们不站队、不打口水仗,把争论彻底拆开,看它卡在哪。
底层拆解:三层完全不同的问题
为什么“它会不会思考”吵了这么久都没有定论?因为不同立场的人,在同时回答三个完全不同的问题:
- 第一个人问机制:这些文字在硅片和算法里究竟是怎么生成的?
- 第二个人问能力:它到底能稳定完成什么任务、不能完成什么?
- 第三个人问意识:它有没有主观体验,有没有内心的感受?
把这三层混在一起,永远吵不出结果。我们一层一层看:
AI 最危险的幻象,不是它像人,而是我们把像人当成了可靠。
从微观物理到宏观表现,信息流动经过了五层:
- 晶体管层:芯片上百亿个开关每秒以千兆赫兹速度翻转的 0 与 1;
- 数值表示层:高维浮点向量张量;
- 参数网络层:几百亿个权重旋钮,决定信息流过时的放大或衰减;
- 概率分布层:给下一个候选 Token 输出一张概率分布表;
- 人类语言层:挑选出最高概率的单元,逐字输出。
Google AdSense / 文章信息流展示位 (文间自适应)
核心推演:锯齿状前沿与幻觉真相
大模型展现出的是极度不均匀的“锯齿状前沿(Jagged Frontier)”:
在人类训练语料密集、逻辑强闭环的领域(如 Python 代码补全、格式转换、常见英文翻译),模型能力直接越过资深人类水平;但只要任务边界稍稍偏离、需要多步精确状态维护,能力瞬间跌落悬崖。
这解释了 TruthfulQA 评测中的著名现象:参数量更大的模型,有时候在特定常识陷阱题上的胡说率反而更高——因为更大的模型学会了人类文献中最具欺骗性的语言套路!
认知升华:可落地的三行验收法
与其寄希望于大模型突然获得人类的“自觉”,不如把你的任务重构为一个可控的外部系统:
写下三行工程验收标准:
1. 可观测输出是什么:要求 AI 返回固定的 JSON Schema 或程序可解析的返回值,拒绝开放式闲聊;
2. 什么条件算通过:设定断言测试或客观验收准则;
3. 没通过怎么处理:设定重试阈值、降级策略或人工拦截线。
参考文献与标准
- Brown et al., Language Models are Few-Shot Learners, arXiv:2005.14165
- Meta, The Llama 3 Herd of Models, arXiv:2407.21783
- Bricken et al., Towards Monosemanticity, transformer-circuits.pub, 2023
- Lin et al., TruthfulQA: Measuring How Models Mimic Human Falsehoods, ACL 2022
- Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP, arXiv:2005.11401
深入阅读 · 深度技术辞书
自回归生成的数学边界:为什么大语言模型永远无法消除“幻觉”?
从条件概率连乘 P(w_t|w_{<t})、自回归误差复合累积到 TruthfulQA 评测真相的底层数学推导。
查阅自回归数学边界手册 ➔