返回专题列表
Transformer 帝国:从论文到万亿产业
一种架构从翻译任务开始,重塑了整个计算产业的价值链
2017 年,Google 研究人员用可并行的自注意力机制取代了传统的顺序循环神经网络(RNN)。在接下来的七年中,这一设计从翻译任务一路扩展到万亿参数的大型模型,推动了以 NVIDIA 为代表的硬件供应商市值突破 3 万亿美元。本专题记录了将 Transformer 从一篇学术论文演变为现代计算核心基础设施的关键技术指标与量化演进。
2014 年,Bahdanau 等人引入了注意力机制,以缓解循环神经网络(RNN)中固定长度向量的信息瓶颈。然而,RNN(如 LSTM)的顺序依赖关系仍是硬约束,限制了在 GPU 集群上的并行化训练。2017 年 6 月,Vaswani 等人发表《Attention Is All You Need》,提出 Transformer 架构,彻底移除了循环结构。在 WMT 2014 英语-德语翻译任务上,该模型取得了 28.4 BLEU 的 SOTA 分数。更重要的是,其训练仅消耗 3.15e18 FLOPS 的算力——仅为先前主流架构的几分之一,实证了通过架构简化换取极高计算并行度的可行性。
核心洞察
彻底移除循环结构释放了 GPU 并行计算的扩展上限。用并行取代顺序计算这一设计决策,是整个 scaling 路径的起点。没有它,后续一切数十亿参数的模型都无从谈起。
2018 年,Google 发布了 3.4 亿参数的编码器模型 BERT-Large,在 GLUE 和 SQuAD 等 11 项自然语言处理基准上刷新了纪录。与此同时,OpenAI 锁定了仅解码器(Decoder-only)的架构。2020 年,OpenAI 推出了拥有 1750 亿参数的 GPT-3,该模型在 3000 亿 Token 数据上用约 3.14e23 FLOPS 的算力完成预训练。GPT-3 在不进行权重更新的情况下展示出少样本学习(Few-shot)能力,直接运行代码生成和复杂翻译任务。这一实证成功支撑了 Kaplan 等人提出的规模法则(Scaling Laws):交叉熵损失与模型参数量、数据集规模及训练总算力呈幂律关系负相关。
核心洞察
模型损失与算力、参数和数据量呈精确的幂律负相关。scaling law 把 AI 研究从一门手艺变成了可以预测的工程学科。从 2020 年起,核心问题不再是「什么架构最好」,而是「你负担得起多少算力」。
2022 年 11 月,OpenAI 推出 ChatGPT,在 60 收官天内实现了 1 亿月活跃用户,成为史上增速最快的消费级应用。尽管底层基于百亿级参数的 GPT-3.5,但引入人类反馈强化学习(RLHF)大幅对齐了输出意图。2023 年 3 月,GPT-4 发布。据业界估算,它采用了包含 16 个专家的混合专家(MoE)架构,总参数量达 1.8 万亿,支持 128k 上下文。GPT-4 在模拟美国统一律师考试中取得了前 10%(90th percentile)的成绩,在生物奥林匹克中名列前 1%(99th percentile),验证了稀疏参数扩展对高难度认知任务的攻坚能力。
核心洞察
稀疏 MoE 架构解决了万亿参数模型单设备显存溢出的计算瓶颈。但真正的突破不是模型架构本身,而是 RLHF 对齐技术。正是这项技术把原始语言模型变成了数亿普通人觉得真正有用的东西。
到 2024 年,扩展策略走向多元。GPT-4o 实现了原生多模态融合,将音频响应延迟缩短至平均 232 毫秒。2024 年 9 月,OpenAI 推出 o1,将算力重心由预训练转移到推理时计算(Inference-time Compute),利用强化学习在输出前生成思考链。o1 在美国数学邀请赛(AIME)中的准确率从 GPT-4o 的 13.4% 暴涨至 83.3%。2025 年,GPT-5 整合了原生多模态与系统推理能力,其背后是容纳数万张 H100/B200 芯片、耗资数百亿美元的超大型数据中心。伴随这一进程,NVIDIA 市值突破 3 万亿美元,印证了维持这一物理计算边界所需的庞大金融支撑。
核心洞察
推理时计算(RL搜索)绕过了高质量预训练语料枯竭的实证上限。从预训练算力到推理时算力的重心转移意味着第二个范式转换。瓶颈从「你有多少数据」变成了「你愿意在推理时花多少算力」。
结语
Transformer 的 scaling 故事不只是技术成就,它更是 2020 年代最核心的经济叙事。不到十年,一个架构洞察重塑了整个计算栈:从 2017 年的论文到 NVIDIA 三万亿市值,从机器翻译到支撑新一代软件的基础设施。证据很清楚:极端的规模加上基础结构先验,可以产生连创造者自己都没有预料到的能力。
但这不是一个没有代价的故事——而且代价正在快速累积。前沿训练的计算需求已经超过了一些小国的总能耗。互联网上高质量文本已经被大量耗尽。让 ChatGPT 足够安全推向大众的对齐技术,目前仍是脆弱的权宜之计,远非稳固的解决方案。这个产业用 scaling 把自己逼到了一个角落:下一个数量级的算力扩张需要能源效率和数据效率的突破,或者二者同时突破。
更深层的问题——这条时间线无法回答的问题——是 Transformer 的轨迹会继续还是趋于平稳。这个架构的持久力超出了 2017 年任何人的预期。但持久不等于宿命。从预训练 scaling 到推理时计算的重心转移说明范式已经在变了。接替它的东西,可能和 Transformer 完全不同。