2020-06-11
OpenAI 发布 GPT-3,证明语言模型规模化可以解锁涌现能力
事件摘要
2020 年 6 月,OpenAI 发表了 GPT-3(生成式预训练 Transformer 3),一个拥有 1750 亿参数的语言模型,展示了卓越的少样本学习能力——仅需寥寥几个示例即可执行新任务,无需微调。GPT-3 撰写的文章、生成的代码、翻译的语言和回答的问题,其质量经常模糊了人类与机器输出之间的界限。论文《语言模型是少样本学习者》(Brown 等人)验证了缩放假说:更大的模型在更多数据上训练会得到质的提升,而不仅仅是量的改进。
影响评估
-
能力跃迁 +3 · 长期
展示了大规模下的涌现式少样本学习。GPT-3 可以执行它从未被明确训练过的任务——翻译、算术、代码生成、问答——仅通过在提示中的几个示例。这确立了"提示"作为一种新编程范式的地位,并向持怀疑态度的领域证明了缩放假说。
受影响群体: AI researchers、NLP researchers、software developers
-
经济冲击 +3 · 中期
创造了"基础模型"商业模式:一个单一的大型模型通过 API 访问,开发者可将其适配到数千个下游应用。这种 API 驱动的模式成为 AI 商业化的默认方式。微软投资了数十亿美元,一整个初创公司生态系统(Jasper、Copy.ai、GitHub Copilot)在 GPT-3 上启动。
受影响群体: tech industry、investors、startups、Microsoft、OpenAI
-
风险制造 -2 · 中期
提高了公众对规模化 AI 风险的认识:产生令人信服的虚假信息、放大训练数据中的偏见、训练的环境成本(估计 552 吨 CO₂)以及 AI 能力集中在少数资金充足的实验室手中。
受影响群体: policymakers、ethicists、general public、researchers
共识度与来源
重要度
L3
分类
能力突破
共识度
广泛共识
影响指数
7/10
-
1
We demonstrate that scaling up language models greatly improves task-agnostic, few-shot performance.参考证据 引用已记录 原文可访问
-
2
Power-law relationships predict model performance from scale, enabling informed resource allocation.参考证据 引用已记录 原文可访问
-
3
参考证据 引用已记录 原文可访问
-
4
OpenAI's GPT-3 is shockingly good—and completely mindless.新闻报道 引用已记录 原文可访问