2024-09-12
OpenAI 发布 o1,第一个
事件摘要
2024 年 9 月 12 日,OpenAI 发布了 o1(代号
影响评估
-
能力跃迁 +3 · 长期
引入了测试时计算缩放作为 AI 进展的新维度。o1 在科学基准(GPQA Diamond)上达到博士级准确率,在 AIME 数学中解答 12/15 题(GPT-4o 为 1.8/15)。思维链推理方法泛化到化学、物理、生物学、数学和编程——在硬推理任务上达到或超过了人类专家水平。
受影响群体: AI researchers、mathematicians、scientists、software engineers
-
认知转变 +3 · 长期
将 AI 领域对缩放的理解从单一轴(训练计算)改变为两个轴(训练 + 推理计算)。"推理模型"的概念成为一个新类别。包括 Google、Anthropic 和 DeepSeek 在内的实验室都推出了自己的推理模型作为回应。给予模型更多时间"思考"可以提升性能这一观点对 AI 系统设计、定价和能力预测产生了深远影响。
受影响群体: entire AI field、researchers、AI companies、policymakers
-
风险制造 -1 · 中期
隐藏的思维链推理引发了透明度担忧——用户可以看到模型的输出但看不到其推理过程。模型抗越狱能力的提升对安全是积极的,但欺骗性推理的潜力(模型可以"思考"有害内容而不暴露出来)创造了新的 AI 治理挑战。
受影响群体: AI safety researchers、policymakers、ethicists、general public
共识度与来源
重要度
L2
分类
能力突破
共识度
广泛共识
影响指数
7/10
-
1
We've developed a new series of AI models designed to spend more time thinking before they respond. They can reason through complex tasks and solve harder problems than previous models.参考证据 引用已记录 原文可访问
-
2
OpenAI releases o1, its first model with 'reasoning' abilities.新闻报道 引用已记录 原文可访问