Claude Fable 5 写出首个 AI 编写的 CUDA 超级内核,引发递归自改进讨论
事件摘要
2026年7月6日,Anthropic 的 Claude Fable 5 为 KernelBench-Mega 基准自主编写了一个 CUDA 超级内核,在 RTX PRO 6000 Blackwell GPU 上实现了 18.71 倍于优化 PyTorch 基线的加速。该内核是该基准有史以来提交的第一个'真正的超级内核'——每个解码令牌仅启动一次,而所有其他高分方案需要 4-14 次单独内核启动。Fable 5 的方法将硬件内存带宽利用率推至极限。这一壮举需要 2.5 小时的自主工作,期间模型将 64% 的时间用于静默分析(计时基线、推导 Roofline 性能模型),然后才编写代码。这一结果被广泛解读为 AI 系统在 AI 研发自动化方面能力日益增强的重要信号,对递归自改进具有潜在影响。
影响评估
-
能力跃迁 +3 · 长期
Fable 5 在 KernelBench-Mega 上的 18.71 倍加速代表了 AI 内核优化能力的阶跃变化。单次内核启动方法是人类工程师未曾发现的新技术。历史进展:Opus 4(约 3 倍,2025年5月)→ Mythos Preview(约 52 倍训练代码,2026年4月)→ Fable 5(18.71 倍推理内核,2026年7月)。
受影响群体: AI researchers、GPU programmers、hardware engineers
-
认知转变 +2 · 长期
Jack Clark 宣布这是'递归自改进'循环的开始。如果 AI 系统能够自主改进它们运行的计算基础设施,AI 进步的速度可能脱离人类驱动的研发。
受影响群体: AI researchers、policymakers、AI safety community
-
风险制造 -2 · 中期
RSI 的含义是一个安全担忧:如果 AI 系统能够以加速的方式自主提升自己的能力,人类监督和干预的窗口可能会缩小。此前的能力跃升(如一年内从 3 倍到 52 倍)表明这一趋势正在加速。
受影响群体: general public、policymakers、AI safety researchers
共识度与来源
-
1
Fable 5 achieved 18.71x speedup — the first true megakernel in KernelBench-Mega history.参考证据 引用已记录 原文可访问
-
2
The start of a recursive self-improvement loop.参考证据 引用已记录 原文可访问
-
3
Fable 5 wrote the first-ever CUDA super-kernel in 2.5 hours.新闻报道 引用已记录 原文可访问