事件摘要
Epoch AI 与 METR 发布了 MirrorCode 长程编程任务结果。该基准要求模型在没有源代码和网络访问的条件下重建程序。一轮 Claude Opus 4.7 运行以报告的 251 美元推理成本,在 14 小时内完成了一个约 1.6 万行的目标程序。
影响评估
-
能力跃迁 +2 · 中期
MirrorCode 提供证据表明,现有模型能在受控条件下完成部分长程程序重建任务。
受影响群体: software engineers、AI-agent researchers、developer-tool builders
共识度与来源
重要度
L1
分类
能力突破
共识度
共识形成中
影响指数
4/10
- 1
- 2
- 3