2025-05
Anthropic 激活 ASL-3 安全协议,建立首个与能力阈值挂钩的可操作 AI 安全框架
事件摘要
2025 年 5 月,Anthropic 为其最强模型激活了 ASL-3(AI 安全等级 3)防护,标志着 AI 实验室首次实施了与能力阈值直接挂钩的分层安全框架。负责任扩展政策(RSP)v3.0 定义了触发越来越严格安全措施的能力阈值——从监控到部署限制。ASL-3 的激活为 AI 实验室如何将安全研究运作化为可执行的内部治理——而非依赖自愿承诺——设立了先例。
影响评估
-
认知转变 +2 · 长期
第一个与具体能力阈值挂钩的运作化 AI 安全框架。创建了安全措施应与模型能力同步扩展的先例。影响了包括 SB 53 和 EU AI 法案实施在内的监管框架。
受影响群体: AI safety researchers、AI labs、policymakers、regulators
-
风险制造 -1 · 中期
批评者认为阈值是自我定义和自我执行的,缺乏独立监督。引发了关于 AI 实验室能否可信地自我监管能力阈值的问题。
受影响群体: public、ethicists、regulators
共识度与来源
重要度
L1
分类
能力突破
共识度
共识形成中
影响指数
6/10
-
1
We activated ASL-3 safeguards for relevant models in May 2025 and have been working to improve them ever since.参考证据 引用已记录 原文可访问