返回时间轴
2025-05

Anthropic 激活 ASL-3 安全协议,建立首个与能力阈值挂钩的可操作 AI 安全框架

Capability Breakthrough

事件摘要

2025 年 5 月,Anthropic 为其最强模型激活了 ASL-3(AI 安全等级 3)防护,标志着 AI 实验室首次实施了与能力阈值直接挂钩的分层安全框架。负责任扩展政策(RSP)v3.0 定义了触发越来越严格安全措施的能力阈值——从监控到部署限制。ASL-3 的激活为 AI 实验室如何将安全研究运作化为可执行的内部治理——而非依赖自愿承诺——设立了先例。

影响评估

  • 认知转变 +2 · 长期

    第一个与具体能力阈值挂钩的运作化 AI 安全框架。创建了安全措施应与模型能力同步扩展的先例。影响了包括 SB 53 和 EU AI 法案实施在内的监管框架。

    受影响群体: AI safety researchers、AI labs、policymakers、regulators

  • 风险制造 -1 · 中期

    批评者认为阈值是自我定义和自我执行的,缺乏独立监督。引发了关于 AI 实验室能否可信地自我监管能力阈值的问题。

    受影响群体: public、ethicists、regulators

共识度与来源

重要度 L1
分类 能力突破
共识度 共识形成中
影响指数 6/10
  • 1

    原文可访问: https://www.anthropic.com/news/responsible-scaling-policy-v3

    We activated ASL-3 safeguards for relevant models in May 2025 and have been working to improve them ever since.
    参考证据 引用已记录 原文可访问