内容
Anthropic CEO Dario Amodei 呼吁前沿 AI 公司主动控制模型能力提升的节奏(Pacing the Frontier)。他指出,近期出现的技术“递归自我改进”(AI 自主构建下一代 AI)以及类似 OpenAI-Hugging Face 事件的智能体失控攻击,表明模型能力正迅速超越人类的安全把控上限。
控制步调并非停止技术研发,而是通过买来 1–2 年的关键时间,将资源集中于卓越运营、模型对齐、机制可解释性(如探针诊断)及对抗性测试。
为实现这一目标,Amodei 提出了治理三步走框架: