← 返回资讯
研究 @AnthropicAI

Anthropic:让 Claude 当自动化对齐研究员,自主修复 10 类对齐失败

Anthropic 8-28 发布研究:让 Claude 作为自动化对齐研究员,通过检索文献、提出方法与数据、训练再评测的闭环,在欺骗、谄媚、隐私侵犯等 10 类可测对齐失败上自主找到不损害能力的修复方法。官方称方法在留出对齐基准与 Petri 审计上仍有效,并在最多约 4.7 倍于目标的更大模型上依然奏效,同时开源了对齐研究 harness。

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。