Anthropic发布新一代“宪法分类器”安全系统,大幅提升防越狱能力。
核心创新:利用模型内部激活(“直觉”)作为探针,结合更强大的“对话”分类器,形成两级防御。 效果显著:将越狱成功率从86%降至4.4%,对无害请求的误拒率降低87%。 效率提升:仅增加约1%的计算开销,且经过1700小时红队测试未发现通用越狱方法。
Anthropic在模型安全领域取得重要进展,其新防御系统在效果和效率上均有突破。同时,大模型竞技场的数据表明,技术迭代速度极快,模型性能的领先优势非常短暂,竞争异常激烈。