Anthropic在模型安全领域取得重要进展,其新防御系统在效果和效率上均有突破。同时,大模型竞技场的数据表明,技术迭代速度极快,模型性能的领先优势非常短暂,竞争异常激烈。

模型动态

Anthropic发布新一代“宪法分类器”安全系统,大幅提升防越狱能力。

核心创新:利用模型内部激活(“直觉”)作为探针,结合更强大的“对话”分类器,形成两级防御。 效果显著:将越狱成功率从86%降至4.4%,对无害请求的误拒率降低87%。 效率提升:仅增加约1%的计算开销,且经过1700小时红队测试未发现通用越狱方法。

LMSys Arena发布模型排名演变分析报告,揭示领先地位快速更迭。

核心发现:榜首模型平均仅能保持35天,通常在5个月内跌出前5,7个月内跌出前10。 现状举例:曾经的领先者如o1和Claude 3 Opus排名已大幅下滑,分别跌至第56和第139位。