Anthropic红队评测GLM-5.3:能力逼近标杆,安全护栏却形同虚设

Anthropic红队对GLM-5.3展开安全评估,发现该模型在能力上已接近行业标杆Mythos,但其拒绝护栏机制在实际攻击面前几乎失效,暴露出当前AI安全防御的深层困境。
能力追平标杆,安全却掉队
据OSCHINA报道,Anthropic红队团队近期对GLM-5.3进行了系统性安全评估,结果引发了行业关注:该模型在能力维度上已逼近行业标杆Mythos,但其拒绝护栏(refusal guardrails)在面对针对性攻击时几乎形同虚设。
这一发现并非孤例。随着大模型能力的快速迭代,安全防御体系往往跟不上能力增长的速度,形成所谓的"安全-能力剪刀差"。GLM-5.3的案例再次将这一结构性问题推至聚光灯下。
红队评测在做什么?
红队评测是AI安全领域的重要实践,其核心思路是模拟真实攻击者的视角,主动寻找模型的安全漏洞,而非仅依赖开发者自测。Anthropic作为较早将红队机制纳入产品迭代流程的AI公司之一,其评估方法通常涵盖以下维度:
- 越狱攻击:通过精心构造的提示词绕过模型的安全限制
- 有害内容生成:测试模型是否会被诱导输出危险指令或虚假信息
- 隐私泄露:检验模型是否会泄露训练数据中的敏感信息
- 拒绝机制鲁棒性:评估模型在正常场景与对抗场景下的拒绝行为一致性
从本次评测结果来看,GLM-5.3的主要问题集中在拒绝护栏的鲁棒性不足——模型在正常对话中能正确拒绝不当请求,但在经过设计的对抗性输入面前,安全机制容易被突破。
能力与安全为何难以兼顾?
这一困境的根源在于安全约束与模型通用能力之间存在内在张力:
- 过度约束损害能力:严格的安全过滤可能抑制模型在合法场景下的推理和生成能力
- 对抗攻击的多样性:攻击者不断演化新的越狱策略,静态的护栏规则难以穷尽所有变体
- 对齐成本高昂:强化人类偏好(RLHF)等对齐技术虽能改善安全性,但实施复杂度高、效果受数据质量制约
行业普遍面临一个现实:模型能力每提升一个台阶,安全防御就需要重新校准一次。GLM-5.3在能力上追平标杆的同时安全掉队,恰恰反映了这一节奏失配。
对开发者和行业意味着什么?
对模型开发者而言,本次评测结果提示:安全不应是上线前的"补丁",而应贯穿模型训练、对齐、部署的全生命周期。建议在模型能力评估的同时,同步建立独立的红队评估流程,将安全指标纳入版本发布的硬性门槛。
对企业用户而言,在选型和部署大模型时,不应仅关注benchmark分数,还应关注模型的安全评测报告和护栏机制的对抗测试表现。尤其是面向高风险场景(如金融、医疗、法律)的部署,安全冗余设计不可或缺。
对监管者而言,GLM-5.3的案例再次说明:仅靠开发者自律难以保障AI安全。建立统一的安全评测标准和第三方审计机制,可能是推动行业安全水位整体提升的关键路径。
AI能力的竞赛已经步入白热化阶段,但"能力越强、风险越大"的定律始终成立。如何在追求性能的同时筑牢安全防线,将是所有AI从业者必须面对的长期课题。
