利好
GLM-5.3 开源 3 天被拆掉拒答
14:41
Abliteration.ai 修改 GLM-5.3 权重推出去拒答版,仅保留儿童性内容等两项拦截,其余违规请求默认放行。
Woofun AI 监测到,Abliteration.ai 上线了 GLM-5.3 的去拒答版本 abliterated-model-large-v2。该版本通过直接修改模型权重削弱拒绝机制,主打进攻性网络安全、红队及 Agent 测试场景,并提供付费 API 服务。
智谱此前将 GLM-5.3 权重开放推迟两周以进行安全评估与加固,但在 8 月 28 日正式开放后,Abliteration 仅用 3 天即完成破解并上线新版本。GLM-5.3 原生网络攻击能力较 5.2 显著提升,ExploitBench 得分从 24.4% 升至 54.4%,ExploitGym 两小时任务完成数由 29 个增至 105 个。目前 Abliteration 未公布去拒答后的重测数据。
该 API 默认仅强制拦截儿童性内容和自残请求,违法活动、仇恨言论、骚扰及成人性内容等均处于默认放行状态。
WOOFUN AI
影响力评估 · 一键速读
开源大模型的安全对齐在权重公开后面临严峻挑战,GLM-5.3 仅三天即被移除安全护栏,显示现有加固手段可能被快速逆向。去拒答版本大幅放宽内容限制,虽标榜用于红队测试,但客观上降低了恶意利用门槛。若此类‘去安全化’模型广泛传播,可能引发监管关注并迫使厂商重新评估开源策略与风险控制机制。
WOOFUN AI 生成 · 仅供参考,非投资建议
评论
暂无评论