利好

GLM-5.3 开源 3 天被拆掉拒答

14:41

Abliteration.ai 修改 GLM-5.3 权重推出去拒答版,仅保留儿童性内容等两项拦截,其余违规请求默认放行。

Woofun AI 监测到,Abliteration.ai 上线了 GLM-5.3 的去拒答版本 abliterated-model-large-v2。该版本通过直接修改模型权重削弱拒绝机制,主打进攻性网络安全、红队及 Agent 测试场景,并提供付费 API 服务。

智谱此前将 GLM-5.3 权重开放推迟两周以进行安全评估与加固,但在 8 月 28 日正式开放后,Abliteration 仅用 3 天即完成破解并上线新版本。GLM-5.3 原生网络攻击能力较 5.2 显著提升,ExploitBench 得分从 24.4% 升至 54.4%,ExploitGym 两小时任务完成数由 29 个增至 105 个。目前 Abliteration 未公布去拒答后的重测数据。

该 API 默认仅强制拦截儿童性内容和自残请求,违法活动、仇恨言论、骚扰及成人性内容等均处于默认放行状态。

WOOFUN AI

影响力评估 · 一键速读

开源大模型的安全对齐在权重公开后面临严峻挑战,GLM-5.3 仅三天即被移除安全护栏,显示现有加固手段可能被快速逆向。去拒答版本大幅放宽内容限制,虽标榜用于红队测试,但客观上降低了恶意利用门槛。若此类‘去安全化’模型广泛传播,可能引发监管关注并迫使厂商重新评估开源策略与风险控制机制。
WOOFUN AI 生成 · 仅供参考,非投资建议

评论

回复 @用户
0/800

暂无评论

消息提醒

登录后查看消息
查看全部消息管理订阅