1.51 亿次交互被指非法蒸馏,七家中国 AI 遭 Anthropic 指控

核心要点

Anthropic发布威胁情报报告,指控阿里、月之暗面等七家中国公司未经授权蒸馏Claude模型。报告揭示大规模交互提取及用户请求转发争议,引发行业对技术边界与数据隐私的深刻反思。

据 Woofun AI 消息,全球人工智能安全格局因一份最新威胁情报报告而剧烈震荡,Anthropic 正式将矛头指向阿里巴巴月之暗面DeepSeek智谱小米商汤以及 MiniMax 这七家中国头部 AI 企业,指控其实施了未经授权的模型蒸馏行为。

这一指控并非泛泛而谈,而是基于对特定时间段内异常网络流量的深度追踪,核心争议聚焦于这些公司是否在未获许可的情况下,通过技术手段系统性提取了 Claude 模型的核心推理能力,并可能涉及对用户数据的违规处理。此举不仅将中美 AI 竞争中的技术伦理问题推向台前,更直接挑战了当前开源与闭源模型之间模糊的数据边界,迫使整个行业重新审视模型训练数据来源的合法性与透明度。

值得注意的是,此次被点名的企业涵盖了从互联网巨头到垂直领域独角兽的广泛阵营,显示出该指控所覆盖的技术生态之广,以及 Anthropic 在维护其模型知识产权方面所采取的强硬姿态,这标志着 AI 安全治理正从理论探讨转向具体的法律与商业对抗阶段。

指控中最具冲击力的数据指向阿里巴巴,Anthropic 声称在 5 月至 7 月期间,监测到可归因于阿里的超过 1.51 亿次交互请求,这些请求被明确用于提取 Claude 的推理能力。

这一数字规模之大,暗示了背后可能存在工业级的自动化提取系统,而非零星的技术测试。更深层的争议在于用户数据的流向:报告指出,月之暗面和 DeepSeek 被指控将部分用户请求直接转发给 Claude,利用其生成的回答再返回给终端用户,甚至有公司被指将此类对话记录直接转化为训练数据。

这种操作模式若属实,意味着用户在不知情的情况下,其输入内容成为了竞争对手模型优化的燃料。Woofun AI 整理数据显示,此类大规模交互不仅涉及简单的问答,更深度触及了模型核心的逻辑推演过程,使得'蒸馏'不再仅仅是参数层面的模仿,而是对模型思维链的直接窃取。

这种将用户请求作为中转站的行为,彻底打破了用户对数据隐私的基本预期,将商业竞争的成本转嫁给了普通用户,引发了关于数据所有权与服务透明度的激烈辩论。

这份报告的时间跨度覆盖了 2025 年 12 月至 2026 年 8 月,Anthropic 在此期间发现并阻断了一系列 AI 滥用活动,范畴远超模型蒸馏,包括网络攻击、监控、舆论影响、诈骗、生物领域滥用、常规武器开发等七大类。

然而,与国产模型直接相关的焦点集中在'蒸馏'这一章节。报告将'非法蒸馏'定义为未经授权、隐蔽开展且达到工业规模的能力提取活动,攻击者往往借助代理'中转站'、虚假账号或被盗凭证来绕过访问限制。蒸馏技术本身旨在让'学生模型'通过学习'老师模型'的输出进行训练,但争议在于数据来源的合法性。本次争夺的核心并非最终答案,而是模型的推理过程,即'如何分析和完成任务'的思维链。Anthropic 强调,相关活动主要针对编程、工具调用、数据分析以及长流程任务等高价值能力。

这意味着,被提取的不仅是知识,更是处理复杂问题的逻辑框架。判断此类行为是否违法,关键在于访问是否获得授权、是否绕过安全限制以及用户是否知情,仅凭使用蒸馏技术这一事实,尚不足以构成法律定论,但大规模、隐蔽性的操作无疑触碰了行业底线。

面对指控,Anthropic 披露了其应对措施,包括检测异常提取行为、封禁相关账号、以摘要替代完整推理内容以及加强身份验证,旨在防止模型安全限制在蒸馏过程中被剥离。截至 2026 年 9 月 11 日,被点名的七家公司尚未发布可核实的正式回应。

然而,业内对此早有分歧。早在 7 月 24 日,微软联合 Hugging FaceMetaMistral英伟达等企业签署公开信,主张区分正常模型开发与不当侵占,认为蒸馏是广泛使用的改进方法,非法提取应通过针对性法律解决,而非一刀切限制。技术层面,7 月 23 日 TechCrunch 在讨论 Kimi K3 时引用 AI 研究者 Nathan Lambert 的观点,指出随着模型接近前沿且训练重心转向强化学习,仅靠监督微调式蒸馏难以解释全部能力提升。Laude Institute 研究者、Snorkel AI 联合创始人 Braden Hancock 亦认为美国舆论低估了中国团队的技术实力。这些观点虽未直接回应九月报告的具体指控,但揭示了蒸馏技术在提升模型性能中的复杂作用,以及监管边界认定的困难性,暗示单纯的技术归因可能忽略了模型演进的多维动力。

目前,外界看到的仍是 Anthropic 的单方面调查结论,1.51 亿次交互的归因逻辑、用户请求是否经过授权转发、以及哪些对话被用于训练,均缺乏第三方验证。这场争议超越了单纯的技术竞争,直指数据隐私与伦理的核心:当用户将代码、商业资料甚至私人对话输入 AI 时,背后处理信息的主体可能已悄然转移。AI 公司争夺的是下一代模型的能力高地,但被卷入其中的却是每一个普通用户的数据资产。若对话在用户不知情下被转发、储存甚至用于训练,我们不得不重新追问:在 AI 的输入框前,用户究竟是使用产品的消费者,还是被无偿征用的训练原料?

这一问题的答案,将决定未来 AI 生态的信任基石与合规走向。

评论

回复 @用户
0/800

暂无评论

消息提醒

登录后查看消息
查看全部消息管理订阅