AI 视频骗过 48% 人类,Tavus 融资 4000 万引安全隐忧
核心要点
Tavus发布Griffin模型,实时视频通话中48%受访者误认其为真人。虽获英伟达基准高分及4000万融资,但缺乏独立验证,且深度伪造诈骗风险加剧,引发行业对AI身份认证的担忧。
据 Woofun AI 消息,Tavus 于 10 月 1 日正式发布其首个'人类交互模型',标志着实时视频对话 AI 技术取得突破性进展。该模型专为理解和生成面对面对话而设计,能够同步处理语言内容、面部表情变化及对话停顿,旨在确立其在人机交互领域的领先地位。
在性能验证方面, 版本与 54 名参与者进行了交流,其中 26 人(占比 48%)坚信对方为真实人类;相比之下,旧款系统在与 41 人交流后仅 1 人产生相同错觉,准确率仅为 2.4%。测试流程要求参与者进行为期一分钟的视频通话,话题围绕对今年的期待,且全程未被告知对方可能是机器人,这与 1950 年艾伦·图灵提出的经典图灵测试截然不同——后者要求评估者主动分辨隐藏的人类与机器。
值得注意的是,开始产生怀疑的参与者通常在 20 秒内就会察觉异常。Woofun AI 整理数据显示,这些结果源自 Tavus 自身研究页面,参与者通过所谓独立研究平台招募,但 X 平台讨论指出其未经独立验证且不符合标准实验流程。
技术基准测试进一步揭示了 Griffin 的能力边界。在 基准测试中,Griffin-Lite 表现位居首位。在衡量回复自然度与表现力的'生成能力评分'项中,该模型获 3.83 分,仅次于真实人类的 3.92 分,远超排名第二系统的 2.80 分。在检测模型理解能力的'感知能力评分'项中,Griffin-Lite 得分为 3.73 分,优于最优秀基准系统的 3.44 分,但仍落后于真实人类的 4.20 分。
Tavus 称此项评估由英伟达独立完成。作为全双工系统,Griffin 能同时倾听、观察和说话,类似普通电话而非对讲机。演示中,它能根据用户手中魔方状态提供解题指导,并在用户思考时等待。在英伟达 H100 芯片上,音频到视频延迟平均为 0.43 秒,仅为次快方案的一半。横向对比来看, 的 GPT-4.5 在文本交流中能让 73% 的评估者相信其为真人,但 Griffin 实现了实时音视频结合。
然而,技术进步伴随严峻安全风险。1 月,与朝鲜有关的 Lazarus 集团子公司 在 或 通话中使用深度伪造技术伪装可信联系人,诱导受害者安装恶意软件。负责开发去中心化 AI 计算网络 的戴维·利伯曼指出,照片和视频已无法证明真实性,因早期 AI 模型远不及当前系统先进。防御措施方面,2025 年 通过随机提问(如查看政府身份证明及当地餐厅名字)发现一名疑似朝鲜籍求职者,该求职者在回答时显得吃力。
尽管 Tavus 声称正在研发披露功能并与多个 AI 安全组织合作,但 Griffin-Lite 目前仅限信任测试者试用,未向普通客户开放。2025 年 11 月,Tavus 在 领投下完成 4000 万美元 B 轮融资。其旧款系统通过整合三个独立模型(分别处理视觉、对话及感知)实现 2.4% 准确率。信任测试者可通过官网申请试用,但 Tavus 强调在公开发布前需额外安全保障。这是继文本 AI 突破后,视频交互领域首次引发如此广泛的安全担忧,预示着身份认证体系将面临重构。

评论
暂无评论