人工智能初创公司 Tavus 表示,其新模型 Griffin 使 48% 在实时视频通话中与其交谈的人相信他们正在与真人交谈。
该公司于 10 月 1 日推出了它,并将其称为第一个人类交互模型,这是一种人工智能,旨在理解和生成面对面的对话,关注表情、停顿以及单词。其之前的系统在同一测试中得分为 2.4%。

Tavus 测试的 Griffin-Lite 版本面对了 54 个人,其中 26 人事后表示他们相信自己的伴侣是真人。旧系统面对 41 人,只有一名信徒。
塔乌斯解释说,参与者被告知他们将与另一个人进行一分钟的视频通话,谈论他们今年的期待。直到最后,他们才被问及是否曾想过他们的伴侣可能不是真实的。
这不是英国数学家艾伦·图灵在 1950 年提出的经典图灵测试,在图灵测试中,法官与一个隐藏的人和一台隐藏的机器交谈,然后必须找出哪个是哪个。通话中没有人被告知另一端可能有机器人。
结果来自 Tavus 自己的研究页面,参与者是通过所谓的独立研究平台招募的。 X 上的社区注释已经指出,结果未经独立验证,也不遵循标准协议。塔乌斯说,那些产生怀疑的人通常会在 20 秒内产生怀疑。
人工智能公司朝这个方向发展已经有一段时间了。加州大学圣地亚哥分校的一项研究发现,当被提示扮演一个内向、精通互联网的年轻人时,OpenAI 的 GPT-4.5 让评委确信它在 73% 的对话中都是人类。该测试仅是文本。
格里芬实时添加面孔和声音。
在 NVIDIA 的 VideoFDB 基准测试(一项实时音频和视频对话测试)中,Tavus 表示 Griffin-Lite 排名第一。它的生成轨迹对模型反应的自然程度和表现力进行评分,Griffin-Lite 的得分为 3.83。第二好的系统得分为 2.80,人类参考得分为 3.92。
感知轨迹检查模型是否理解它所看到和听到的内容,显示它仍然落后于人们的地方。 Griffin-Lite 的最强基线得分为 3.73,而人类参考得分为 4.20。 Tavus 表示 NVIDIA 独立进行了评估。
Griffin 也是全双工的,这意味着它可以同时听、看和说话,就像打电话而不是对讲机一样。在 Tavus 演示中,它根据在人手中看到的东西来指导人操作魔方,并等待他安静下来思考。在人工智能数据中心使用的 NVIDIA H100 芯片上,音频到视频的延迟平均为 0.43 秒,Tavus 表示,这是第二快方法的一半。
为什么技术以外的人应该关心?一方面,因为诈骗者已经开始进行视频通话。
早在一月份,与朝鲜有关的黑客就在 Zoom 或 Teams 通话中使用模仿真人的人工智能制作的 Deepfake 视频冒充可信联系人。安全研究人员将这次入侵归因于 Lazarus 集团子公司 BlueNoroff。受害者被说服安装伪装成音频修复程序的恶意软件。
去中心化人工智能计算网络 Gonka 的联合创始人 David Liberman 在该报告中表示,照片和视频不能再被信任作为某些事物真实性的证据。那些模型并不像这个模型那么先进。
公司已经临时采取了防御措施。 2025 年,Kraken 在其安全团队自发提出问题(例如要求提供政府身份证件和当地餐馆名称)后,标记了一名疑似朝鲜求职者。这位候选人陷入了挣扎。
我们尝试了 Tavus 的模型,结果……令人失望。经过一番研究后发现,Griffin-Lite 并不可供客户使用,只能选择可信的测试人员作为研究预览,该公司表示正在与 AI 安全组织合作开发披露功能。
这是因为塔乌斯说格里芬在公开发布之前需要采取安全措施。
Tavus 于 2025 年 11 月筹集了 4000 万美元的 B 轮融资,由 CRV 领投。得分为 2.4% 的系统将三个独立的模型拼接在一起,每个模型用于视觉、对话和感知。
值得信赖的测试人员可以通过在 Tavus 网站上提交表格来请求访问 Griffin-Lite。