#马斯克策略存疑
参数暴涨 40% 却难敌竞品,xAI 以低价换生存
WooFun2026-09-21 17:16
核心要点
xAI发布Grok 4.7,参数增至2.1万亿但基准测试落后于Claude Fable 5.1等竞品。马斯克承认性能差距,坚持“足够好且低价”策略,并预告后续Grok 4.8至5.0路线图。
据 Woofun AI 消息,xAI 于周一下午正式上线 Grok 4.7,这是该系列迄今为止最强大的模型。马斯克在 X 平台上强调,该版本在保持相同价格和速度的前提下,相比 Grok 4.6 有了显著提升,且无需排队等待即可在 Grok 应用、Cursor、Grok Build 以及 xAI API 中直接使用。
尽管官方宣称其兼具出色的智能水平、快速的处理速度以及低廉的成本,但这一发布过程历经多次推迟,自 7 月底以来马斯克至少五次调整过预期时间,从最初的'四周后'、'几周后'到'3 到 4 周',再到 9 月 1 日的'10 天后'及 9 月 11 日的'还需要几天时间完善',最终才确认正式上线。xAI 表示,这款模型处理复杂问题时所需时间更长,也会更频繁地自我校验答案,同时还具备该公司所称的目前最为强大的安全防护机制。
Woofun AI 整理数据显示,Grok 4.7 拥有 2.1 万亿个参数,相比 Grok 4.6 的 1.5 万亿个参数增长了 40%,而 Grok 4.6 本身又是 Grok 4.5 的升级版。使用成本为每百万输入 token 2 美元,每百万输出 token 6 美元。参数是指模型在训练过程中调整的内部设定,参数越多通常意味着模型学习模式的能力越强;而 token 则是人工智能模型能够识别或生成的基本信息单位。xAI 还加入了来自马斯克旗下火箭公司 SpaceX 的额外训练数据,包括星链卫星的遥测数据、制造记录以及工程故障日志。该公司的宣传点是,这款模型在处理硬件及物理系统相关问题时的能力,要优于那些仅通过互联网文本进行训练的模型。
更关键的变量在于,这种垂直领域的数据注入旨在弥补通用互联网文本训练在物理世界逻辑上的短板,试图通过 SpaceX 的工程数据构建独特的竞争壁垒。
然而,各项基准测试的结果却显示出了常见的情况。GDPval 通过各领域专业人士审核过的任务,来衡量模型在处理具有实际经济价值的知识性工作——如法律备忘录、电子表格、演示文稿等——时的表现,并采用与国际象棋相同的 Elo 评分系统给出分数。Grok 4.7 在 GDPval 测试中的得分为 1695 分,而 Claude Fable 5.1 的得分则高达 1735 分。
由 Artificial Analysis 开发的 AA-Briefcase 则用于测试需要数小时完成的办公室工作,这类任务会将研究、分析及文档撰写整合为一项整体任务,同样采用 Elo 评分系统评估。Grok 4.7 的得分为 1657 分,低于 Fable 5.1 的 1678 分,测试结果虽相同但所用评估标准不同。Cursor 的 CursorBench 4.0 则是用于测试其在编辑器内处理实际编程任务的性能,该测试会根据每项任务的准确率、成本以及消耗的 token 数量来给出评价。
Grok 4.7 的表现处于中间水平:相比 GPT-5.6、Sol 的继任者 GPT-6 Astra 以及 Claude Sonnet 5,它的单任务成本更高,但仍不及在所有价格区间都占据优势的 Fable 5.1。对于 xAI 来说,这并非新现象。Grok 4.5 在 7 月推出时便拥有业内最大的训练集群,但其性能排名仅位列 Claude 和 OpenAI 的模型之后。在此之前,Grok 4.20 则选择了牺牲稳定性来换取速度和个性化特点。Grok 4.6 在编程自主性方面也落后于其他领先模型。
尽管如此,对于那些通过 X 平台、独立应用程序或特斯拉汽车仪表盘与 Grok 4.7 互动的数百万人而言,它依然是一款不错的产品。这意味着最有可能回答你的问题、或为你的汽车语音助手提供支持的模型,其实运行在一个根据其开发者自身基准测试结果来看略逊于顶尖水平的系统之上。
正因如此,对大多数人来说,价格比排名更重要。即便在原始性能方面落后于 Anthropic 和 OpenAI,xAI 仍能在每 token 成本上持续压低价格,因为它认为对于大多数日常用途而言,'足够好、价格低且随处可用'远比'最优秀但价格昂贵'更有优势。在发布前几天,马斯克就已经降低了人们的预期,他表示 Grok 4.7 的性能'大致相当于'Anthropic 的 Claude Opus 5.0,而非更新版的 Opus 5.1,而且其多模态功能仍有待提升。在同一篇帖子中,他还概述了接下来的三款模型:Grok 4.8 将是重大升级版本,Grok 4.9 则有望达到'Astra/Fable 级别'的性能,而 Grok 5 则可能成为领域的领头羊。
不过这些版本的发布日期尚未确定。'我们拭目以待吧,'他写道。这表明 xAI 正试图通过长期的迭代路线图来弥补当前的性能缺口,将竞争重心从单一的基准测试分数转向更广泛的市场渗透率与成本效率。
评论
暂无评论