#Grok 4.7 表现不及预期#马斯克 AGI 预期存疑
Grok 4.7 实测:马斯克豪言落空,仅列第四
WooFun2026-09-22 10:23
核心要点
SpaceXAI发布Grok 4.7,独立评测显示其智能指数46分位列第四。虽编码能力超越GPT-5.6 Sol,但高昂输出Token导致成本激增,马斯克称Grok 5才是AGI关键。
据 Woofun AI 消息,SpaceXAI 最新发布的 Grok 4.7 模型在独立机构评估中仅位列第四,与马斯克此前宣称的'性能超越所有其他模型'形成鲜明反差。
这一落差源于基准测试数据的全面拆解。独立基准测试公司 Artificial Analysis 给出的智能指数为 46 分,虽比 Grok 4.6 高出 2 分,但仍低于 Claude Fable 5.1、GPT-6 Astra 及 Claude Opus 5。马斯克曾强调该模型基于 2.1 万亿参数构建,并融合了 SpaceX 自身数据,旨在实现全面超越。
然而,在模拟真实专业工作任务的 AA-Briefcase 测试中,Grok 4.7 的 Elo 评分为 1657 分,较前代提升 111 分,逼近 Claude Opus 5 水平;在 GDPval-AA 测试中,其 Elo 评分达 1695 分,高出 90 分。编码能力方面,配合自研工具 Grok Build,Grok 4.7 在编码代理指数上获得 56 分,比 Grok 4.6 高出 9 分,成功超越 GPT-5.6 Sol,但仍落后于上述三家竞品。
值得注意的是,在 Terminal-Bench 4.0 和 GDP.pdf 测试中,其评分分别上升 4.5 个百分点和 3 个百分点,但在 AA-LCR 和 AutomationBench-AA 测试中评分下降。回顾 7 月,Grok 4.5 曾赢得 AutomationBench 冠军,印证了马斯克关于性能媲美 Claude Opus 的说法,但此次 Grok 4.7 的表现并未延续这一优势。
Woofun AI 整理数据显示,成本结构成为另一大隐忧。尽管定价未变——每百万输入 token 2 美元,每百万输出 token 6 美元,缓存命中 0.50 美元,上下文窗口维持 500,000 token——但输出量激增导致实际费用攀升。测试显示,每个指数任务 Grok 4.7 输出约 81,000 个 token,远超 Grok 4.6 的 36,000 个和 GPT-6 Astra 的 27,000 个。
这种低效的 token 消耗加剧了财务压力,该公司此前已报告 12.6 亿美元亏损。
未来路线图指向 Grok 4.8 与 Grok 5。马斯克于 9 月 14 日表示,Grok 4.8 的训练将在一周内完成,但他明确指出,Grok 5 才是实现通用人工智能的关键。接下来的版本将验证 SpaceXAI 是否能在不增加额外算力的情况下提升排名,这将是检验其技术效率与商业可持续性的核心指标。
评论
暂无评论