SpaceXAI 推出 Grok 4.7,独立评测显示其已跻身前沿 AI 实验室前四名。
独立评测机构 Artificial Analysis 将 Grok 4.7 的智能指数评分定为 46,比前一版本 Grok 4.6 提升 2 分。目前,Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5 得分更高,暂列前茅。
Grok 4.7 助力 SpaceXAI 进入全球前四 AI 实验室
埃隆·马斯克(Elon Musk)此前表示,Grok 4.7 基于 2.1 万亿参数打造,将全面超越现有所有 AI 模型。马斯克补充称,此次模型训练中还融入了 SpaceX 公司内部数据。
那么,Grok 4.7 的实际表现究竟如何?在 Artificial Analysis 针对真实专业场景设计的 AA-Briefcase 基准测试中,Grok 4.7 获得了 1657 Elo 分,比上一代 Grok 4.6 提升 111 分,接近 Claude Opus 5 的水平。
在 GDPval-AA 测试中,Grok 4.7 录得 1695 Elo 分,比前一版本高出 90 分。编程任务得分同样持续提升。
结合自有编程代理 Grok Build,Grok 4.7 在 Coding Agent Index 编程代理指数上取得 56 分,比 Grok 4.6 提高 9 分。
该模型不仅超越了 GPT-5.6 Sol,目前仅落后于Anthropic 的 Claude Fable 5.1、GPT-6 Astra 和 Opus 5。
“Grok 4.7 在 Artificial Analysis 智能指数中的得分为 46,推动 SpaceXAI 跻身全球 TOP 4 AI 实验室。编程代理指数同样取得突破,成功超越 GPT-5.6 Sol。”相关帖子如此表示。
在其他测试中,模型表现波动有限。它在 Terminal-Bench 4.0 上提升了 4.5 个百分点,在 GDP.pdf 测试中提高了 3 分。但在 AA-LCR 和 AutomationBench-AA 的表现则有所下滑。7 月份,Grok 4.5 在 AutomationBench 测试中排名第一,这一成绩印证了马斯克提出的“媲美 Claude Opus”说法。
性能提升背后:算力及费用代价
定价方面并未出现变化。Grok 4.7 依然按照每百万输入 Token 2 美元、每百万输出 Token 6 美元的标准计价。缓存命中仍享 0.5 美元的优惠价,50 万 Token 上下文窗口延续自 Grok 4.6。
不过,模型在每项任务中输出 Token 的数量显著增加。Artificial Analysis 数据显示,Grok 4.7 在 Index 任务中,平均每次输出约 81,000 Token,而 Grok 4.6 为 36,000,GPT-6 Astra 则为 27,000。因此,即使单 Token 价格不变,单任务的总体花费也会水涨船高。
如此庞大的 Token 消耗,带来的成本压力落在了 SpaceXAI——一个此前已公布亏损 12.6 亿美元的部门身上。与此同时,马斯克在 9 月 14 日透露,Grok 4.8 有望在一周内完成训练。
他还预测,Grok 5有望成为最先实现通用人工智能的模型。下一个版本将检验 SpaceXAI 能否继续攀升榜单,而无需进一步消耗更多算力资源。









