与此主题相关未来科技与人工智能委员会

Grok 4.7 发布表现超越预期吗

  • Grok 4.7 智能指数跻身前四
  • DeepSeek 编程超越 GPT-5.6 Sol 成本增加
  • 马斯克称 Grok 4.8 即将训练完成 Grok 5 接近实现通用人工智能

SpaceXAI 推出 Grok 4.7,独立评测显示其已跻身前沿 AI 实验室前四名。

独立评测机构 Artificial Analysis 将 Grok 4.7 的智能指数评分定为 46,比前一版本 Grok 4.6 提升 2 分。目前,Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5 得分更高,暂列前茅。

Grok 4.7 助力 SpaceXAI 进入全球前四 AI 实验室

埃隆·马斯克(Elon Musk)此前表示,Grok 4.7 基于 2.1 万亿参数打造,将全面超越现有所有 AI 模型。马斯克补充称,此次模型训练中还融入了 SpaceX 公司内部数据。

关注我们的 X(原推特)账号,第一时间掌握行业最新动态

那么,Grok 4.7 的实际表现究竟如何?在 Artificial Analysis 针对真实专业场景设计的 AA-Briefcase 基准测试中,Grok 4.7 获得了 1657 Elo 分,比上一代 Grok 4.6 提升 111 分,接近 Claude Opus 5 的水平。

在 GDPval-AA 测试中,Grok 4.7 录得 1695 Elo 分,比前一版本高出 90 分。编程任务得分同样持续提升。

结合自有编程代理 Grok Build,Grok 4.7 在 Coding Agent Index 编程代理指数上取得 56 分,比 Grok 4.6 提高 9 分。

该模型不仅超越了 GPT-5.6 Sol,目前仅落后于Anthropic 的 Claude Fable 5.1、GPT-6 Astra 和 Opus 5。

“Grok 4.7 在 Artificial Analysis 智能指数中的得分为 46,推动 SpaceXAI 跻身全球 TOP 4 AI 实验室。编程代理指数同样取得突破,成功超越 GPT-5.6 Sol。”相关帖子如此表示。

Grok 4.7 性能对比。
Grok 4.7 性能对比。来源:X/Artificial Analysis

在其他测试中,模型表现波动有限。它在 Terminal-Bench 4.0 上提升了 4.5 个百分点,在 GDP.pdf 测试中提高了 3 分。但在 AA-LCR 和 AutomationBench-AA 的表现则有所下滑。7 月份,Grok 4.5 在 AutomationBench 测试中排名第一,这一成绩印证了马斯克提出的“媲美 Claude Opus”说法。

性能提升背后:算力及费用代价

定价方面并未出现变化。Grok 4.7 依然按照每百万输入 Token 2 美元、每百万输出 Token 6 美元的标准计价。缓存命中仍享 0.5 美元的优惠价,50 万 Token 上下文窗口延续自 Grok 4.6。

不过,模型在每项任务中输出 Token 的数量显著增加。Artificial Analysis 数据显示,Grok 4.7 在 Index 任务中,平均每次输出约 81,000 Token,而 Grok 4.6 为 36,000,GPT-6 Astra 则为 27,000。因此,即使单 Token 价格不变,单任务的总体花费也会水涨船高。

如此庞大的 Token 消耗,带来的成本压力落在了 SpaceXAI——一个此前已公布亏损 12.6 亿美元的部门身上。与此同时,马斯克在 9 月 14 日透露,Grok 4.8 有望在一周内完成训练。

他还预测,Grok 5有望成为最先实现通用人工智能的模型。下一个版本将检验 SpaceXAI 能否继续攀升榜单,而无需进一步消耗更多算力资源。

欢迎订阅我们的 YouTube 频道,第一时间掌握行业领袖及媒体记者的深度分析

https://youtu.be/IcgIaeIE7LI

文章免责声明

BeInCrypto 致力于提供公正、透明的报道。本新闻文章旨在提供准确、及时的信息。但读者仍应自行独立核实事实,并在根据本内容作出任何决定之前咨询专业人士。请注意,我们的条款与条件隐私政策免责声明已更新。