马克·扎克伯格于周三正式发布了 Muse Code 测试版,这是 Meta 推出的首个人工智能(AI)代码助手。然而,Anthropic 的 Claude Opus 5 在 Meta 官方公布的全部四项对比测试中均表现优于 Muse Code。
即便如此,Meta 依然选择公布相关对比图表,并将 Muse Code 打造为一款性价比较高的工具,而非性能最强者。第三方独立测试数据显示,实际差距甚至比 Meta 公开的数据更为明显。
Meta 自家测试数据,Anthropic 全面领先
Muse Code 内置的模型为 Muse Spark 1.2,在 Terminal-Bench 2.1 测试中的得分为 82.9%。
而 Claude Opus 5 在同一测试中取得了 86.7% 的成绩。Terminal-Bench 由 Laude Institute 与斯坦福大学研究团队联合开发,覆盖系统维护、数据处理、安全防护等 89 项真实开发任务。
尽管 Muse Code 排名第二,整体表现依然不俗,其分数超过了 OpenAI 的 Codex(81.8%)和 Grok Build(81.6%)。
但在另一项测试中,结果更为严峻。DeepSWE 1.1 测评涉及 113 项编程任务,测试期间不允许联网。Muse Spark 1.2 在该项中仅排第三,得分为 59.3%。
随后 Meta 还发布了一套自有基准测试,数据采集自公司工程师的 440 个真实 Pull Request。Muse Spark 1.2 得分为 70.6%,比 Opus 5 低约 9 个百分点。
该得分仅比 Meta 于 7 月上线的 Muse Spark 1.1 高出 2.3 分。
Meta 未被列入对比的模型
Meta 采用自家的 GPT-5.6 Terra 作为对标对象。然而,OpenAI 实际上推出了更强大的 Sol 模型,且 Meta 在三项代码测试榜单中均未提及该模型。
Sol 目前以 89.5% 的得分稳居独立 Terminal-Bench 2.1 榜首,Opus 5 紧随其后,得分为 89.1%。
这两项成绩均优于 Meta 自己公布的 Opus 5 得分(86.7%)。也就是说,Meta 选用了竞争对手的非最强版本,依然没能超越对方。
如果直接与 Sol——也就是业界真正的领头羊——对比,Muse Spark 1.2 的得分劣势为 6.6 分,而非 3.8 分。
Meta 只在一项测试中纳入了 Sol。在运行超过 1,000 次工具调用的 GPU 核心任务中,Sol 相较基线提升 71.2%,Muse Spark 1.2 提升 68.7%,在六款模型中位列第四。
值得注意的是,Muse Spark 1.2 目前尚未出现在该公开榜单上,榜单只测试了 183 款追踪模型中的 26 款。82.9% 的成绩仍然来自于 Meta 的自述数据。
“Muse Spark 1.2 是我们迈向前沿的重要一步,更大、更强的模型即将到来。”——扎克伯格(Zuckerberg)于社交平台发文表示。
扎克伯格或将托管击败自家模型的对手
据悉,Meta 正在与 Anthropic 商谈算力租赁协议。该合作可能在两年内金额高达 100 亿美元。届时,Meta 的数据中心将用于运行 Claude 模型,而 Muse Code 正是瞄准替代 Claude 演进而来。
Muse Code 背后的团队代价高昂。2025 年 6 月,扎克伯格以 143 亿美元收购了 Scale AI 及其创始人 Alexandr Wang,后者现任 Meta Superintelligence Labs 负责人。
定价成为 Wang 当前为数不多的竞争砝码。定价与 7 月推出的Meta 首个付费 API一致:每 100 万输入 token 收费 1.25 美元,每 100 万输出 token 收费 4.25 美元。
贡献者层级价格更为低廉,甚至低至十分之一。开发者如允许 Meta 使用其代码数据进行训练,即可享受该优惠。Wang 拒绝透露 Muse Spark 系列的具体用户数量。
Meta 财报揭示了优惠背后的原因。Meta 上季度营收同比增长 28%,达到 608 亿美元,但运营利润下滑 8%,降至 188 亿美元。
运营利润率从去年同期的 43%,跌至 31%。单季度资本支出高达 310.8 亿美元,全年支出指引上限高至 1,450 亿美元。
Muse Code 还具备 Claude Code 所不具备的工程功能。其后台智能体可在会话全程保持上下文,子智能体则能在独立的代码仓库副本中协同工作。
Meta 推出的代码生成模型,在性能上稳居行业第二,但定价却极具性价比。此次公测将检验,开发者们是否愿意为价格低至十分之一,而在准确率上略作妥协。









