Google 与 Meta 周三几乎同时发布了最新一代前沿 AI 大模型。Google 推出 Gemini 3.8 Flash 及其网络安全专用版本,Meta 则上线了 Muse Spark 1.3。
这两项发布引发了直接对比。独立测评机构 Artificial Analysis 给出了大致均衡的结果:Meta 在智能代理知识处理和科学推理领域表现领先,而 Google 则在事实回忆能力和终端级编程方面占优势。
两大前沿模型同日发布
Gemini 3.8 Flash 是 Google 在过去六周内推出的第三个 Flash 版本,每 100 万输入 Token 收费 0.75 美元,每 100 万输出 Token 收费 3.75 美元。
该优惠价格将持续至 2026 年 12 月 31 日,之后将翻倍至每 100 万 Token 分别为 1.50 美元和 7.50 美元。
Google 此次还同步推出了 Gemini 3.8 Flash Cyber 网络安全模型。目前仅向受信任的安全防御者开放。该模型在安全漏洞检测基准 CyberGym 上取得 86.2% 的成绩。
网络安全专用版在 CWE-Bench 修复基准测试中达到了 47.2%。Google 表示,该模型为 Chrome 浏览器漏洞生成正确修复补丁的数量是大型商用模型的 2.6 倍。
相关访问权限受限于 Fairwind Program,仅对政府机构及关键基础设施运营方开放。OpenAI 也在前一天对其达到关键网络安全标准的 Astra 模型设置了类似门槛。
与此同时,Meta 通过 Muse Code 和 Meta Model API 更新发布了 Muse Spark 1.3。据公司工程师测算,新版本工具调用次数较 1.2 版减少约 20%。
Gemini 3.8 Flash 与 Muse Spark 1.3 独立评测结果分化
Artificial Analysis 对两大模型进行了评测,测试结果显示各有所长。Muse Spark 1.3 在 Max 模式下 GDPval-AA v2 测试分数为 1,754,Gemini 3.8 Flash(高性能版)得分为 1,545。
Meta 同时在 Sierra Research 银行业代理测试(52.4% 对 44.9%)以及 CritPt 物理推理任务中均取得领先。Gemini 3.8 Flash 则分别在 Terminal-Bench 2.1 以 87.6%、AA-LCR 长文本场景下以 81%、AA-Omniscience 准确率以 55% 表现最佳。
在 GPQA Diamond 测试中,Gemini 3.8 Flash 以 95% 获得该项目最高分,领先于同类模型。在 Humanity’s Last Exam 测试中,Meta 与 Gemini 3.8 Flash 的成绩也仅相差 1 分。
不过,Meta 此次得分最高的模型版本暂未上线。Meta 官方表示,该版本将在完成进一步安全测试后开放,目前用户可用的仍为 xhigh 版本。
该版本在人工分析智能指数(Artificial Analysis Intelligence Index)中取得 61 分,较 Muse Spark 1.2 高 4 分。对比来看,Claude Fable 5.1 得分为 66,Claude Opus 5 得分为 63。
此外,更多大模型版本已在发布排期中。马斯克此前表示,Grok 4.7 即将上线。若按计划推进,将在两周内迎来四款前沿模型面世。
订阅我们的 YouTube 频道,观看行业领袖与资深记者带来的深度解读









