谷歌发布最新音频模型排名分析

  • 谷歌语音模型以 82.6 分登顶语音识别指数
  • Gemini 3.8 发布 每小时仅需 0.84 美元
  • Gemini 3.1 Flash Live 语音测试获用户更高评价

Google 于 9 月 15 日推出 Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking,官方称其为迄今最先进的音频模型。

这两款模型具备对话、推理和多任务处理能力。那么在独立分析师的测评中,表现如何?Gemini 3.8 Live Extended Thinking 版本以 82.6 分,位列 Artificial Analysis 语音对话模型指数榜首,超越了 GPT-Live-1 和 Grok Voice。

第一时间掌握行业快讯,欢迎关注我们的 X(原 Twitter)账号

权威榜单如何评价 Google 最新对话式人工智能模型

Artificial Analysis 指数主要综合了语音推理能力、Agentic 表现、用户偏好以及任务完成率等维度。

Gemini 3.8 Live Extended Thinking 在高强度推理测试下首次亮相,便以 82.6 分斩获榜首。紧随其后的是 GPT-Live-1 Astra (81.5 分) 和 Grok Voice Think Fast 2.0 High (81.3 分)。

Gemini 3.8 Live 在语音对话指数中的排名
Gemini 3.8 Live 在语音对话指数中的排名。数据来源:Artificial Analysis

标准版 Gemini 3.8 Live以 76.0 分,位列第五。两种新版本均超越了 Gemini 3.1 Flash Live High(得分 71.5)。

若看智能体(Agentic)能力差距则更为明显。Extended Thinking 在 Tau Voice 基准测试中取得 68.6%,而前代产品仅为 37.7%。

在语音推理基准测试中,Extended Thinking 得分 97.7%,略高于 Grok Voice 的 97.2%。不过,相较于 Qwen Audio 3.0 Realtime Plus(得分 99.2%),依然略逊一筹。

用户测试仍偏爱旧款 Gemini

在价格方面,新老版本差距同样明显。标准版按每小时输入音频计费为 0.84 美元,大约是前代产品 1.75 美元的一半,也成为当前语音榜单中价格最低的选择之一。

Extended Thinking 每小时费用为 3.50 美元,低于 GPT-Live-1 Sol 的 4.47 美元,以及 Grok Voice Think Fast 2.0 High 的 4.80 美元

延迟方面也有所降低。首次音频输出的平均耗时降至 1.18 秒,而旧版 Gemini 模型则需 2.99 秒。

不过,用户的接受度仍有限。在语音代理盲测竞技场中,Gemini 3.1 Flash Live 依然以 1096 的 Elo 得分领先最受用户青睐。

Gemini 3.8 Live 以 1083 排名第二。尽管 Extended Thinking 能完成 89.1% 的任务,但其 Elo 得分仅为 990,表现稍显落后。

当前,语音 AI 的评判标准正在分化:一方面是强调推理能力的基准测试,另一方面则是侧重表达能力的用户喜好。谷歌目前在这两大维度分别领先,依赖于不同模型。

欢迎订阅我们的 YouTube 频道,收看行业领袖与记者分享权威观点

文章免责声明

BeInCrypto 致力于提供公正、透明的报道。本新闻文章旨在提供准确、及时的信息。但读者仍应自行独立核实事实,并在根据本内容作出任何决定之前咨询专业人士。请注意,我们的条款与条件隐私政策免责声明已更新。