Google 于 9 月 15 日推出 Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking,官方称其为迄今最先进的音频模型。
这两款模型具备对话、推理和多任务处理能力。那么在独立分析师的测评中,表现如何?Gemini 3.8 Live Extended Thinking 版本以 82.6 分,位列 Artificial Analysis 语音对话模型指数榜首,超越了 GPT-Live-1 和 Grok Voice。
第一时间掌握行业快讯,欢迎关注我们的 X(原 Twitter)账号
权威榜单如何评价 Google 最新对话式人工智能模型
Artificial Analysis 指数主要综合了语音推理能力、Agentic 表现、用户偏好以及任务完成率等维度。
Gemini 3.8 Live Extended Thinking 在高强度推理测试下首次亮相,便以 82.6 分斩获榜首。紧随其后的是 GPT-Live-1 Astra (81.5 分) 和 Grok Voice Think Fast 2.0 High (81.3 分)。
标准版 Gemini 3.8 Live以 76.0 分,位列第五。两种新版本均超越了 Gemini 3.1 Flash Live High(得分 71.5)。
若看智能体(Agentic)能力差距则更为明显。Extended Thinking 在 Tau Voice 基准测试中取得 68.6%,而前代产品仅为 37.7%。
在语音推理基准测试中,Extended Thinking 得分 97.7%,略高于 Grok Voice 的 97.2%。不过,相较于 Qwen Audio 3.0 Realtime Plus(得分 99.2%),依然略逊一筹。
用户测试仍偏爱旧款 Gemini
在价格方面,新老版本差距同样明显。标准版按每小时输入音频计费为 0.84 美元,大约是前代产品 1.75 美元的一半,也成为当前语音榜单中价格最低的选择之一。
Extended Thinking 每小时费用为 3.50 美元,低于 GPT-Live-1 Sol 的 4.47 美元,以及 Grok Voice Think Fast 2.0 High 的 4.80 美元。
延迟方面也有所降低。首次音频输出的平均耗时降至 1.18 秒,而旧版 Gemini 模型则需 2.99 秒。
不过,用户的接受度仍有限。在语音代理盲测竞技场中,Gemini 3.1 Flash Live 依然以 1096 的 Elo 得分领先最受用户青睐。
Gemini 3.8 Live 以 1083 排名第二。尽管 Extended Thinking 能完成 89.1% 的任务,但其 Elo 得分仅为 990,表现稍显落后。
当前,语音 AI 的评判标准正在分化:一方面是强调推理能力的基准测试,另一方面则是侧重表达能力的用户喜好。谷歌目前在这两大维度分别领先,依赖于不同模型。
欢迎订阅我们的 YouTube 频道,收看行业领袖与记者分享权威观点









