与此主题相关未来科技与人工智能委员会

Anthropic Sonnet 模型接近 Opus 性能但耗费更多代币

  • Anthropic 发布 Claude Sonnet 5.5 速度提升三成
  • Artificial Analysis 智能指数排名第二,仅次于 Opus 5.5
  • Sonnet 5.5 输出代币量比 Opus 5.5 高 60%

Anthropic 于 9 月 28 日正式推出 Claude Sonnet 5.5,定价与 Sonnet 5 保持一致。官方表示,该模型运行速度提升超过 30%,每项任务的成本最多可降低 30%。

但经过独立基准测试机构评测后,在高强度使用下发现其实际成本与官方说明存在差异。

关注我们的 X 账号,第一时间获取最新资讯

Anthropic 5.5 系列第二款模型发布,距 Opus 推出仅数日

Sonnet 5.5 是 Claude 5.5 系列的第二款产品。此前,Anthropic 于 9 月 22 日已率先发布 Opus 5.5。同期,OpenAI 也推出了 GPT-6 Sol 及 Luna。

本次发布的 Sonnet 5.5 沿用前作定价:每百万输入 Token 费用为 2 美元,每百万输出 Token 费率为 10 美元。官方介绍中,Sonnet 5.5 在 Terminal-Bench 4.0 代理式编码测试中获得 70.6% 得分,而 Sonnet 5 仅为 10.3%,Opus 5.5 则为 66.4%。

“Opus 5.5 更适用于需要深度判断的复杂任务,而 Sonnet 5.5 则专注于日常紧凑型业务场景——如修复 Bug、撰写文档、制作演示文稿及表格等。”Anthropic 团队表示。

Anthropic 强调,Sonnet 5.5 并未扩展模型边界。因此,本轮合规评审更聚焦于防范误导用户、配合高风险滥用等问题。

Sonnet 5.5 同时集成了网络安全防护与反蒸馏检测机制,阻止竞争者通过逆向分析获取模型推理逻辑。官方透露,Claude Haiku 5.5 亦将在未来数周内陆续发布。

与此同时,OpenAI 叫停了即将发布的 GPT-6.1 Astra,原因系安全考量。CNBC 本周一证实,该模型未达企业标准。

独立评测机构:全性能下模型使用成本高于预期

曾将 Grok 4.7 排名第四的基准测试机构 Artificial Analysis,此次为 Sonnet 5.5 打出 Intelligence Index 评分 56 分,整体排名第二,仅比 Opus 5.5 在满负荷条件下低 2 分。

该公司在 Terminal-Bench 4.0 基准测试中,Sonnet 5.5 得分为 64%,高于 Opus 5.5 和 GPT-6 Astra 的 60%。在类似 GDPval-AA 等知识类测试中,Sonnet 5.5 的表现与 Opus 5.5 基本持平。

但公司表示,Sonnet 5.5 实现这些成绩时,所使用的 Token 数量明显高于其他模型。

“在全负荷运行的情况下,Claude Sonnet 5.5 每完成一个智能指数任务,平均产生约 193,000 个输出 Token,这一表现已接近 Opus 5.5。”相关帖文指出。

这一 Token 体量,比 Opus 5.5 和 Sonnet 5 的全负荷场景高出约 60%,更是 GPT-6 Astra 最高 Token 使用量的 7 倍左右。

不过,Anthropic 引用的早期客户反馈显示,在其他工作负载下,情况与 Sonnet 5 恰好相反。Balyasny Asset Management 在金融方向任务中观察到更低的 Token 使用量。

“在我们分布于问答、数据提取、分析与预测等 2,441 个私有金融任务中,Claude Sonnet 5.5 的得分超过了 Sonnet 5,平均每条回答仅用约 121,000 个 Token,而 Sonnet 5 需用 497,000 个 Token。”Balyasny Asset Management 高级 AI 工程师 Joe Poirier 表示。

Artificial Analysis 此前测试的为一版存在结构化输出 Bug 的预发布版本,该 Bug 已被 Anthropic 修复。相关评测将在近期重新进行。

订阅我们的 YouTube 频道,第一时间获取业内专家与新闻人士的深度解读

文章免责声明

BeInCrypto 致力于提供公正、透明的报道。本新闻文章旨在提供准确、及时的信息。但读者仍应自行独立核实事实,并在根据本内容作出任何决定之前咨询专业人士。请注意,我们的条款与条件、隐私政策及免责声明已更新。