Anthropic 于 9 月 28 日正式推出 Claude Sonnet 5.5,定价与 Sonnet 5 保持一致。官方表示,该模型运行速度提升超过 30%,每项任务的成本最多可降低 30%。
但经过独立基准测试机构评测后,在高强度使用下发现其实际成本与官方说明存在差异。
Anthropic 5.5 系列第二款模型发布,距 Opus 推出仅数日
Sonnet 5.5 是 Claude 5.5 系列的第二款产品。此前,Anthropic 于 9 月 22 日已率先发布 Opus 5.5。同期,OpenAI 也推出了 GPT-6 Sol 及 Luna。
本次发布的 Sonnet 5.5 沿用前作定价:每百万输入 Token 费用为 2 美元,每百万输出 Token 费率为 10 美元。官方介绍中,Sonnet 5.5 在 Terminal-Bench 4.0 代理式编码测试中获得 70.6% 得分,而 Sonnet 5 仅为 10.3%,Opus 5.5 则为 66.4%。
“Opus 5.5 更适用于需要深度判断的复杂任务,而 Sonnet 5.5 则专注于日常紧凑型业务场景——如修复 Bug、撰写文档、制作演示文稿及表格等。”Anthropic 团队表示。
Anthropic 强调,Sonnet 5.5 并未扩展模型边界。因此,本轮合规评审更聚焦于防范误导用户、配合高风险滥用等问题。
Sonnet 5.5 同时集成了网络安全防护与反蒸馏检测机制,阻止竞争者通过逆向分析获取模型推理逻辑。官方透露,Claude Haiku 5.5 亦将在未来数周内陆续发布。
与此同时,OpenAI 叫停了即将发布的 GPT-6.1 Astra,原因系安全考量。CNBC 本周一证实,该模型未达企业标准。
独立评测机构:全性能下模型使用成本高于预期
曾将 Grok 4.7 排名第四的基准测试机构 Artificial Analysis,此次为 Sonnet 5.5 打出 Intelligence Index 评分 56 分,整体排名第二,仅比 Opus 5.5 在满负荷条件下低 2 分。
该公司在 Terminal-Bench 4.0 基准测试中,Sonnet 5.5 得分为 64%,高于 Opus 5.5 和 GPT-6 Astra 的 60%。在类似 GDPval-AA 等知识类测试中,Sonnet 5.5 的表现与 Opus 5.5 基本持平。
但公司表示,Sonnet 5.5 实现这些成绩时,所使用的 Token 数量明显高于其他模型。
“在全负荷运行的情况下,Claude Sonnet 5.5 每完成一个智能指数任务,平均产生约 193,000 个输出 Token,这一表现已接近 Opus 5.5。”相关帖文指出。
这一 Token 体量,比 Opus 5.5 和 Sonnet 5 的全负荷场景高出约 60%,更是 GPT-6 Astra 最高 Token 使用量的 7 倍左右。
不过,Anthropic 引用的早期客户反馈显示,在其他工作负载下,情况与 Sonnet 5 恰好相反。Balyasny Asset Management 在金融方向任务中观察到更低的 Token 使用量。
“在我们分布于问答、数据提取、分析与预测等 2,441 个私有金融任务中,Claude Sonnet 5.5 的得分超过了 Sonnet 5,平均每条回答仅用约 121,000 个 Token,而 Sonnet 5 需用 497,000 个 Token。”Balyasny Asset Management 高级 AI 工程师 Joe Poirier 表示。
Artificial Analysis 此前测试的为一版存在结构化输出 Bug 的预发布版本,该 Bug 已被 Anthropic 修复。相关评测将在近期重新进行。
订阅我们的 YouTube 频道,第一时间获取业内专家与新闻人士的深度解读









