暂无菜单项

8
发布于 更新于

Claude Sonnet 5.5 发布:价目表没动,单任务成本降三成

9 月 28 日,Anthropic 发布 Claude Sonnet 5.5,这是 Claude 5.5 家族继 Opus 5.5 之后的第二款模型。最值得记住的一条是价格:输入、输出、缓存读取三项单价一分未动,仍是每百万 tokens 输入 2 美元、输出 10 美元、缓存读取 0.20 美元,但官方称做同一件事的平均成本最多降三成——省在用量上,不在标价上。同期开放的还有 Claude Marketplace,一个把两千多个连接器、插件、第三方智能体与咨询伙伴放在一起的目录。

省下的三成不是降价省出来的

价目表不动这件事有来历:Sonnet 5 在 6 月以输入 2 美元、输出 10 美元的“引入价”上市,原计划 8 月调到 3 美元与 15 美元,那次调价最终没执行。Sonnet 5.5 沿用旧价,等于把这个中档位的价格钉住——对照上周发布并降价的 Opus 5.5(输入 4 美元、输出 20 美元),正好是它的一倍。

便宜下来的部分靠的是用得少:输出速度快 30% 以上,完成同样的工作通常需要更少的 token、更少的工具调用和更少的步骤,于是单任务成本最多低三成。官方还给出一个更激进的说法——部分评测里 Sonnet 5.5 用低或中等 effort 就能超过 Sonnet 5 的最好成绩,而单任务成本约为后者的十分之一。

真正跳了一大截的是终端里的编码

Terminal-Bench 4.0 上 Sonnet 5.5 拿到 70.6%,Sonnet 5 只有 10.3%,还高过最高 effort 下的 Opus 5.5(66.4%)。这个跨度要打折扣看:基准维护者提示,Sonnet 5 在测试里常撞上超时与 token 上限,10.3% 里包含不少“没跑完”的任务。

其余指标更像“贴近旗舰”:

  • 编码类:CursorBench 4.0 得 55.5%,Opus 5.5 为 57.8%;FrontierCode 1.1 主集上 Max effort 46.2%、Xhigh 52.1%,对照 Opus 5.5 的 54.4% 与 GPT-6 Sol 的 49.3%。
  • 知识工作:跨 44 个职业的真实任务评测 GDPval-AA v2.1 从 1449 升到 1844,只比 Opus 5.5 低 2 分。
  • 电脑操作与综合题:OSWorld 2.1 部分得分 80.1%,带工具的人类最后考题为 64.5%。
  • 长时程的闲笔:官方还提到,它是第一个只凭截图打通《宝可梦 红》的 Sonnet。

Anthropic 自己也很克制:明示在需要持续判断的复杂开放任务上 Opus 5.5 仍“明显更强”,Sonnet 5.5 面向的是界定清晰的日常任务、修 bug、写文档与做幻灯片表格;早期试用者提到,它照着模板出的演示稿基本不用再改。

客户那边的数字

早期用户给出的口径方向相当一致:Box 称快 2.4 倍、总 token 少 12%,Slack 在不改提示词的前提下输出 token 少约 14%。代码一类压缩得更狠——Lovable 报告工具调用少约三分之一、shell 执行次数减半,Balyasny 在 2441 个金融任务上把单答案的 token 消耗从 49.7 万降到约 12.1 万。这些都是官方收录的证言,参考价值在于方向一致,而非绝对数字。

第一个带网络安全护栏的 Sonnet

因为网络安全能力已经接近 Opus 5,Sonnet 5.5 成为首个自带网络安全护栏与回退机制的 Sonnet:风险较高的安全类请求会被交还给 Sonnet 5,用户能看到这个切换动作。它也是 Anthropic 首个配备防蒸馏分类器的模型,用来拦截规模化提取其推理过程的请求。官方特别说明,这两套护栏只覆盖一小部分高风险请求,常规软件开发与绝大多数生命科学工作不受影响。

同步开放的 Claude Marketplace

同一周,Anthropic 对外开放 Claude Marketplace,把三件事收进同一个目录:

  • 接上去:2000 多个立即可用的连接器与插件,来源包括 Atlassian、Google、Microsoft、Notion、Salesforce 等。
  • 买进来:CrowdStrike、Cursor、Harvey、Legora、Lovable、Snowflake 等公司的 Claude 驱动智能体与产品,符合条件的客户可用已承诺给 Anthropic 的支出额度中的一部分支付。
  • 找人做:Accenture、波士顿咨询、德勤等咨询与系统集成伙伴,负责帮企业把 Claude 铺进组织。

开发者侧的两条标准都是 Anthropic 主导的开放协议——连接器与插件用 MCP 与 Agent Skills 编写,做产品的公司可以申请上架。不难看出 OpenAI 应用商店的前车之鉴:目录能不能活,取决于第三方愿不愿意进来,而不是头部厂商撑场。

怎么用上

  • 在哪能用到:Claude Platform 与 AWS、Google Cloud、Microsoft Azure 同步可用,API 模型标识 claude-sonnet-5-5,企业可选零数据留存。
  • 迁移要改一处:此前把 Sonnet 的“思考”完全关掉使用的开发者,需先切到新的 between_tools 设置再迁移;Opus 5.5 已经不接受完全关闭思考的请求。
  • effort 默认值不统一:应用与 Claude Code 默认 Medium,Claude Platform API 默认 High,跨端比较效果与成本前先把这一项对齐;面向高调用量场景的 Haiku 5.5 将在未来几周加入家族。

怎么看这次发布

把两件事放在一起更有意思。模型这一侧,是把“旗舰以下也够用”的区间往上顶,让单位任务成本成为真正的选择依据,替很多日常流程省掉了 Opus 的溢价;产品这一侧,是把发现、采购、交付收进自己的目录,争的是“企业去哪里找 AI 能力”这个入口——微软在 Microsoft 365 Copilot 里做的 Agent Store 是同一个思路。

需要保留的分寸:全部基准为 Anthropic 自测,各对照模型的任务子集、harness 与 effort 并不完全一致;客户数字出自官方收录的证言,尚无第三方独立复现。要不要从 Opus 5.5 换到 Sonnet 5.5,最省事的办法还是拿自己那条真实工作流跑一遍,比对完成率与 token 消耗。

常见问题(FAQ)

Claude Sonnet 5.5 的单价降了吗?
每百万 tokens 的单价没有变化,仍是输入 2 美元、输出 10 美元、缓存读取 0.20 美元,缓存写入 2.50 美元。降的是单任务成本:官方称完成同样的工作所需 token、工具调用和步骤更少,据此算出的每任务开销最多低三成。
它能直接替掉 Opus 5.5 吗?
Anthropic 自己的定位是分工而非替代:Sonnet 5.5 面向界定清晰的日常任务、修 bug、写文档与做幻灯片表格,Opus 5.5 在需要持续判断的复杂开放任务上仍明显更强。两者单价相差一倍,建议用自己那条真实业务流对比完成率与 token 消耗后再决定默认用哪个。
Claude Marketplace 里的两千多个连接器都是 Anthropic 自己做的吗?
主要由第三方提供,Atlassian、Google、Microsoft、Notion、Salesforce 等都贡献了集成,开发者可以用 MCP 与 Agent Skills 自行开发上架。目录里另有 CrowdStrike、Cursor 等公司的付费产品与咨询集成伙伴;上市不等于 Anthropic 背书,接入某个工具前仍要自己评估它能访问哪些数据。
0 / 600
0 讨论
热门最新
总结
暂无总结