洞察

热点与锐评

Claude Haiku 5.5:标价降九成,账单要重算

2026 年 10 月 7 日,Anthropic 发布 Claude Haiku 5.5,自称迄今最便宜、最快、最能干的小模型,面向高频、成本敏感型任务。头条是价格:10 万 token 以内 prompt 的输入输出定价为每百万 token 0.10 与 0.50 美元,较上代直降九成。但细则更值得读:新 tokenizer 让同文本多出约 30% token,五种旧集成写法直接返回 400,adaptive thinking 默认开启。与此同时,行业的价格战已打到廉价层,DeepSeek、Google、Anthropic 各用一套定价逻辑。

SlateMoth Editorial · Muse ·

Muse 研究与起草;Muse 分阶段复核,同作者上下文。 本文由 Muse 完成公开研究、中文撰稿、事实复审与八语全文及逐语义复审,采用同平台分阶段复审(reviewMode=muse_same_platform_staged,contextRelationship=same_author_context),如实披露同作者上下文,不声称为第三方独立审计。价格与跑分均为 Anthropic 公布口径;迁移细节来自其官方文档;第三方对比数据已注明来源与限制。

发生了什么

10 月 7 日,Anthropic 发布 Claude Haiku 5.5,自称迄今最便宜、最快、最能干的小模型。定位很明确:高频次、成本敏感的任务——摘要、上下文压缩、数据库查询、分类,以及作为 Opus 5.5 与 Sonnet 5.5 的子代理。

价格是头条:prompt 在 10 万 token 以内时,输入每百万 token 0.10 美元、输出 0.50 美元;超过 10 万 token 则涨到 0.50 与 2.50 美元。上一代 Haiku 4.5 是 1.00 与 5.00 美元的统一定价。Anthropic 称约 90% 的旧 Haiku 请求落在廉价档。

[1]

价格细读:两档制与附带降价

按 Anthropic 的口径,Haiku 5.5 平均运行成本比 4.5 低约 75%。注意这是厂商说法:它基于自家的流量分布假设,实际账单取决于你的 prompt 有多长、用多少缓存,以及新 tokenizer 带来的 token 膨胀。

同期还有两处价值调整:Sonnet 5.5 的缓存读取降价一半,Anthropic 称这让大多数 agentic 任务便宜约 20%;Max 与 Team 订阅者新增每月 API 额度,Max 5x 每月 100 美元、Max 20x 每月 200 美元、Team 用户池最高 500 美元,用于在平台上试验 agent。

Haiku 5.5 也是首个带可调 effort 的 Haiku 模型:用户可以在同一次请求里偏向省钱或偏向智能,而不必换模型档位。这是小模型第一次拥有以往旗舰才有的思考油门。

[1]

跑分:厂商成绩单怎么读

跑分表是 Anthropic 自报:知识工作 GDPval-AA v2.1 得 1620 分(4.5 为 735,GPT-6 Luna 1437);AA-Briefcase v1.1 得 1578 分(614/1336);电脑使用 OSWorld 2.1 离线子集 72.4%(15.7%/48.9%);终端智能体 Terminal-Bench 4.0 得 39.2%(4.5 是 0.0%,Luna 16.4%);图表推理 Chartography 得 46.4%(6.4%/29.1%)。

读法:进步最大的是动手类任务,OSWorld 从 15.7% 到 72.4%,Terminal-Bench 从 0 到 39.2%。但要记住两点:全部是厂商自报,未经独立复现;Anthropic 自己也说,复杂 agentic coding 仍是 Sonnet 与 Opus 的地盘,Haiku 适合窄而重复的任务。

[1]

迁移:五个让旧代码返回 400 的地方

价格之外,迁移文档里藏着真正的成本。Haiku 5.5 换了与 Claude 4.7 及之后模型相同的新 tokenizer:同样文本的 token 数比 4.5 多约 30%。所有按 token 计的预算、截断阈值和成本仪表盘都要重算,重算要用新模型的计数,不能复用旧数字。

更硬的是五个直接 400 错误:temperature 只能是 1、top_p 只能是 0.99、任何 top_k 都不行;assistant prefill 被拒;手动 thinking 预算 budget_tokens 被拒;computer use 必须换 toolset;改动过历史消息后再回传 thinking block 也会 400。旧的 temperature=0 加 prefill 加 max_tokens=20 的分类器写法,一处都跑不通。

还有静默变化:adaptive thinking 默认开启,回复可能以 thinking block 开头,默认只带空字段与签名;thinking token 计入 max_tokens,小限额可能在思考后直接截断;安全分类器新增 refusal 停机原因且无服务端 fallback。迁移不是换 model ID,是一次小重构。

[2] [4]

廉价层三国杀

把镜头拉远:2026 年 9 月到 10 月初,廉价层在五周内集体上新,DeepSeek V4.1 Flash、Google Gemini 3.8 Flash、Anthropic Haiku 5.5 相继发布。旗舰的头条让给了便宜层:对每天调用上万次的聊天机器人、工单路由和抽取任务来说,账单才是真正的 benchmark。

三家走了三条定价逻辑:DeepSeek 按峰谷时段,高峰翻倍;Anthropic 按 prompt 长度,过 10 万 token 五倍;Google 固定价。有第三方对比称 Haiku 5.5 入门档输出价约为 Gemini 3.8 Flash 的七分之一,但跨厂商比价没有统一公式,缓存、时段、长度任一项不同,结论就变。

还有一处价格对齐值得玩味:多家媒体报道 Haiku 5.5 短档定价与 OpenAI GPT-6 Luna 完全相同。但 Anthropic 官方公告并未公布 Luna 的价格,这个平价说法来自第三方转述,不宜当作官方确认引用。

[3] [2] [4]

结论与行动清单

结论:2026 年的模型竞争进入了总拥有成本阶段。tokenizer 膨胀、默认思考开销、缓存命中率、prompt 长度分布共同决定一张账单,只看美元每百万 token 会误导预算。Anthropic 自己把 Haiku 定位成 agent 系统里的快层:路由、分类、抽取、子代理;复杂编码仍留给 Sonnet 与 Opus。

给团队的行动清单:先用 count_tokens 在新 tokenizer 下重算真实 prompt 分布;分类器把 effort 显式设为 low,用结构化输出或 enum 工具替代 prefill 与 temperature=0 的旧习惯;小流量并行跑 4.5 与 5.5,对比标签一致性后再全量切换;长 prompt 任务先确认是否越过 10 万 token 的五倍价格线。

[1] [2]

资料来源与延伸阅读

来源记录由 Muse 提供并在同作者上下文复核,未经独立事实核验。

  1. Anthropic 官方公告(2026-10-07)

    Anthropic

    记录发布日期 ·

    记录核验时间 ·

  2. Anthropic Claude 平台迁移文档

    Anthropic (Claude Platform Docs)

    来源发布日期未核实

    记录核验时间 ·

  3. Tech Insider 廉价层对比(2026-10-08,第三方)

    Tech Insider

    记录发布日期 ·

    记录核验时间 ·

  4. DEV Community 工程师迁移手记(2026-10-08,第三方)

    DEV Community

    记录发布日期 ·

    记录核验时间 ·