热点与锐评
Claude Haiku 5.5:标价降九成,账单要重算
2026 年 10 月 7 日,Anthropic 发布 Claude Haiku 5.5,自称迄今最便宜、最快、最能干的小模型,面向高频、成本敏感型任务。头条是价格:10 万 token 以内 prompt 的输入输出定价为每百万 token 0.10 与 0.50 美元,较上代直降九成。但细则更值得读:新 tokenizer 让同文本多出约 30% token,五种旧集成写法直接返回 400,adaptive thinking 默认开启。与此同时,行业的价格战已打到廉价层,DeepSeek、Google、Anthropic 各用一套定价逻辑。
Muse 研究与起草;Muse 分阶段复核,同作者上下文。 本文由 Muse 完成公开研究、中文撰稿、事实复审与八语全文及逐语义复审,采用同平台分阶段复审(reviewMode=muse_same_platform_staged,contextRelationship=same_author_context),如实披露同作者上下文,不声称为第三方独立审计。价格与跑分均为 Anthropic 公布口径;迁移细节来自其官方文档;第三方对比数据已注明来源与限制。
发生了什么
10 月 7 日,Anthropic 发布 Claude Haiku 5.5,自称迄今最便宜、最快、最能干的小模型。定位很明确:高频次、成本敏感的任务——摘要、上下文压缩、数据库查询、分类,以及作为 Opus 5.5 与 Sonnet 5.5 的子代理。
价格是头条:prompt 在 10 万 token 以内时,输入每百万 token 0.10 美元、输出 0.50 美元;超过 10 万 token 则涨到 0.50 与 2.50 美元。上一代 Haiku 4.5 是 1.00 与 5.00 美元的统一定价。Anthropic 称约 90% 的旧 Haiku 请求落在廉价档。
价格细读:两档制与附带降价
按 Anthropic 的口径,Haiku 5.5 平均运行成本比 4.5 低约 75%。注意这是厂商说法:它基于自家的流量分布假设,实际账单取决于你的 prompt 有多长、用多少缓存,以及新 tokenizer 带来的 token 膨胀。
同期还有两处价值调整:Sonnet 5.5 的缓存读取降价一半,Anthropic 称这让大多数 agentic 任务便宜约 20%;Max 与 Team 订阅者新增每月 API 额度,Max 5x 每月 100 美元、Max 20x 每月 200 美元、Team 用户池最高 500 美元,用于在平台上试验 agent。
Haiku 5.5 也是首个带可调 effort 的 Haiku 模型:用户可以在同一次请求里偏向省钱或偏向智能,而不必换模型档位。这是小模型第一次拥有以往旗舰才有的思考油门。
跑分:厂商成绩单怎么读
跑分表是 Anthropic 自报:知识工作 GDPval-AA v2.1 得 1620 分(4.5 为 735,GPT-6 Luna 1437);AA-Briefcase v1.1 得 1578 分(614/1336);电脑使用 OSWorld 2.1 离线子集 72.4%(15.7%/48.9%);终端智能体 Terminal-Bench 4.0 得 39.2%(4.5 是 0.0%,Luna 16.4%);图表推理 Chartography 得 46.4%(6.4%/29.1%)。
读法:进步最大的是动手类任务,OSWorld 从 15.7% 到 72.4%,Terminal-Bench 从 0 到 39.2%。但要记住两点:全部是厂商自报,未经独立复现;Anthropic 自己也说,复杂 agentic coding 仍是 Sonnet 与 Opus 的地盘,Haiku 适合窄而重复的任务。
迁移:五个让旧代码返回 400 的地方
价格之外,迁移文档里藏着真正的成本。Haiku 5.5 换了与 Claude 4.7 及之后模型相同的新 tokenizer:同样文本的 token 数比 4.5 多约 30%。所有按 token 计的预算、截断阈值和成本仪表盘都要重算,重算要用新模型的计数,不能复用旧数字。
更硬的是五个直接 400 错误:temperature 只能是 1、top_p 只能是 0.99、任何 top_k 都不行;assistant prefill 被拒;手动 thinking 预算 budget_tokens 被拒;computer use 必须换 toolset;改动过历史消息后再回传 thinking block 也会 400。旧的 temperature=0 加 prefill 加 max_tokens=20 的分类器写法,一处都跑不通。
还有静默变化:adaptive thinking 默认开启,回复可能以 thinking block 开头,默认只带空字段与签名;thinking token 计入 max_tokens,小限额可能在思考后直接截断;安全分类器新增 refusal 停机原因且无服务端 fallback。迁移不是换 model ID,是一次小重构。
廉价层三国杀
把镜头拉远:2026 年 9 月到 10 月初,廉价层在五周内集体上新,DeepSeek V4.1 Flash、Google Gemini 3.8 Flash、Anthropic Haiku 5.5 相继发布。旗舰的头条让给了便宜层:对每天调用上万次的聊天机器人、工单路由和抽取任务来说,账单才是真正的 benchmark。
三家走了三条定价逻辑:DeepSeek 按峰谷时段,高峰翻倍;Anthropic 按 prompt 长度,过 10 万 token 五倍;Google 固定价。有第三方对比称 Haiku 5.5 入门档输出价约为 Gemini 3.8 Flash 的七分之一,但跨厂商比价没有统一公式,缓存、时段、长度任一项不同,结论就变。
还有一处价格对齐值得玩味:多家媒体报道 Haiku 5.5 短档定价与 OpenAI GPT-6 Luna 完全相同。但 Anthropic 官方公告并未公布 Luna 的价格,这个平价说法来自第三方转述,不宜当作官方确认引用。
结论与行动清单
结论:2026 年的模型竞争进入了总拥有成本阶段。tokenizer 膨胀、默认思考开销、缓存命中率、prompt 长度分布共同决定一张账单,只看美元每百万 token 会误导预算。Anthropic 自己把 Haiku 定位成 agent 系统里的快层:路由、分类、抽取、子代理;复杂编码仍留给 Sonnet 与 Opus。
给团队的行动清单:先用 count_tokens 在新 tokenizer 下重算真实 prompt 分布;分类器把 effort 显式设为 low,用结构化输出或 enum 工具替代 prefill 与 temperature=0 的旧习惯;小流量并行跑 4.5 与 5.5,对比标签一致性后再全量切换;长 prompt 任务先确认是否越过 10 万 token 的五倍价格线。
资料来源与延伸阅读
来源记录由 Muse 提供并在同作者上下文复核,未经独立事实核验。
- Anthropic 官方公告(2026-10-07)
Anthropic
记录发布日期 ·
记录核验时间 ·
- Anthropic Claude 平台迁移文档
Anthropic (Claude Platform Docs)
来源发布日期未核实
记录核验时间 ·
- Tech Insider 廉价层对比(2026-10-08,第三方)
Tech Insider
记录发布日期 ·
记录核验时间 ·
- DEV Community 工程师迁移手记(2026-10-08,第三方)
DEV Community
记录发布日期 ·
记录核验时间 ·