内容提要
Anthropic发布Claude Haiku 5.5,跑分超越DeepSeek V4.1 Flash和GLM-5.3-Flash,对标GPT-6 Luna,价格大幅下调。首次支持effort调节,在OSWorld等测试中低档即超上代最高档。复杂编码仍不及Sonnet 5.5,定位执行层任务。迁移需注意五处接口变动。
延伸解读
价格优势有条件,实际节省可能缩水
Haiku 5.5的降价并非无条件:只有提示词在10万token以内的请求(占Haiku 4.5请求量的90%)才能享受输入输出价格直降90%,超过部分仅降50%。此外,新模型更换了tokenizer,同样任务会消耗更多token,导致实际节省金额低于标价折扣,尤其在代码、表格和非英语内容上膨胀可能更明显。因此,成本评估不能只看单价,需结合具体任务重新测算。
effort调节带来成本与性能的灵活权衡
Haiku 5.5首次支持effort调节,提供从low到max五档配置。在OSWorld 2.1测试中,Low档准确率42.0%、单次成本$0.07,Max档72.4%、$0.61;GDPval-AA v2.1也呈现类似曲线。这意味着用户可以根据任务复杂度选择档位,在精度和成本之间灵活取舍。例如,低档已超越上代最高档,适合对成本敏感且任务相对简单的场景。
复杂编码仍是短板,定位执行层任务
尽管Haiku 5.5在跑分上超越前代,但复杂编码能力仍远不及Sonnet 5.5。Terminal-Bench 4.0上Haiku 5.5仅39.2%,Sonnet 5.5达70.6%,在跨文件重构、长周期自主规划等方面差距明显。Anthropic官方建议复杂agent编码优先使用Sonnet 5.5或Opus 5.5。Haiku 5.5的价值在于执行层:任务已拆解、验收标准明确、可并行处理,如作为子智能体与Opus 5.5组合使用。
迁移需注意五处接口变动,避免请求报错
从Haiku 4.5迁移到5.5并非简单更换模型名。五处关键变动包括:budget_tokens手动思考配置报错,需改用自适应思考加effort参数;temperature、top_p、top_k锁定默认值,依赖采样参数的应用需调整逻辑;assistant消息预填充取消,强制JSON开头需改用工具调用或结构化输出;计算机操作工具版本更新,接口格式可能不同;自适应思考默认开启,响应首块可能是思考块,解析需按type字段过滤。建议对照迁移指南逐一检查。
Q&A
Claude Haiku 5.5 的跑分表现如何?
Claude Haiku 5.5 在跑分上超越了 DeepSeek V4.1 Flash 和 GLM-5.3-Flash,成为新的小模型守门员,并且逐项赢过 GPT-6 Luna。
Claude Haiku 5.5 的价格有什么变化?
价格大幅下调:提示词在 10 万 token 以内的请求,输入输出价格直接砍 90%;超过 10 万 token 的部分只砍 50%。相比上代 Haiku 4.5,价格是 5.5 的 10 倍。
Haiku 5.5 支持 effort 调节吗?具体有哪些档位?
支持,Haiku 5.5 是第一个支持 effort 调节的 Haiku 模型,继承了从 low 到 max 的五档配置。
Haiku 5.5 在 OSWorld 2.1 测试中的表现如何?
在 OSWorld 2.1 测试中,Low 档准确率 42.0%,单次成本 $0.07;Max 档准确率 72.4%,成本 $0.61。而 Haiku 4.5 只有 Max 档 15.7% 准确率,成本 $1.45。
Haiku 5.5 能替代 Sonnet 5.5 吗?
不能完全替代。在 Terminal-Bench 4.0 上 Haiku 5.5 拿 39.2%,Sonnet 5.5 拿 70.6%,复杂多步编码、跨文件重构、长周期自主规划方面差距明显。Anthropic 建议复杂 agent 编码优先用 Sonnet 5.5 或 Opus 5.5。
从 Haiku 4.5 迁移到 Haiku 5.5 需要注意哪些接口变动?
需要注意五处变动:1. budget_tokens 手动思考配置报错,必须改成自适应思考加 effort 参数;2. temperature、top_p、top_k 全部锁定默认值;3. assistant 消息预填充被取消,需换工具调用或结构化输出接口;4. 计算机操作工具版本从 computer_20250124 换成 computer_toolset_20260801;5. 自适应思考默认开启,响应第一个内容块可能是思考块,解析逻辑要按 type 字段过滤。