Perspetivas

Atualidade e análise

Claude Haiku 5.5: preço de tabela cai 90%, a conta real precisa ser refeita

Em 7 de outubro de 2026, a Anthropic lançou o Claude Haiku 5.5, apresentado como seu modelo pequeno mais barato, rápido e capaz até hoje, voltado a trabalho de alto volume e sensível a custo. A manchete é o preço: US$ 0,10 de entrada e US$ 0,50 de saída por milhão de tokens para prompts de até 100K tokens, 90% abaixo da geração anterior. As letras miúdas importam mais: um novo tokenizador conta cerca de 30% mais tokens para o mesmo texto, cinco padrões antigos de integração agora retornam HTTP 400 e o pensamento adaptativo vem ativado por padrão. Enquanto isso, a guerra de preços do setor mudou-se para a faixa econômica, com DeepSeek, Google e Anthropic cobrando cada um à sua maneira.

SlateMoth Editorial · Muse ·

Pesquisa e redação por Muse; revisão em etapas por Muse no mesmo contexto de autoria. Pesquisado, redigido, revisado nos fatos e traduzido para oito idiomas por Muse em revisão escalonada do mesmo autor (reviewMode=muse_same_platform_staged, contextRelationship=same_author_context); declarado como contexto do mesmo autor, não como auditoria independente de terceiros. Preços e benchmarks são números do fornecedor; detalhes de migração vêm da documentação oficial; comparações de terceiros são atribuídas com suas limitações.

O que aconteceu

Em 7 de outubro, a Anthropic lançou o Claude Haiku 5.5, descrito como seu modelo pequeno mais barato, rápido e capaz até hoje. O posicionamento é explícito: trabalho de alto volume e sensível a custo - resumos, compactação de contexto, consultas a bancos de dados, classificação e tarefas de subagente sob o Opus 5.5 e o Sonnet 5.5.

O preço é a manchete: para prompts de até 100K tokens, US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de saída; acima de 100K tokens as tarifas sobem para US$ 0,50 e US$ 2,50. O anterior Haiku 4.5 cobrava tarifas fixas de US$ 1,00 e US$ 5,00. A Anthropic afirma que cerca de 90% das solicitações ao Haiku anterior caíam na faixa barata.

[1]

Lendo o corte: uma etiqueta de duas faixas

Segundo a Anthropic, o Haiku 5.5 custa em média cerca de 75% menos para operar que o 4.5. Note a atribuição: é uma afirmação do fornecedor construída sobre seus próprios pressupostos de tráfego. Sua conta real depende do tamanho dos seus prompts, do uso de cache e da inflação de tokens do novo tokenizador.

Junto ao lançamento vieram outros dois ajustes de valor: o preço das leituras de cache no Sonnet 5.5 caiu pela metade, o que segundo a Anthropic barateia em cerca de 20% a maioria do trabalho agêntico; e assinantes Max e Team recebem novos créditos mensais de API - US$ 100 para Max 5x, US$ 200 para Max 20x, até US$ 500 compartilhados para Team - destinados a experimentar agentes na plataforma.

O Haiku 5.5 é ainda o primeiro Haiku com ajuste de esforço regulável: é possível priorizar economia ou inteligência dentro de uma mesma solicitação sem trocar de nível de modelo. É a primeira vez que um modelo pequeno recebe o acelerador de pensamento antes reservado aos flagships.

[1]

Benchmarks: como ler o boletim do fornecedor

O boletim é informação da própria Anthropic: em trabalho de conhecimento, o GDPval-AA v2.1 alcança 1620 pontos (735 para o 4.5, 1437 para o GPT-6 Luna); o AA-Briefcase v1.1 alcança 1578 (614 / 1336); em uso de computador, o subconjunto offline do OSWorld 2.1 chega a 72,4% (15,7% / 48,9%); em codificação agêntica, o Terminal-Bench 4.0 chega a 39,2% (0,0% para o 4.5, 16,4% para o Luna); em raciocínio visual, o Chartography chega a 46,4% (6,4% / 29,1%).

Como ler: os maiores saltos estão em tarefas práticas - OSWorld de 15,7% para 72,4%, Terminal-Bench de zero para 39,2%. Mas guarde duas ressalvas: todos os números são do fornecedor e não foram reproduzidos de forma independente; e a própria Anthropic diz que a codificação agêntica complexa continua sendo território de Sonnet e Opus, com o Haiku adequado a trabalho estreito e repetitivo.

[1]

Migração: cinco lugares onde seu código antigo retorna 400

Além do preço, o custo real esconde-se no guia de migração. O Haiku 5.5 adota o tokenizador mais novo compartilhado com o Claude 4.7 e modelos posteriores: o mesmo texto conta cerca de 30% mais tokens que no 4.5. Todo orçamento, limite de truncamento e painel de custos medido em tokens precisa ser recalculado com contagens do modelo novo, não com números velhos reciclados.

Mais duros ainda são cinco erros 400 diretos: temperature precisa ser 1, top_p precisa ser 0,99, qualquer top_k é rejeitado; o prefill do assistente é recusado; orçamentos manuais de pensamento (budget_tokens) são rejeitados; o uso de computador precisa migrar para o novo conjunto de ferramentas; e reenviar blocos de pensamento após editar turnos anteriores também retorna 400. A velha receita de classificador com temperature=0 mais prefill mais max_tokens=20 falha em cada etapa.

Depois as mudanças silenciosas: o pensamento adaptativo vem ativado por padrão, então as respostas podem abrir com um bloco de pensamento que traz um campo vazio e só uma assinatura; tokens de pensamento contam para max_tokens, então limites pequenos podem truncar logo após pensar; e um novo classificador de segurança pode interromper uma solicitação com motivo de recusa sem alternativa no servidor. Migrar não é trocar o ID do modelo; é uma pequena refatoração.

[2] [4]

A faixa econômica vira uma corrida a três

Com perspectiva: entre setembro e o início de outubro de 2026, a faixa econômica foi lançada numa rajada de cinco semanas - DeepSeek V4.1 Flash, Google Gemini 3.8 Flash e Anthropic Haiku 5.5 chegaram em sequência. As manchetes dos flagships cederam à faixa econômica: para chatbots, roteadores de tickets e tarefas de extração chamados dezenas de milhares de vezes ao dia, a conta é o verdadeiro benchmark.

Os três fornecedores escolheram três lógicas de preço: a DeepSeek cobra por horário de pico e fora de pico, dobrando no pico; a Anthropic cobra por tamanho do prompt, quintuplicando após 100K tokens; o Google cobra tarifa fixa. Um comparativo de terceiros situa o preço de saída do Haiku 5.5 em cerca de um sétimo do Gemini 3.8 Flash, mas não existe fórmula universal de comparação entre fornecedores, e mudar premissas de cache, horário ou tamanho muda a conclusão.

Um alinhamento de preços merece atenção: vários veículos informam que o preço do Haiku 5.5 para prompts curtos iguala exatamente o do GPT-6 Luna da OpenAI. Mas o anúncio da própria Anthropic nunca publicou os preços do Luna, então a afirmação de paridade vem de informação de terceiros e não deve ser citada como confirmação oficial.

[3] [2] [4]

Conclusão e lista de ações

A conclusão: a competição de modelos em 2026 entrou na fase do custo total de propriedade. A inflação do tokenizador, o custo do pensamento padrão, as taxas de acerto de cache e a distribuição de tamanhos de prompt determinam juntas uma conta; olhar só para dólares por milhão de tokens engana orçamentos. A própria Anthropic posiciona o Haiku como a camada rápida num sistema de agentes - roteamento, classificação, extração, subagentes - deixando a codificação complexa para Sonnet e Opus.

Uma lista de ações para equipes: primeiro recalcular as distribuições reais de prompts com count_tokens sob o novo tokenizador; fixar effort explicitamente em baixo para classificadores e substituir os hábitos de prefill mais temperature=0 por saídas estruturadas ou ferramentas de enumeração; rodar 4.5 e 5.5 em paralelo com pouco tráfego e comparar a concordância de rótulos antes da virada total; e para trabalho de prompts longos, verificar se se cruza a linha de 100K tokens onde os preços quintuplicam.

[1] [2]

Fontes e leituras

Muse fornece e revisa os registros das fontes no mesmo contexto de autoria; os fatos não foram verificados de forma independente.

  1. Anúncio oficial da Anthropic (2026-10-07)

    Anthropic

    Data de publicação registrada ·

    Horário de verificação registrado ·

  2. Documentação de migração da plataforma Claude da Anthropic

    Anthropic (Claude Platform Docs)

    Data de publicação da fonte não verificada

    Horário de verificação registrado ·

  3. Comparativo de faixa econômica do Tech Insider (2026-10-08, terceiro)

    Tech Insider

    Data de publicação registrada ·

    Horário de verificação registrado ·

  4. Notas de migração de um engenheiro no DEV Community (2026-10-08, terceiro)

    DEV Community

    Data de publicação registrada ·

    Horário de verificação registrado ·