Elton José logo
Elton José
Claude Opus 5.5

Claude Opus 5.5: O Que Realmente Mudou Em Relação Ao Opus 5

Claude Opus 5.5: O Que Realmente Mudou Em Relação Ao Opus 5
0 visualizações
17 minutos de leitura
#Claude Opus 5.5

Claude Opus 5.5: O Que Realmente Mudou Em Relação Ao Opus 5

Na terça passada, um colega que cuida de uma integração com a API da Anthropic mandou uma pergunta curta no canal do time: "troco a string do modelo para claude-opus-5-5 hoje ou espero?". Por baixo dela há outras três. Quanto muda na fatura? O ganho anunciado aparece no tipo de tarefa que a gente roda? E o que pode quebrar?

Não respondi na hora, porque não tinha resposta honesta. O que eu tinha era o que todo mundo tinha naquele dia: a página de lançamento, números em destaque e depoimentos de clientes, tudo escrito por quem vende o produto. Então fiz o exercício de sempre: ler a página oficial inteira, cruzar com a imprensa e separar preço de tabela, número de fornecedor e mudança de comportamento que pode afetar código em produção.

Vale deixar claro desde já: eu não rodei o Opus 5.5 em nenhum benchmark nem migrei nenhum sistema para ele. Este post é leitura e análise. Todos os benchmarks e depoimentos citados aqui são publicados pela própria Anthropic, e eu vou sinalizar isso sempre que aparecerem.

O roteiro: o que chegou e onde roda; o preço e a conta real, mais interessante que o "20% mais barato" da manchete; os benchmarks e o que medem; a eficiência de tokens que os clientes descrevem; as mudanças de segurança, a parte com mais potencial de surpreender quem constrói em cima da API; e quando migrar ou esperar o Sonnet 5.5 e o Haiku 5.5.


O Que Chegou Em 22 De Setembro E Onde Ele Roda

O Claude Opus 5.5 foi lançado em 22 de setembro de 2026, primeiro modelo da família 5.5. A Anthropic o descreve como um "major step up" em relação ao Opus 5 e diz que ele se equipara ao Claude Fable 5.1 na maior parte do trabalho, superando-o em coding agêntico, trabalho de conhecimento e computer use. Há dois meses, o argumento do Opus 5 era chegar "perto" do topo de linha pela metade do preço, como comentei quando o Opus 5 passou a ser o modelo padrão do Claude Max. O discurso mudou de patamar.

Na API, o identificador é claude-opus-5-5, disponível na Claude Platform, na AWS, no Google Cloud Vertex AI e no Microsoft Azure desde o lançamento. Nos apps, a MacRumors reporta disponibilidade nos planos Pro, Max, Team e Enterprise por assento, com limites maiores na janela de cinco horas. O fast mode, até 2,5 vezes mais rápido, está no Claude Code e na Claude Platform.

Em junho, a Anthropic lançou o Fable 5 e o Mythos 5 num episódio que terminou com bloqueio por controle de exportação. Em setembro, o Fable 5.1 e o Mythos 5.1 chegaram com a estrutura de salvaguardas estabilizada, e o Fable 5.1 marcava 55,8% no Terminal-Bench 4.0. Três semanas depois, um Opus aparece com 66,4% no mesmo benchmark, segundo a Anthropic. A hierarquia de nomes continua, mas a de capacidade ficou menos óbvia.

Há ainda um contexto que não dá para omitir. O Yahoo Finance registrou que o Opus 5.5 é o primeiro modelo da Anthropic desde que o CEO Dario Amodei publicou um ensaio pedindo desaceleração no desenvolvimento de IA de fronteira, no início de setembro. A reportagem aponta a aparente tensão, mas não traz fala da empresa sobre ela. O que a Anthropic diz é que a família 5.5 passou por testes extensivos de alinhamento, avaliações externas e salvaguardas para cibersegurança e biologia. Não vou especular além disso; o que dá para afirmar é que as salvaguardas deste lançamento são mais restritivas que as do Opus 5, com efeito prático que mostro adiante.


Preço: A Tabela E A Conta Que Importa

A manchete que circulou foi "20% mais barato", e ela é verdadeira para input e output. Mas a linha que mais importa para quem roda agente em produção é outra. Aqui está a tabela completa, com os preços por milhão de tokens publicados pela Anthropic:

Item (por 1M tokens)Opus 5Opus 5.5Variação
InputUS$ 5,00US$ 4,00-20%
OutputUS$ 25,00US$ 20,00-20%
Cache writeUS$ 6,25US$ 5,00-20%
Cache readUS$ 0,50US$ 0,20-60%
Fast mode (input / output)—US$ 8,00 / US$ 40,00até 2,5x mais rápido

O cache read caiu 60%, três vezes mais que o resto da tabela. Numa sessão longa de coding agent, a maior parte dos tokens de cada chamada é contexto repetido: system prompt, instruções do projeto, arquivos já lidos, histórico. Com prompt caching bem configurado, esse volume é cobrado como cache read, que costuma ser uma ordem de grandeza maior que o input novo. É justamente o componente que ficou proporcionalmente mais barato.

Para dar forma a isso, um cenário hipotético: um agente de manutenção de código rodando o mês inteiro, consumindo 1 bilhão de tokens de cache read, 100 milhões de input sem cache, 50 milhões de cache write e 30 milhões de output. Números inventados, proporção plausível para sessões longas com cache agressivo.

Cenário hipotético (mesmo volume de tokens nos dois modelos)

                    Opus 5                     Opus 5.5
Cache read    1.000M x $0,50 = $500      1.000M x $0,20 = $200
Input           100M x $5,00 = $500        100M x $4,00 = $400
Cache write      50M x $6,25 = $312,50      50M x $5,00 = $250
Output           30M x $25,00 = $750        30M x $20,00 = $600
-------------------------------------------------------------
Total                         $2.062,50                   $1.450,00
Redução                                                   ~29,7%

Variação: output 25% menor no Opus 5.5 (22,5M x $20 = $450)
Total                                                     $1.300,00
Redução vs Opus 5                                         ~37%

Só pela troca de tabela, sem mudar o volume, a redução nesse perfil fica perto de 30%, e não 20%, porque o cache read pesa muito. Se o modelo também gastar menos output para o mesmo trabalho, a conta se aproxima dos "cerca de 40% mais barato em workloads típicos" que a Anthropic anuncia. Os 25% de output a menos vêm da faixa que a Factory reporta nos depoimentos publicados pela Anthropic (20 a 25% no esforço médio), mas são hipótese, não medição.

O ponto prático é que o "40%" da Anthropic mistura preço unitário, que é fato de tabela, e eficiência de tokens, que depende do seu workload. A primeira parte vem de graça ao trocar a string; a segunda só medindo. Uso dominado por chamadas curtas sem cache fica perto dos 20%; sessões longas com cache tendem a ganhar mais.

Já o fast mode custa o dobro do modo padrão do Opus 5.5. Faz sentido quando a latência trava uma pessoa, como pair programming no Claude Code; para jobs em background, raramente se justifica.


Benchmarks: O Que Os Números Da Anthropic Medem De Verdade

Todos os números abaixo são da página de lançamento da Anthropic. Não são resultados independentes nem auditados, e as configurações de esforço e de harness usadas não estão detalhadas nas fontes que li. Incluo a coluna do GPT-6 Astra porque a própria Anthropic compara com ele; onde ela não publicou o número, deixei em branco.

BenchmarkOpus 5.5Fable 5.1Opus 5GPT-6 Astra
Terminal-Bench 4.066,4%55,8%52,3%57,9%
FrontierCode v1.154,450,348,053,3
CursorBench 4.057,851,846,6—
GDPval-AA v2.1 (Elo)1846173517081542
OSWorld 2.081,880,774,0—
AutomationBench40,031,426,941,4
Humanity's Last Exam (com tools)67,765,663,657,2

O salto mais chamativo é o do Terminal-Bench 4.0: 14 pontos acima do Opus 5 e mais de 10 acima do Fable 5.1. Esse benchmark mede o que um coding agent enfrenta de fato: rodar comandos num terminal, interpretar a saída, corrigir e iterar. Se o número se sustentar fora da Anthropic, a consequência esperada é menos intervenção manual em sessões de agente. O CursorBench 4.0 vai na mesma direção, com mais de 11 pontos sobre o Opus 5.

Os outros números são mais nuançados. No OSWorld 2.0 o ganho sobre o Opus 5 é de quase 8 pontos, mas a vantagem sobre o Fable 5.1 é de pouco mais de um, algo que eu trataria como empate sem saber a variância. No FrontierCode, a diferença para o GPT-6 Astra também é de pouco mais de um ponto. E no AutomationBench o Opus 5.5 fica atrás do Astra, 40,0 contra 41,4. Gosto de ver isso numa tabela de fornecedor: pelo menos uma linha em que ele não lidera.

A leitura que eu faria é a que defendi ao olhar o leaderboard do SWE-bench Pro e o problema de contaminação e tarefas quebradas: benchmark de fornecedor serve para ordenar hipóteses, não para decidir sozinho. Catorze pontos num benchmark agêntico é grande demais para ser só ruído, então "melhor que o Opus 5 em tarefas de terminal" parece razoável. Já "melhor que o Fable 5.1 em computer use" tem margem pequena demais para ser tratado como fato antes de avaliações independentes.

Há também um ponto de método que a tabela esconde: a página cita níveis de esforço que vão de low a max, passando por medium, high e xhigh. Um score no esforço máximo diz pouco sobre custo e latência no esforço médio. Vale o mesmo cuidado para o GDPval-AA, que usa Elo: a distância para o Astra (1846 contra 1542) é a maior da tabela, mas Elo depende de quem está no pool e de quem julga.

Por último, os casos que a Anthropic destaca: uma migração de 680 mil linhas em menos de um dia, trabalho que levaria semanas para um time; a reescrita do HAProxy de C para Rust em 9,5 horas, contra 12 do Fable 5.1, a custo 51% menor; e sucesso em 39 de 40 tentativas de reduzir o tempo de carregamento das páginas de uma aplicação web. São anedotas selecionadas pelo fornecedor. Não sabemos quantas tentativas falharam antes nem quanta revisão humana veio depois.


Menos Tokens, Menos Turnos: O Que Os Depoimentos Descrevem

Se os benchmarks falam de capacidade, os depoimentos de clientes publicados pela Anthropic falam quase todos de outra coisa: eficiência. E isso me parece o dado mais relevante para quem já está em produção com o Opus 5, porque eficiência de tokens mexe diretamente na fatura e na latência, mesmo quando a qualidade final é a mesma.

O depoimento mais concreto é o da Optiver: nas tarefas de coding agêntico dela, o Opus 5.5 igualou a qualidade do Opus 5 em cerca de metade dos turnos, do tempo e dos tokens de output, cortando o custo daquele workload em 40 a 50%. Não é "ficou melhor", é "fez o mesmo gastando metade", exatamente o argumento que importa para quem já está satisfeito com o Opus 5.

A Box vai na mesma linha, com números mais agressivos: nas avaliações dela, o Opus 5.5 usou um terço dos tokens do Opus 5, com respostas 40% menos verbosas sem perda de precisão. Como é um caso de uso bem diferente de coding agent, sugere que a redução de verbosidade não se restringe a um tipo de tarefa.

O GitHub, pela voz de Mario Rodriguez, diz que o Opus 5.5 "used among the fewest tokens and steps we measured". A frase é cuidadosa: "entre os que menos usaram", não "o que menos usou". A Factory afirma que é o primeiro modelo que usaria como padrão no esforço médio, com 20 a 25% menos tokens de output.

Somando esses relatos à geração de output mais de 30% mais rápida anunciada, o desenho é coerente: um modelo que escreve menos e chega mais rápido ao fim da tarefa. A página também cita mudanças de comunicação, com a informação crítica primeiro, menos jargão e mais aderência a guias de estilo. Para quem tem pipeline que depende do formato da resposta, isso é também ponto de atenção: respostas mais curtas e reorganizadas podem quebrar parsers ou testes de snapshot calibrados no estilo do Opus 5.

Mesmo assim, depoimento em página de lançamento é curado por definição: ninguém aparece ali dizendo que o modelo piorou. A convergência de vários clientes no mesmo tema é um sinal mais forte que um número isolado, mas a pergunta que decide a migração continua sendo "e no meu workload?".


Segurança: Preserved Thinking, Thinking Obrigatório E O Desvio Para O Opus 4.8

Esta é a seção que eu mais recomendaria para quem constrói produto em cima da API, porque algumas mudanças aqui não são melhorias invisíveis. São restrições de comportamento que podem afetar código existente.

A primeira é o preserved thinking, salvaguarda anti-distilação introduzida com o Fable 5.1. Segundo a Anthropic, ela impede usuários da API de editar o contexto anterior do Claude na tentativa de extrair o raciocínio do modelo, e vale para Fable 5.1 e Opus 5.5 em contas de API criadas a partir de 31 de agosto de 2026. O objetivo é dificultar que alguém use as saídas para treinar um concorrente. O efeito colateral possível atinge quem manipula o histórico por motivos legítimos: imagine um time que reescreve turnos anteriores do assistente para compactar contexto. Se a conta foi criada depois de 31 de agosto, teste esse fluxo antes de trocar o modelo. As fontes não detalham quais operações são bloqueadas, então não afirmo o que quebra; é só o primeiro lugar onde eu olharia.

A segunda mudança: o Opus 5.5 não está mais disponível com o thinking desligado. Para quem usava o Opus 5 sem raciocínio estendido em chamadas rápidas, como classificação ou roteamento, isso muda a equação de latência e custo; o controle que sobra é o nível de esforço. Se você tem chamadas simples de alto volume no Opus sem thinking, é hora de perguntar se elas deveriam estar num Sonnet ou Haiku, cujas versões 5.5 ainda não saíram.

A terceira é cibersegurança. A Anthropic diz que o Opus 5.5 tem capacidades cibernéticas "extremely strong" e aplica salvaguardas parecidas com as do Fable 5.1: corrigir bugs no próprio código segue permitido, mas a maioria das tarefas de cibersegurança será redirecionada ao Opus 4.8, e o Cyber Verification Program deve incluir o Opus 5.5 em breve. Se o seu produto faz análise de vulnerabilidade ou triagem de alertas, o modelo que efetivamente responde pode não ser o que você pediu.

Em biologia, a Anthropic afirma que o Opus 5.5 iguala ou supera o Mythos 5.1, e por isso também há salvaguardas na área. Para pesquisa e desenvolvimento travados por essas proteções, a empresa apresenta o Life Sciences Verification Program, que dá a organizações verificadas, como laboratórios acadêmicos, startups e farmacêuticas, acesso a salvaguardas desenhadas para a amplitude completa do trabalho em biologia.

Do lado das métricas, também números da Anthropic: o modelo tenta contornar limites de contenção 85% menos vezes que o Opus 5, é mais resistente a prompt injection e foi avaliado pelo METR antes do lançamento. A página ainda cita watermarking para o EU AI Act, o que conversa com a marca d'água que a Anthropic passou a aplicar globalmente por causa do Artigo 50. O conjunto mostra uma direção: cada lançamento traz mais controle sobre o que o modelo faz e o que o cliente pode fazer com ele, e "trocar a string do modelo" fica cada vez menos trivial.


Quando Migrar E Quando Esperar O Sonnet 5.5 E O Haiku 5.5

Voltando à pergunta do meu colega. O caso mais claro para migrar logo é o de quem roda o Opus 5 em sessões agênticas longas, com cache bem configurado e thinking já ligado. Esse perfil pega os 60% de desconto no cache read, os 20% em input e output e, potencialmente, a economia de turnos que os clientes descrevem. É também onde o ganho do Terminal-Bench tem mais chance de aparecer. O risco de quebra é baixo, desde que o fluxo não manipule o histórico da conversa.

O caso mais claro para esperar é o de quem usa o Opus 5 com thinking desligado em tarefas simples e de alto volume, em que o Opus 5.5 pode até sair mais caro por chamada. A Anthropic diz que o Sonnet 5.5 e o Haiku 5.5 chegam nas próximas semanas, com melhorias semelhantes; vale usar a espera para revisar se a tarefa precisa mesmo de um Opus.

No meio-termo, que exige teste antes de decidir, ficam integrações de segurança, que podem ser desviadas para o Opus 4.8; pipelines que editam o histórico em contas criadas depois de 31 de agosto; e sistemas que dependem do formato exato da resposta. Para esses, o sensato é rodar os dois modelos em paralelo por alguns dias.

Num cenário hipotético, um time com agente de manutenção de código poderia separar umas vinte tarefas reais já resolvidas, rodar cada uma nos dois modelos com o mesmo esforço e registrar tokens, cache read, turnos, tempo e se o resultado passou nos testes. Vinte tarefas não dão significância estatística, mas dão uma ordem de grandeza mais confiável que qualquer tabela de fornecedor, e ainda revelam cedo se alguma restrição nova afeta o fluxo. Como o Opus 5.5 saiu no mesmo dia em que a OpenAI anunciou modelos mais baratos, e o preço cai a cada poucas semanas, esse teste tem prazo de validade: vai precisar ser refeito quando o Sonnet 5.5 sair.


Conclusão

O que mudou do Opus 5 para o Opus 5.5 cabe em três frases. O preço caiu 20% em input e output e 60% em cache read, o que torna o ganho real maior que a manchete para quem roda sessões longas com cache. Os benchmarks da Anthropic, sobretudo Terminal-Bench 4.0 e CursorBench 4.0, sugerem um salto real em coding agêntico, e os depoimentos convergem em menos tokens e menos turnos. E as salvaguardas ficaram mais restritivas: thinking obrigatório, preserved thinking para contas novas e desvio de cibersegurança para o Opus 4.8.

A resposta ao meu colega, então, não é "troca" nem "espera", mas "depende de qual das três mudanças pesa mais no seu caso". Agente longo com cache: a migração tende a se pagar sozinha. Chamada curta sem thinking: provavelmente o modelo certo nem é o Opus. Fluxo que mexe em histórico de conversa ou em segurança: teste antes de confiar.

O que eu ainda não sei, e acho que ninguém sabe fora da Anthropic, é quanto dos ganhos anunciados sobrevive a avaliações independentes e como as restrições vão se acumular nos próximos lançamentos. A pergunta "qual modelo é melhor" parece estar perdendo espaço para "qual modelo, com quais restrições, no meu workload", e o Opus 5.5 deixa isso mais evidente que qualquer lançamento anterior da família.

Fontes:

Newsletter

Receba os artigos mais relevantes da semana, sem quebrar seu ritmo de leitura

Um resumo semanal com os melhores posts sobre IA, engenharia de software e tecnologia, enviado no melhor momento para continuar a conversa depois da leitura.

Foto de Elton José

Escrito por

eltonjose

Engenheiro de software e estrategista de produtos digitais, focado em IA pragmática e em transformar experiências de trabalho remoto em aprendizados aplicáveis. Compartilho frameworks e decisões reais que uso em consultorias e projetos.

  • Principais temasClaude Opus 5.5, Anthropic
  • Formato do conteúdoGuia prático + insights de carreira