VOLTAR AO BLOG

Anthropic apresenta Claude Opus 5.5 com promessa de desempenho de ponta e custo 40% menor

COMPARTILHE
XFACEBOOKWHATSAPPLINKEDIN

A Anthropic anunciou em 22 de setembro de 2026 o Claude Opus 5.5, primeiro modelo da nova família Claude 5.5. A principal promessa é combinar desempenho próximo ao do Claude Fable 5.1 em grande parte das tarefas com um custo de operação 40% menor que o Claude Opus 5.

A redução pretende atingir especialmente empresas que usam inteligência artificial em tarefas longas, como programação assistida, automação de processos e agentes capazes de executar várias etapas. Para usuários individuais, o impacto potencial está em mais capacidade dentro dos limites de assinatura. Mas os números divulgados são, neste momento, principalmente resultados apresentados pela própria Anthropic e não substituem testes com cargas de trabalho reais.

O que mudou no modelo

Segundo a empresa, o Opus 5.5 foi projetado para lidar melhor com trabalhos complexos e extensos. Entre os exemplos divulgados está uma migração de código com 680 mil linhas concluída em menos de um dia por um testador externo. Em outro caso, o modelo teria auditado e corrigido uma base de 200 mil linhas em menos de três horas, enquanto o Opus 5 levou mais de 20 horas e utilizou 2,5 vezes mais tokens.

A Anthropic também afirma que o novo modelo encontrou maneiras de reduzir o tempo de carregamento de páginas de uma aplicação web em 39 de 40 tentativas. A comparação, porém, não é apenas sobre velocidade: a empresa diz que o Opus 5 fez melhorias menores e chegou a alterar o comportamento da aplicação. Isso ilustra um ponto importante para negócios: uma automação tecnicamente bem-sucedida ainda precisa ser avaliada quanto a efeitos colaterais e aderência aos requisitos do produto.

Em uma avaliação interna de tradução de software, o Opus 5.5 teria convertido o HAProxy, ferramenta escrita em C, para Rust em 9,5 horas, contra 12 horas do Fable 5.1, com custo 51% menor. A empresa também destaca avanços em uso de computador, trabalho de conhecimento e pesquisa científica feita por agentes.

Preço e velocidade

Na API, a tabela divulgada pela Anthropic estabelece preço de US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de tokens de saída. No Opus 5, esses valores eram de US$ 5 e US$ 25, respectivamente. A leitura de tokens armazenados em cache passa de US$ 0,50 para US$ 0,20 por milhão, enquanto a gravação cai de US$ 6,25 para US$ 5.

A empresa afirma que a combinação de preço menor e menor consumo de tokens resulta em uma queda de 40% no custo de cargas típicas. O ganho não deve ser interpretado como desconto uniforme em qualquer aplicação: o valor final depende do tamanho dos prompts, da quantidade de respostas, do uso de cache, do nível de esforço de raciocínio e do número de tentativas necessárias para concluir uma tarefa.

Também há um modo rápido no Claude Code e na plataforma da Anthropic, com velocidade de até 2,5 vezes maior. Ele custa US$ 8 por milhão de tokens de entrada e US$ 40 por milhão de tokens de saída. Para assinantes dos planos Pro, Max, Team e Enterprise por assento, a Anthropic diz que aumentará limites de uso em janelas de cinco horas e permitirá guardar uma redefinição de limite para uso posterior.

Desempenho não é apenas uma tabela

Nos testes publicados, o Opus 5.5 supera o Opus 5 e o Fable 5.1 em avaliações como Terminal-Bench, FrontierCode, CursorBench, GDPval-AA, OSWorld e reconhecimento de gráficos. Em alguns casos, a diferença é pequena. No AutomationBench, por exemplo, o modelo aparece com 40% contra 31,4% do Fable 5.1, enquanto o GPT-6 Astra registra 41,4%.

A própria Anthropic faz uma ressalva: em níveis elevados de capacidade, as margens dos benchmarks se tornaram um indicador menos confiável das diferenças no mundo real. Além disso, as avaliações não foram todas conduzidas em condições idênticas. Os resultados do Opus 5.5 usam raciocínio adaptativo no esforço máximo, e o Terminal-Bench foi medido no nível “xhigh”, enquanto o modelo concorrente aparece em uma configuração informada pelo próprio fornecedor.

Há outra limitação relevante. O Opus 5.5 foi avaliado com as salvaguardas de produção ativadas. Quando elas intervieram, tarefas de cibersegurança foram concluídas pelo Opus 4.8, e tarefas de biologia e desenvolvimento de modelos de fronteira pelo Opus 5. Isso pode reduzir os resultados do novo modelo em algumas avaliações, mas também significa que a comparação representa o produto com controles operacionais, não uma versão irrestrita.

Segurança e próximos passos

A Anthropic afirma que o Opus 5.5 teve o melhor resultado até agora em sua auditoria comportamental automatizada, baseada em milhares de cenários simulados. A empresa diz que o modelo é menos propenso a tomar ações difíceis de reverter, operar fora dos limites definidos e cair em ataques de injeção de prompt.

Essas declarações devem ser lidas como resultados de avaliação, não como garantia de segurança. Sistemas que executam código, acessam ferramentas ou modificam arquivos continuam exigindo permissões restritas, revisão humana e monitoramento. A própria empresa reconhece limites e informa que ampliou os testes para tarefas longas, tarefas impossíveis e situações inspiradas em incidentes reais.

Por apresentar desempenho comparável ao do Fable 5.1 em biologia e cibersegurança, o Opus 5.5 será submetido a salvaguardas semelhantes. Organizações avaliadas podem solicitar acesso ao programa de verificação para ciências da vida; a Anthropic também prevê ampliar um programa específico para profissionais de cibersegurança.

A empresa promete lançar Sonnet 5.5 e Haiku 5.5 nas semanas seguintes, com parte dos mesmos ganhos de desempenho, eficiência e segurança. Para empresas, o próximo passo mais prudente é comparar custo, qualidade e taxa de falhas no próprio ambiente antes de substituir modelos existentes. Para usuários, a novidade importa menos pelo nome da versão do que pela possibilidade de executar tarefas mais longas com menor custo — desde que os resultados continuem sendo conferidos.

Fontes