O que mudou de verdade
Até pouco tempo, escolher um modelo era escolher inteligência. Hoje são dois eixos independentes — e o segundo é o que quase ninguém usa direito.
Os dois eixos
- Qual modelo — o tamanho e o treinamento. É o que você comprou de fábrica: Haiku, Sonnet, Opus, Fable / Luna, Terra, Sol.
- Quanto esforço — quanta computação o modelo gasta naquela resposta específica. É o pé no acelerador.
Um carro potente dirigido devagar e um carro modesto no talo podem chegar juntos. E custam muito diferente.
Isso tem uma consequência prática que muda orçamentos: um modelo menor em esforço alto pode ser melhor e mais barato que um modelo maior em esforço médio. Antes você só podia subir de modelo. Agora existe uma matriz — e o ponto ótimo raramente está no canto mais caro dela.
O erro mais comum de 2026
Deixar tudo no máximo. Além de caro e lento, piora resultado em tarefas simples: o modelo "pensa demais" um problema que não tinha o que pensar. Nos testes de código publicados sobre o Opus 5, o esforço médio entregou nota quase de topo com cerca de metade da computação dos níveis superiores.
Quem é quem em 2026
O panorama de julho de 2026. Nomes e preços mudam rápido — a lógica de família, não.
Anthropic — a família Claude
| Modelo | Lançamento | US$ /MTok | Para quê |
|---|---|---|---|
| Fable 5 e Mythos 5 | 9 jun 2026 | 10 / 50 | Mesmo modelo por baixo; o Fable carrega salvaguardas extras em biologia, cibersegurança e P&D de modelos. O Mythos 5 fica restrito a organizações do programa Glasswing. |
| Opus 5 | 24 jul 2026 | 5 / 25 | Salto grande em raciocínio profundo e trabalho agêntico longo. Contexto de 1M, saída até 128k, pensamento ligado por padrão. É o padrão do Max e o mais forte disponível no Pro. |
| Sonnet 5 | 30 jun 2026 | 2 / 10 intro | Traz capacidade de classe Opus para a faixa Sonnet. Contexto de 1M, pensamento adaptativo por padrão. Preço promocional até 31/08/2026, depois 3 / 15. |
| Haiku 4.5 | 2025 | 1 / 5 | Volume alto, classificação, resposta curta. Não expõe o parâmetro effort. |
Nota histórica útil: o acesso a Fable 5 e Mythos 5 foi suspenso em 12 de junho de 2026 para cumprir controles de exportação do Departamento de Comércio dos EUA, e restaurado em 1º de julho quando os controles foram retirados.
OpenAI — a família GPT
| Modelo | Lançamento | US$ /MTok | Para quê |
|---|---|---|---|
| GPT-5.6 Sol | 9 jul 2026 | 5 / 30 | Topo da linha. Contexto de 1M. |
| GPT-5.6 Terra | 9 jul 2026 | 2,50 / 15 | A faixa de trabalho diário. |
| GPT-5.6 Luna | 9 jul 2026 | 1 / 6 | Volume alto e baixo custo. |
| GPT-5.5 legado | 23 abr 2026 | 5 / 30 | Ainda é o motor prático por trás do ChatGPT Plus. |
| GPT-5.4 nano | — | 0,20 / 1,25 | O mais barato da casa. |
O GPT-5.6 acrescenta um segundo dial independente: reasoning.mode, com standard (padrão) e pro. O modo pro faz o modelo trabalhar mais internamente e devolver uma única resposta final — vale quando confiabilidade importa mais que latência.
Effort, explicado
Não é "modo turbo" e não é "quantidade de texto". É quanto trabalho o modelo se permite fazer para produzir a resposta inteira.
O que o parâmetro realmente controla
Na Anthropic é output_config.effort. Ele afeta todos os tokens da resposta:
- o texto e as explicações;
- as chamadas de ferramenta — em esforço baixo o modelo agrupa operações e chama menos ferramentas; em alto, chama mais e explica o plano antes;
- o pensamento, quando ativo.
Duas consequências: funciona mesmo sem pensamento ligado, e dá controle sobre gasto agêntico, que é onde o dinheiro vai embora de verdade.
Sinal, não teto
A documentação é explícita: effort é um sinal de comportamento, não um orçamento rígido de tokens. Em nível baixo o Claude ainda pensa se o problema for difícil — só pensa menos do que pensaria em nível alto para o mesmo problema. Do lado da OpenAI, o GPT-5.6 trata o effort como teto, não piso: num prompt que ele julga fácil pode não gerar nenhum token de raciocínio, mesmo em nível alto.
A escada, lado a lado
| Nível | Claude output_config.effort | GPT reasoning.effort | Quando usar |
|---|---|---|---|
| none | — | ✓ | Latência mínima, sem raciocínio nenhum |
| low | ✓ | ✓ | Classificação, consulta rápida, subagentes, volume alto |
| medium | ✓ | ✓ padrão GPT-5.6 | Equilíbrio de velocidade, custo e desempenho |
| high | ✓ padrão Claude | ✓ | Raciocínio complexo, análise delicada, código difícil |
| xhigh | ✓ | ✓ | Trabalho agêntico longo (30 min+), orçamentos de milhões de tokens |
| max | ✓ | ✓ | Sem restrição de gasto; o problema justifica |
No Claude, high produz exatamente o mesmo comportamento que omitir o parâmetro. O xhigh é mais novo: alguns modelos que aceitam max não aceitam xhigh. Suportam effort: Fable 5, Mythos 5, Opus 5, Opus 4.8, Opus 4.7, Opus 4.6, Sonnet 5, Sonnet 4.6 e Opus 4.5 — Haiku não entra na lista.
Como isso é cobrado
Aqui está o ponto que pega quem não leu a letra miúda: tokens de raciocínio são cobrados como tokens de saída. Não existe sobretaxa de "modo pensante" — esforço alto simplesmente gera mais tokens, e saída é a parte cara da conta (5 a 6× a entrada). Você paga por um pensamento que nem chega a ler.
Thinking ≠ effort
São dois controles diferentes que todo mundo confunde. Vale trinta segundos separar os dois.
thinking
Se o modelo pensa em blocos antes de responder. No modo adaptive, o próprio modelo decide quando e quanto. É liga/desliga com um modo automático.
effort
Quanto trabalho o modelo coloca na resposta inteira — o que, no modo adaptativo, inclui com que frequência e profundidade ele pensa. É o acelerador.
Onde as duas coisas se cruzam: em esforço alto o Claude pensa em quase toda requisição e por mais tempo; em esforço baixo ele pode pular o pensamento em problemas simples. Onde há pensamento adaptativo, effort é o controle recomendado para profundidade.
Mudanças que quebram código antigo
- Opus 5 — pensamento vem ligado por padrão. Desabilitar pensamento com effort
xhighoumaxretorna erro400, verificado a cada requisição. Ou você limita o effort emhigh, ou remove o campo de thinking. - Sonnet 5 — pensamento adaptativo por padrão; o pensamento manual com
budget_tokensfoi removido e agora retorna400. Definirtemperature,top_poutop_kfora do padrão também dá400. - max_tokens vale para tudo — é um limite duro sobre pensamento mais texto visível. Em
xhighoumax, comece em 64k e ajuste, ou o modelo fica sem espaço no meio do trabalho. - Não passe
adaptivecomo valor de effort. É um modo de pensamento, não um nível de esforço.
Effort não encurta a resposta
No Opus 5, baixar o esforço reduz o volume de pensamento mas não encurta de forma confiável o texto que você lê. Se quer resposta curta, peça resposta curta no prompt. São problemas diferentes com soluções diferentes.
A escada interativa
Escolha um modelo, suba e desça a escada, veja o que acontece com custo e tempo. Os multiplicadores são ilustrativos — só a relação "high ≈ 2× medium" é documentada; o resto é ordem de grandeza para você raciocinar.
Simulador de esforço
Custo calculado sobre 1.000 requisições com o contexto e a saída-base que você definir.
Efeito no bolso e no relógio
Três números que valem mais que qualquer benchmark de marketing.
| Observação | O que fazer com isso |
|---|---|
| Uma requisição em high consome cerca de o dobro dos tokens de uma em medium | Antes de subir um nível, pergunte se o ganho de qualidade paga 100% a mais de token |
| Trocar high → medium num fluxo de 200 a 500 consultas diárias pode cortar ~50% do consumo | É a economia mais fácil de conseguir num time que já usa IA todo dia |
| No Opus 5, max pode render menos que medium em tarefas simples ou estruturadas | "Pensar demais" é um modo de falha real, não figura de linguagem |
A hierarquia de otimização
Na ordem, do que mais resolve para o que menos resolve:
- Instrução mais clara — um prompt vago em
xhighcontinua vago, só mais lento e mais caro. - Exemplos — um trecho do resultado que você considera bom vale mais que três parágrafos de instrução.
- Decomposição — quebrar a tarefa em etapas simples.
- Verificação em passo separado — pedir a revisão numa segunda chamada.
- Só então: subir o effort.
Dez regras práticas
Extraídas da documentação oficial dos dois fornecedores e das notas de migração.
- Defina o effort de propósito. O padrão existe, mas o ponto de partida certo depende do seu modelo e da sua carga.
- Comece no padrão e desça. No Opus 5, a recomendação é começar em
highe usarlowemediumliberalmente como controle primário de custo, sempre que suas avaliações mostrarem que a qualidade se mantém. - Não reaproveite configuração de modelo antigo. A Anthropic pede explicitamente: rode uma nova varredura de effort nas suas avaliações. Os níveis foram recalibrados —
lowemediumno Opus 5 são muito mais fortes que nas gerações anteriores. - Migrando de GPT-5.5 para 5.6? Mantenha o effort atual como linha de base e teste um nível abaixo. Modelo novo costuma entregar o mesmo com menos.
- Suba para xhigh só em trabalho agêntico longo — busca repetida, muitas chamadas de ferramenta, exploração. É para isso que o nível existe.
- Em xhigh ou max, aumente o max_tokens. Comece em 64k. Sem espaço, o modelo trava no meio.
- Mantenha o effort constante dentro de uma conversa com cache. Trocar o nível muda o prompt renderizado e invalida o cache — varie entre cargas de trabalho, não dentro de uma sessão longa.
- Apague suas instruções de verificação no Opus 5. Pedidos de "faça uma verificação final" agora causam verificação em excesso: o modelo já confere o próprio trabalho.
- Cuidado com instrução restritiva em revisão. Se o prompt diz "reporte só o que for grave", o Opus 5 obedece literalmente e reporta menos. Peça tudo e filtre num segundo passo.
- Se a resposta veio rasa, suba o effort em vez de contornar com prompt. E se precisar manter o effort baixo por latência, adicione uma instrução curta e dirigida: "esta tarefa envolve raciocínio em várias etapas; pense com cuidado antes de responder".
Para quem só usa o app
Você não vai digitar output_config em lugar nenhum. Mas o dial está lá, com outro nome.
| No app | É a versão consumidor de… | Como usar bem |
|---|---|---|
| ChatGPT: Instant / Thinking / Pro | Os níveis de reasoning.effort e o reasoning.mode | Instant para volume, Thinking para o que exige julgamento. Em planos elegíveis, um pedido difícil no Instant pode ser promovido automaticamente |
| Claude: seletor de modelo | A escolha do modelo; o effort é gerenciado pelo app | Modelo maior para julgamento e documento longo; menor para tarefa mecânica e conversa rápida |
| Claude Code e Cowork | Níveis mais altos de effort, com muitas chamadas de ferramenta | É exatamente por isso que queimam cota rápido — não é bug, é o acelerador no fundo |
A tradução prática, sem jargão
- Pergunta de fato, formatação, resumo curto → modo rápido. Subir o esforço não melhora nada.
- Análise, decisão, texto que vai para fora, código, contrato → modo pensante. Aqui o esforço vira qualidade de verdade.
- Se a resposta veio rasa, o primeiro reflexo não é trocar de modelo: é dar mais contexto e um exemplo. Na maioria das vezes resolve, e sai de graça.
Tabela de decisão
Ponto de partida por tipo de tarefa. Ajuste depois de medir — nunca antes.
| Tarefa | Modelo | Effort | Por quê |
|---|---|---|---|
| Classificar, etiquetar, extrair campo fixo | Haiku 4.5 / Luna | low ou none | Não há o que raciocinar; velocidade e preço mandam |
| Resumir e-mail, reescrever texto | Sonnet 5 / Terra | low–medium | Qualidade se mantém e o custo cai bastante |
| Redigir documento que vai para um cliente | Sonnet 5 / Terra | medium–high | Julgamento de tom e estrutura compensa o gasto |
| Análise densa, contrato, decisão de negócio | Opus 5 / Sol | high | É o padrão por um motivo: aqui a profundidade vira acerto |
| Agente longo, muitas ferramentas, 30 min+ | Opus 5 / Sol | xhigh | O nível foi desenhado para exploração prolongada |
| Problema de fronteira, sem restrição de custo | Fable 5 / Sol pro | max | Só quando o problema justifica — e depois de medir |
| Subagentes dentro de um fluxo maior | Sonnet 5 / Luna | low | Muitos deles rodam em paralelo; o custo multiplica |