Guia companheiro · 29 de julho de 2026

O acelerador

Escolher o modelo virou só metade da decisão. A outra metade é o effort: quanto o modelo gasta pensando antes de responder. Este guia explica a nova geração de modelos e como usar esse dial sem queimar dinheiro nem inteligência.

Níveis Anthropic
5 low → max
Níveis OpenAI
6 none → max
Custo de high vs medium
≈ 2× tokens
Padrão Claude / GPT-5.6
high / medium
01

O que mudou de verdade

Até pouco tempo, escolher um modelo era escolher inteligência. Hoje são dois eixos independentes — e o segundo é o que quase ninguém usa direito.

Os dois eixos

  1. Qual modelo — o tamanho e o treinamento. É o que você comprou de fábrica: Haiku, Sonnet, Opus, Fable / Luna, Terra, Sol.
  2. Quanto esforço — quanta computação o modelo gasta naquela resposta específica. É o pé no acelerador.
Um carro potente dirigido devagar e um carro modesto no talo podem chegar juntos. E custam muito diferente.

Isso tem uma consequência prática que muda orçamentos: um modelo menor em esforço alto pode ser melhor e mais barato que um modelo maior em esforço médio. Antes você só podia subir de modelo. Agora existe uma matriz — e o ponto ótimo raramente está no canto mais caro dela.

O erro mais comum de 2026

Deixar tudo no máximo. Além de caro e lento, piora resultado em tarefas simples: o modelo "pensa demais" um problema que não tinha o que pensar. Nos testes de código publicados sobre o Opus 5, o esforço médio entregou nota quase de topo com cerca de metade da computação dos níveis superiores.

02

Quem é quem em 2026

O panorama de julho de 2026. Nomes e preços mudam rápido — a lógica de família, não.

Anthropic — a família Claude

ModeloLançamentoUS$ /MTokPara quê
Fable 5 e Mythos 59 jun 202610 / 50Mesmo modelo por baixo; o Fable carrega salvaguardas extras em biologia, cibersegurança e P&D de modelos. O Mythos 5 fica restrito a organizações do programa Glasswing.
Opus 524 jul 20265 / 25Salto grande em raciocínio profundo e trabalho agêntico longo. Contexto de 1M, saída até 128k, pensamento ligado por padrão. É o padrão do Max e o mais forte disponível no Pro.
Sonnet 530 jun 20262 / 10 introTraz capacidade de classe Opus para a faixa Sonnet. Contexto de 1M, pensamento adaptativo por padrão. Preço promocional até 31/08/2026, depois 3 / 15.
Haiku 4.520251 / 5Volume alto, classificação, resposta curta. Não expõe o parâmetro effort.

Nota histórica útil: o acesso a Fable 5 e Mythos 5 foi suspenso em 12 de junho de 2026 para cumprir controles de exportação do Departamento de Comércio dos EUA, e restaurado em 1º de julho quando os controles foram retirados.

OpenAI — a família GPT

ModeloLançamentoUS$ /MTokPara quê
GPT-5.6 Sol9 jul 20265 / 30Topo da linha. Contexto de 1M.
GPT-5.6 Terra9 jul 20262,50 / 15A faixa de trabalho diário.
GPT-5.6 Luna9 jul 20261 / 6Volume alto e baixo custo.
GPT-5.5 legado23 abr 20265 / 30Ainda é o motor prático por trás do ChatGPT Plus.
GPT-5.4 nano0,20 / 1,25O mais barato da casa.

O GPT-5.6 acrescenta um segundo dial independente: reasoning.mode, com standard (padrão) e pro. O modo pro faz o modelo trabalhar mais internamente e devolver uma única resposta final — vale quando confiabilidade importa mais que latência.

03

Effort, explicado

Não é "modo turbo" e não é "quantidade de texto". É quanto trabalho o modelo se permite fazer para produzir a resposta inteira.

O que o parâmetro realmente controla

Na Anthropic é output_config.effort. Ele afeta todos os tokens da resposta:

Duas consequências: funciona mesmo sem pensamento ligado, e dá controle sobre gasto agêntico, que é onde o dinheiro vai embora de verdade.

Sinal, não teto

A documentação é explícita: effort é um sinal de comportamento, não um orçamento rígido de tokens. Em nível baixo o Claude ainda pensa se o problema for difícil — só pensa menos do que pensaria em nível alto para o mesmo problema. Do lado da OpenAI, o GPT-5.6 trata o effort como teto, não piso: num prompt que ele julga fácil pode não gerar nenhum token de raciocínio, mesmo em nível alto.

A escada, lado a lado

NívelClaude output_config.effortGPT reasoning.effortQuando usar
noneLatência mínima, sem raciocínio nenhum
lowClassificação, consulta rápida, subagentes, volume alto
mediumpadrão GPT-5.6Equilíbrio de velocidade, custo e desempenho
highpadrão ClaudeRaciocínio complexo, análise delicada, código difícil
xhighTrabalho agêntico longo (30 min+), orçamentos de milhões de tokens
maxSem restrição de gasto; o problema justifica

No Claude, high produz exatamente o mesmo comportamento que omitir o parâmetro. O xhigh é mais novo: alguns modelos que aceitam max não aceitam xhigh. Suportam effort: Fable 5, Mythos 5, Opus 5, Opus 4.8, Opus 4.7, Opus 4.6, Sonnet 5, Sonnet 4.6 e Opus 4.5 — Haiku não entra na lista.

# Anthropic client.messages.create( model="claude-opus-5", max_tokens=4096, messages=[{"role":"user","content":"..."}], output_config={"effort":"medium"}, ) # OpenAI {"model":"gpt-5.6", "reasoning":{"effort":"low"}, "input":[...]}

Como isso é cobrado

Aqui está o ponto que pega quem não leu a letra miúda: tokens de raciocínio são cobrados como tokens de saída. Não existe sobretaxa de "modo pensante" — esforço alto simplesmente gera mais tokens, e saída é a parte cara da conta (5 a 6× a entrada). Você paga por um pensamento que nem chega a ler.

04

Thinking ≠ effort

São dois controles diferentes que todo mundo confunde. Vale trinta segundos separar os dois.

thinking

Se o modelo pensa em blocos antes de responder. No modo adaptive, o próprio modelo decide quando e quanto. É liga/desliga com um modo automático.

effort

Quanto trabalho o modelo coloca na resposta inteira — o que, no modo adaptativo, inclui com que frequência e profundidade ele pensa. É o acelerador.

Onde as duas coisas se cruzam: em esforço alto o Claude pensa em quase toda requisição e por mais tempo; em esforço baixo ele pode pular o pensamento em problemas simples. Onde há pensamento adaptativo, effort é o controle recomendado para profundidade.

Mudanças que quebram código antigo

Effort não encurta a resposta

No Opus 5, baixar o esforço reduz o volume de pensamento mas não encurta de forma confiável o texto que você lê. Se quer resposta curta, peça resposta curta no prompt. São problemas diferentes com soluções diferentes.

05

A escada interativa

Escolha um modelo, suba e desça a escada, veja o que acontece com custo e tempo. Os multiplicadores são ilustrativos — só a relação "high ≈ 2× medium" é documentada; o resto é ordem de grandeza para você raciocinar.

Simulador de esforço

Custo calculado sobre 1.000 requisições com o contexto e a saída-base que você definir.

Custo · 1.000 reqs
Saída por resposta
Latência relativa
Vs. o nível medium
06

Efeito no bolso e no relógio

Três números que valem mais que qualquer benchmark de marketing.

ObservaçãoO que fazer com isso
Uma requisição em high consome cerca de o dobro dos tokens de uma em mediumAntes de subir um nível, pergunte se o ganho de qualidade paga 100% a mais de token
Trocar high → medium num fluxo de 200 a 500 consultas diárias pode cortar ~50% do consumoÉ a economia mais fácil de conseguir num time que já usa IA todo dia
No Opus 5, max pode render menos que medium em tarefas simples ou estruturadas"Pensar demais" é um modo de falha real, não figura de linguagem

A hierarquia de otimização

Na ordem, do que mais resolve para o que menos resolve:

  1. Instrução mais clara — um prompt vago em xhigh continua vago, só mais lento e mais caro.
  2. Exemplos — um trecho do resultado que você considera bom vale mais que três parágrafos de instrução.
  3. Decomposição — quebrar a tarefa em etapas simples.
  4. Verificação em passo separado — pedir a revisão numa segunda chamada.
  5. Só então: subir o effort.
07

Dez regras práticas

Extraídas da documentação oficial dos dois fornecedores e das notas de migração.

  1. Defina o effort de propósito. O padrão existe, mas o ponto de partida certo depende do seu modelo e da sua carga.
  2. Comece no padrão e desça. No Opus 5, a recomendação é começar em high e usar low e medium liberalmente como controle primário de custo, sempre que suas avaliações mostrarem que a qualidade se mantém.
  3. Não reaproveite configuração de modelo antigo. A Anthropic pede explicitamente: rode uma nova varredura de effort nas suas avaliações. Os níveis foram recalibrados — low e medium no Opus 5 são muito mais fortes que nas gerações anteriores.
  4. Migrando de GPT-5.5 para 5.6? Mantenha o effort atual como linha de base e teste um nível abaixo. Modelo novo costuma entregar o mesmo com menos.
  5. Suba para xhigh só em trabalho agêntico longo — busca repetida, muitas chamadas de ferramenta, exploração. É para isso que o nível existe.
  6. Em xhigh ou max, aumente o max_tokens. Comece em 64k. Sem espaço, o modelo trava no meio.
  7. Mantenha o effort constante dentro de uma conversa com cache. Trocar o nível muda o prompt renderizado e invalida o cache — varie entre cargas de trabalho, não dentro de uma sessão longa.
  8. Apague suas instruções de verificação no Opus 5. Pedidos de "faça uma verificação final" agora causam verificação em excesso: o modelo já confere o próprio trabalho.
  9. Cuidado com instrução restritiva em revisão. Se o prompt diz "reporte só o que for grave", o Opus 5 obedece literalmente e reporta menos. Peça tudo e filtre num segundo passo.
  10. Se a resposta veio rasa, suba o effort em vez de contornar com prompt. E se precisar manter o effort baixo por latência, adicione uma instrução curta e dirigida: "esta tarefa envolve raciocínio em várias etapas; pense com cuidado antes de responder".
08

Para quem só usa o app

Você não vai digitar output_config em lugar nenhum. Mas o dial está lá, com outro nome.

No appÉ a versão consumidor de…Como usar bem
ChatGPT: Instant / Thinking / ProOs níveis de reasoning.effort e o reasoning.modeInstant para volume, Thinking para o que exige julgamento. Em planos elegíveis, um pedido difícil no Instant pode ser promovido automaticamente
Claude: seletor de modeloA escolha do modelo; o effort é gerenciado pelo appModelo maior para julgamento e documento longo; menor para tarefa mecânica e conversa rápida
Claude Code e CoworkNíveis mais altos de effort, com muitas chamadas de ferramentaÉ exatamente por isso que queimam cota rápido — não é bug, é o acelerador no fundo

A tradução prática, sem jargão

  • Pergunta de fato, formatação, resumo curto → modo rápido. Subir o esforço não melhora nada.
  • Análise, decisão, texto que vai para fora, código, contrato → modo pensante. Aqui o esforço vira qualidade de verdade.
  • Se a resposta veio rasa, o primeiro reflexo não é trocar de modelo: é dar mais contexto e um exemplo. Na maioria das vezes resolve, e sai de graça.
09

Tabela de decisão

Ponto de partida por tipo de tarefa. Ajuste depois de medir — nunca antes.

TarefaModeloEffortPor quê
Classificar, etiquetar, extrair campo fixoHaiku 4.5 / Lunalow ou noneNão há o que raciocinar; velocidade e preço mandam
Resumir e-mail, reescrever textoSonnet 5 / Terralow–mediumQualidade se mantém e o custo cai bastante
Redigir documento que vai para um clienteSonnet 5 / Terramedium–highJulgamento de tom e estrutura compensa o gasto
Análise densa, contrato, decisão de negócioOpus 5 / SolhighÉ o padrão por um motivo: aqui a profundidade vira acerto
Agente longo, muitas ferramentas, 30 min+Opus 5 / SolxhighO nível foi desenhado para exploração prolongada
Problema de fronteira, sem restrição de custoFable 5 / Sol promaxSó quando o problema justifica — e depois de medir
Subagentes dentro de um fluxo maiorSonnet 5 / LunalowMuitos deles rodam em paralelo; o custo multiplica