O que aconteceu
Em 21 e 22 de setembro de 2026 saíram três modelos de fronteira. A xAI lançou o Grok 4.7 na segunda, com 2,1 trilhões de parâmetros — 40% a mais que o 4.6 — a US$ 2 por milhão de tokens de entrada e US$ 6 de saída. No dia seguinte a Anthropic publicou o Claude Opus 5.5 e a OpenAI respondeu com dois modelos da família GPT-6, o Sol e o Luna.
Os números que interessam estão na tabela de preço. Opus 5.5 custa US$ 4 na entrada e US$ 20 na saída, por milhão de tokens, com leitura de cache a US$ 0,20 — uma queda de 60% nesse item específico. GPT-6 Sol fica em US$ 2 e US$ 10; GPT-6 Luna, em US$ 0,10 e US$ 0,50, com 90% de desconto na leitura de token em cache. Em benchmark, a Anthropic reporta 66,4% no Terminal-Bench 4.0 contra 55,8% do Fable 5.1, e 40% de tarefas concluídas no AutomationBench contra 26,9% do Opus 5. A OpenAI reporta 33,2% no mesmo AutomationBench para o Sol, a US$ 0,27 por tarefa.
Por que isso importa
A notícia não é "modelo novo ficou mais inteligente". É que a distância de preço entre o topo e a base da mesma família virou duas ordens de grandeza. Entre o Luna e o Opus 5.5 há 40x na entrada e 40x na saída. Isso muda o desenho do sistema, não a escolha do fornecedor.
Até o ano passado eu escolhia um modelo por produto e vivia com ele. Com essa escada de preço, escolher um só é desperdício nas duas pontas: ou eu pago modelo de fronteira para classificar e-mail, ou uso modelo barato para escrever código que vai para produção e gasto revisão humana no lugar.
O segundo ponto é o cache. Quando a leitura de token em cache cai 60% ou 90%, o custo deixa de ser dominado pelo tamanho do prompt e passa a ser dominado por quantas vezes você muda o prompt. Prompt de sistema estável e longo ficou barato; prompt montado do zero a cada requisição, não. Isso premia uma arquitetura específica: contexto fixo no começo, variável no fim.
Na prática
O que eu faço em projeto Laravel é declarar as camadas por tarefa, não por modelo, e deixar o nome do modelo na configuração. Assim a troca de setembro não vira caça a string espalhada pelo código:
// config/ia.php
return [
'camadas' => [
'triagem' => env('IA_MODELO_TRIAGEM', 'gpt-6-luna'),
'redacao' => env('IA_MODELO_REDACAO', 'gpt-6-sol'),
'critico' => env('IA_MODELO_CRITICO', 'claude-opus-5-5'),
],
'teto_mensal_usd' => env('IA_TETO_MENSAL_USD', 50),
];
class RoteadorDeModelo
{
public function __construct(private GastoMensal $gasto) {}
public function para(string $camada): string
{
// Estourou o teto: cai para a camada barata em vez de derrubar a fila.
if ($this->gasto->acumuladoUsd() >= config('ia.teto_mensal_usd')) {
return config('ia.camadas.triagem');
}
return config("ia.camadas.{$camada}")
?? throw new InvalidArgumentException("camada desconhecida: {$camada}");
}
}
Três detalhes que eu não pulo:
- Registrar tokens de entrada, de saída e de cache separados em cada chamada. Sem isso não dá para saber se a conta subiu por volume ou por prompt reescrito.
- Prompt de sistema imutável, com o que varia no fim da mensagem. É o que faz o desconto de cache existir.
- Teto de gasto com degradação, e não com erro. Fila que morre por limite de orçamento vira incidente de madrugada.
O que eu faria
Se eu tivesse um sistema em produção usando modelo de fronteira para tudo, eu mexeria esta semana — mas só na camada de baixo. Trocar a classificação e a extração de campo para o modelo mais barato da família é uma mudança de configuração com efeito imediato na fatura, e o erro, quando acontece, é visível e barato de corrigir.
A camada que escreve código ou responde cliente eu não trocaria pelo preço. Trocaria depois de rodar o meu próprio conjunto de casos — de 30 a 50 exemplos reais do projeto, com resposta esperada — porque benchmark público mede a média do mundo, e o que importa é a média do seu domínio.
Grok 4.7 eu deixo de fora por enquanto: o próprio anúncio o posiciona abaixo do topo em capacidade, e o preço dele não é baixo o bastante para competir com o Luna na camada de triagem. É o pior lugar para ficar — nem o mais barato, nem o melhor.
E a parte chata, que eu repito em toda consultoria: antes de trocar qualquer coisa, tenha como medir. Se você não consegue dizer hoje quanto custou a última semana de IA no seu sistema, a resposta para "vale a pena trocar de modelo?" não é técnica, é chute.
