O custo que a tabela de tokens não mostra
Por que inteligência e custo por tarefa mudam a comparação entre modelos
.png)
Quando chega a hora de escolher um modelo, o caminho mais comum ainda é abrir a tabela de preços e olhar o custo por milhão de tokens de input e de output. Os nomes grandes aparecem primeiro, os números parecem objetivos, e a decisão fecha em cima dessa comparação. Faz sentido. É a unidade que os vendors publicam, é o que a planilha entende, e por muito tempo foi a forma mais prática de comparar opções.
O problema é que essa leitura, sozinha, deixa muita coisa de fora.
O que o preço por token realmente mede
Preço de input e preço de output dizem quanto custa movimentar uma unidade de texto. Não dizem quanto texto o modelo vai gerar para chegar num resultado, quantas tentativas ele precisa, nem se a regra de contagem do provider é a mesma da versão anterior.
Dois modelos com preço de token parecido podem sair com contas bem diferentes na mesma tarefa. Um responde curto e resolve. Outro escreve mais, revisita o raciocínio, ou simplesmente conta token de outro jeito.
Um exemplo concreto: no Claude Sonnet 5, a Anthropic documenta um tokenizer novo em que o mesmo texto gera cerca de 30% mais tokens do que no Sonnet 4.6. O aumento exato depende do conteúdo. Isso não significa, automaticamente, uma conta 30% mais cara em dólar, porque o preço por milhão de tokens também mudou. Significa outra coisa, mais importante para a comparação: olhar só o $/1M tokens entre gerações (ou entre modelos) engana, porque a unidade "token" não representa o mesmo pedaço de texto para todo mundo.
Por isso o preço por token continua útil como referência, mas incompleto como critério único.
A outra metade: qualidade
Se a gente só otimiza preço, o modelo mais barato sempre ganha. Na prática ninguém escolhe assim, e com razão. Sem um piso de qualidade, "barato" pode ser só modelo fraco para aquele trabalho.
A leitura mais limpa junta as duas coisas: quanto o modelo custa para entregar um resultado, e quão capaz ele é nesse resultado. Separadas, cada métrica mente um pouco. Juntas, elas começam a parecer uma decisão.
Custo por tarefa como lente
O Artificial Analysis publica um gráfico que ajuda exatamente nisso: Intelligence Index no eixo vertical, e custo médio por tarefa desse índice no eixo horizontal (em escala logarítmica). Em vez de perguntar só "quanto custa o token?", a pergunta vira "quanto custa, em média, completar uma tarefa neste nível de inteligência?".
Isso não substitui o teste no seu próprio workload. Substitui a ilusão de que a tabela de $/1M tokens já é a resposta. O custo por tarefa aproxima melhor o que você paga por resultado, porque absorve diferenças de geração, de caminho e, em parte, de comportamento do modelo.
Uma caminhada pelos dados
Olhando o mapa, três regiões ficam claras.
Na faixa mais eficiente, qualidade boa o bastante aparece com custo por tarefa baixo. Variantes como GPT-5.6 Luna ficam no extremo barato, com inteligência sólida na casa dos 30 e poucos pontos por poucos centavos por tarefa. GLM-5.3-Flash aparece perto da fronteira, com inteligência em torno de 42 por cerca de US$ 0,25 por tarefa. DeepSeek V4.1 Flash entrega algo perto de 39 por cerca de US$ 0,28. Gemini 3.8 Flash entra no mesmo tipo de zona atrativa, com inteligência na casa dos 40 a uma fração do que muitos modelos "premium" cobram por tarefa. No meio da curva, nomes como GPT-5.6 Terra e GPT-5.6 Sol competem com inteligência competitiva sem o ticket do topo absoluto.
No outro extremo, modelos de inteligência muito alta (algumas variantes Claude Opus / Fable, por exemplo) chegam a 50+ no índice, com custo por tarefa na casa de vários dólares. Isso pode ser exatamente o que uma tarefa difícil pede. Só não precisa ser o default de tudo.
O Claude Sonnet 5 (max) ajuda a ver a distorção. Inteligência perto de 38, custo na casa de US$ 5 por tarefa. No mesmo gráfico, Terra, Gemini 3.8 Flash e até Luna aparecem com inteligência parecida ou melhor por uma fração do custo. A leitura útil não é "Sonnet é ruim". É "a percepção de qualidade associada a um nome mainstream pode estar desalinhada do custo por tarefa que os dados mostram".
Olhar além do mainstream
Uma coisa que o gráfico deixa difícil de ignorar é quanta eficiência aparece fora da lista de sempre. Modelos como GLM, DeepSeek e Kimi surgem com frequência perto da fronteira: qualidade respeitável com custo por tarefa baixo.
Se a comparação for só preço de token entre dois ou três nomes famosos, essa faixa quase não entra na conversa. Se a comparação for qualidade mínima aceitável mais custo por tarefa, ela entra naturalmente. Às vezes o melhor custo-benefício não está no modelo que todo mundo cita primeiro.
Como usar isso na hora de escolher
Um roteiro simples, e o suficiente para a maior parte das decisões:
- Escreva a tarefa com clareza. O que precisa sair bem, e o que é inaceitável.
- Defina um piso de qualidade. Use um índice público como o Intelligence Index como ponto de partida, e confirme com exemplos reais do seu uso.
- Nessa faixa de qualidade, compare custo por tarefa, não só $/1M tokens de input e output.
- Coloque pelo menos uma ou duas opções fora do default famoso na mesa, especialmente se elas aparecerem na fronteira de eficiência.
- Rode o mesmo conjunto de exemplos nos finalistas e olhe gasto real, estabilidade e qualidade lado a lado.
- Quando o provider mudar preço ou regra de contagem, refaça a leitura. A tabela de ontem pode estar descrevendo outro produto.
Nada disso pede uma planilha infinita. Pede o hábito de não parar no primeiro número visível.
Fonte: Artificial Analysis, gráfico Intelligence Index vs Cost per Intelligence Index Task (21 set 2026). Valores aproximados a partir do recorte público do painel. Sobre o tokenizer do Sonnet 5: documentação Anthropic (What's new / Migration guide).