Montar SquadSolicitar Orçamento

Programação

Melhor modelo de IA para programação: custo em reais e qualidade

Placar de engenharia de software só significa alguma coisa junto com o harness que rodou o teste. O mesmo modelo, em agentes diferentes, resolve quantidades diferentes de tarefas.

Ranking pelos benchmarks relevantesSolicitar orçamento
Voltar ao comparativo completo

Snapshot de 6 set 2026. Revisado toda semana e a cada lançamento. Metodologia v1.0.

Premissas do perfil de carga

Agente de código em repositório real, com muitas chamadas curtas sobre um prefixo grande em cache. Assinaturas de IDE ficam fora: o cálculo é só de API. A escrita de cache fica fora do cálculo, então o custo de carga com cache alto é um piso.
Estes valores são premissas da X-Apps, propostas a partir de perfis típicos de projeto e ainda não aprovadas. Eles não descrevem nenhum cliente e não foram medidos: são a entrada da conta, e estão aqui para você conferir ou trocar pelos seus.
PremissaValorOrigem
Tokens de entrada por interação20.000tokens por chamadapremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0 (arquivos abertos, diff e histórico do agente de código)
Tokens de saída por interação2.000tokens por chamadapremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fração da entrada servida por cache0,75fracao da entrada servida por cachepremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fator de cachederivado do preço de cache de cada modelorazao cache_leitura / entrada, derivada por modelo em precos.json; 1 quando o modelo não publica preço de cache, ou seja, sem desconto (ver regras_de_custo.fator_cache). Nunca 0.premissa a aprovarderivada do dataset, não e premissa numerica; regra corrigida na fase 0c: a unidade anterior dizia 'null quando o modelo não tem cache' e o null lido como zero aplicava desconto integral sobre a fracao em cache
Interações por mês, nos três volumes500, 5.000, 50.000tarefas por mês [pequeno, médio, grande]premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Chamadas ao modelo por tarefa25chamadas ao modelo por tarefapremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0

Ranking pelos benchmarks relevantes

Só entram os benchmarks declarados como relevantes para este caso, cada um com o peso que a X-Apps atribuiu. A ordem da tabela segue o benchmark de maior peso, e não somamos escalas diferentes em um índice único: porcentagem de acerto e pontos de arena não podem virar um número só sem inventar metodologia. Quando os intervalos de dois modelos se cruzam, a linha diz empate técnico.

Ordenado por: SWE-bench Verified, entre os 2 modelos com resultado neste benchmark. Modelo sem resultado no benchmark que ordena a tabela aparece depois dos numerados, sem posição e em ordem alfabética: não há critério que produza um lugar para ele. Os pesos são premissa da X-Apps e ainda não foram aprovados.

Modelos avaliados nos benchmarks relevantes deste caso, com o peso declarado de cada benchmark e a fonte de cada valor.
#ModeloSWE-bench Verifiedverifiedpeso 0,25medição independenteTerminal-Bench4.0peso 0,20medido por concorrenteSWE-bench Propro (publico)peso 0,15medido por concorrenteDeepSWE1.1peso 0,15medido por concorrenteArena WebDev (Code Arena)peso 0,15preferência humanaCursorBench3.2peso 0,10medido por concorrente
1DeepSeek-V4-Proempate técnico77,64%max, nao declarado na paginanão medidonão medidonão medido1.581,68highnão medido
2Gemini 3.1 Pro Previewempate técnico75,62%nao-informado, nao declarado na paginanão medido54,2%high, nao declarado na paginanão medido1.445,52nao-informadonão medido
fora da ordenaçãoClaude Fable 5não medido44,5%max, nao declarado na paginanão medido69,9%max1.629,05nao-informadonão medido
fora da ordenaçãoClaude Fable 5.1não medido55,8%max, nao declarado na paginanão medido67,4%max1.762,25maxnão medido
fora da ordenaçãoClaude Opus 5não medido52,6%max, nao declarado na paginanão medido73,7%max1.687,61maxnão medido
fora da ordenaçãoClaude Sonnet 5não medidonão medidonão medidonão medido1.536,91highnão medido
fora da ordenaçãoDeepSeek-V4-Flashnão medidonão medidonão medidonão medido1.579,64highnão medido
fora da ordenaçãoGemini 3.8 Flashnão medidonão medidonão medidonão medido1.567,23highnão medido
fora da ordenaçãoGLM-5.3não medidonão medidonão medidonão medido1.608,96maxnão medido
fora da ordenaçãoGPT-5.6 Lunanão medidonão medidonão medidonão medido1.519,49xhighnão medido
fora da ordenaçãoGPT-5.6 Solnão medidonão medidonão medidonão medido1.617,42xhigh67,2%nao-informado
fora da ordenaçãoGPT-5.6 Terranão medidonão medidonão medidonão medido1.519,67xhighnão medido
fora da ordenaçãoGPT-6 Astranão medidonão medidonão medidonão medido1.797,04maxnão medido
fora da ordenaçãoGrok 4.6não medidonão medidonão medidonão medido1.624,86highnão medido
fora da ordenaçãoKimi K3não medidonão medidonão medidonão medido1.674,35maxnão medido
fora da ordenaçãoMiniMax M3não medidonão medidonão medidonão medido1.487,3nao-informadonão medido
fora da ordenaçãoMuse Glimmer-30Bnão medidonão medidonão medidonão medido1.359,56nao-informadonão medido
fora da ordenaçãoMuse Spark 1.3não medidonão medidonão medidonão medido1.622,48xhighnão medido
fora da ordenaçãoQwen3.8-Maxnão medidonão medidonão medidonão medido1.686,07maxnão medido

Custo mensal para três volumes

Custo mensal em reais para três volumes, calculado no momento em que a página é montada a partir do preço publicado pelo fabricante e do perfil de carga de cada caso. O perfil de carga é premissa da X-Apps e ainda não foi aprovado: por isso todo valor em reais aparece marcado, com a fórmula, as premissas e a cotação PTAX de venda do Banco Central com data e hora ao lado.

Melhor modelo de IA para programação: custo em reais e qualidade

Agente de código em repositório real, com muitas chamadas curtas sobre um prefixo grande em cache. Assinaturas de IDE ficam fora: o cálculo é só de API. A escrita de cache fica fora do cálculo, então o custo de carga com cache alto é um piso.

Custo mensal em reais por modelo e por volume, com a marca de premissa a aprovar em cada valor.
Modelovolume pequenovolume médiovolume grande
MiniMax M3provedor minimax
R$ 307,52premissa a aprovar
R$ 3.075,18premissa a aprovar
R$ 30.751,80premissa a aprovar
DeepSeek-V4-Flashprovedor deepseek, tarifa de pico
R$ 323,53premissa a aprovar
R$ 3.235,35premissa a aprovar
R$ 32.353,46premissa a aprovar
Mistral Large 3provedor mistral, sem preço de cache: fator 1
R$ 832,86premissa a aprovar
R$ 8.328,61premissa a aprovar
R$ 83.286,13premissa a aprovar
Fórmulacusto_mensal_usd = interacoes_por_mes x (tokens_entrada_por_interacao x preco_entrada x (1 - proporcao_cache x (1 - fator_cache)) + tokens_saida_por_interacao x preco_saida) / 1000000; custo_mensal_brl = custo_mensal_usd x meta.cotacao.valor; para agentes e código, interacoes_por_mes = tarefas_por_mes x chamadas_por_tarefa Regras assumidas por esta fórmula em regras_de_custo: fator_cache, escrita_de_cache, horario_de_pico e provedor_por_modelo.MiniMax M3, volume médio: custo_mensal_usd = 125.000 x (20.000 x 0,3 x (1 - 0,75 x (1 - 0,2)) + 2.000 x 1,2) / 1000000; custo_mensal_brl = 600 x 5,1253
Cotação usadaR$ 5,13em 04/09/2026, 13:03:59
Premissas de carga deste caso
Tokens de entrada por interação
20.000 tokens por chamadapremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0 (arquivos abertos, diff e histórico do agente de código)
Tokens de saída por interação
2.000 tokens por chamadapremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fração da entrada servida por cache
0,75 fracao da entrada servida por cachepremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fator de cache
derivado do preço de cache de cada modelo razao cache_leitura / entrada, derivada por modelo em precos.json; 1 quando o modelo não publica preço de cache, ou seja, sem desconto (ver regras_de_custo.fator_cache). Nunca 0.premissa a aprovarderivada do dataset, não e premissa numerica; regra corrigida na fase 0c: a unidade anterior dizia 'null quando o modelo não tem cache' e o null lido como zero aplicava desconto integral sobre a fracao em cache
Volume mensal
500, 5.000, 50.000 tarefas por mês [pequeno, médio, grande]premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Chamadas ao modelo por tarefa
25 chamadas ao modelo por tarefapremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0

com escrita de cache fora da conta, este valor é um piso

Ver o caso completoFalar com a X-Apps sobre este caso

IOF, spread, tributação de pessoa jurídica e escrita de cache ficam fora do cálculo; com escrita de cache fora, o valor é um piso para carga com muito cache.

Quatro regras que esta conta assume
Fator de cache
fator_cache = cache_leitura / entrada quando precos.json publica cache_leitura, e 1 quando cache_leitura e null, ou seja, sem desconto. Nunca 0: lido como 0, o termo (1 - proporcao_cache x (1 - fator_cache)) aplicaria desconto integral sobre toda a fracao em cache e subestimaria o custo (no caso código, com proporcao de cache de tres quartos, a subestimacao seria de metade do valor). Seis registros vigentes não publicam preço de cache: gemini-3-1-pro-preview e gemini-3-8-flash no provedor google, mistral-large-3, mistral-medium-3-5, mistral-small-4 e qwen3-8-max.
Escrita de cache
Fora do cálculo nesta versão e declarado como tal ao leitor. A escrita de cache custa 1,25x a entrada na janela de cinco minutos e 2x na de uma hora nos registros da Anthropic, e 1,25x nos da OpenAI; a taxa de reescrita do prefixo depende do padrão de uso, que o dataset não mede e que nenhuma fonte publica. Consequencia declarada: em carga com muito cache o custo publicado e um piso, não uma estimativa central.
Horário de pico
Modelo com horario_de_pico em precos.json entra na coluna de custo pela tarifa de PICO, que e a tarifa de referência da própria página (a DeepSeek apresenta o fora de pico como desconto de metade), e o fora de pico aparece como nota. Vale para deepseek-v4-pro e deepseek-v4-flash: pico das 01:00 as 04:00 e das 06:00 as 10:00 UTC, de segunda a sexta, 35 das 168 horas da semana, faixa que cobre o inicio do horario comercial brasileiro.
Provedor por modelo
Quando um modelo tem mais de um registro vigente em precos.json, a coluna de custo usa o registro nomeado aqui. muse-spark-1-3: provedor meta (Standard). O tier meta-contributor, doze vezes e meia mais barato, fica FORA da coluna de custo porque e o tier em que prompts e respostas do cliente treinam modelos da Meta; ele aparece so na secao de preços, com a pilula de treino de dados. gemini-3-1-pro-preview e gemini-3-8-flash: provedor google (os dois registros vigentes tem a mesma entrada e a mesma saida, então a escolha não muda o valor).
Fora do cálculo
IOF, spread bancario, tributacao de pessoa juridica, marketplace de nuvem, Batch, modo rápido, escrita de cache e custo de ferramentas ou de infraestrutura.

Veredito

O que esta página ainda não mede

  • harness usado em cada score, que precisa aparecer ao lado do número
  • tokenizador e custo real por linha de código de cada fabricante
  • contexto útil em repositório grande, sem medição independente nesta versão

Perguntas frequentes

Depende do tipo de tarefa e do agente usado. Esta página cruza benchmarks de engenharia de software com o harness declarado ao lado de cada score, e publica o custo mensal em reais de um agente de código para três volumes, com a fórmula e as premissas de carga visíveis. As premissas são propostas da X-Apps e ainda não foram aprovadas, então cada valor em reais aparece marcado como premissa.

Leia também

Três artigos que explicam como ler um placar, como escolher para prototipar e o que muda entre níveis de esforço do mesmo modelo.

Quer este caso rodando na sua operação?

A X-Apps desenha, opera e governa soluções com estes modelos. Fale com a equipe.
Falar com a X-Apps sobre este casoSolicitar orçamento

Acelere a sua empresa com a X-Apps

Alocar profissionaisSolicitar Orçamento
A X-Apps é um provedor de TI parceiro e aconselhada pelo
Gartner
Receba nossos e-mails
Siga nossas redes sociais
O seu time de tecnologia e IA. Software sob medida, soluções de IA e alocação de profissionais.
Vamos conversar?
comercial@x-apps.com.br11 5083-0122

Rua Rodrigo Vieira, 126

Jardim Vila Mariana. São Paulo, SP.

CEP: 04115-060

Mapa do site
Termos de serviçoTermos de privacidade
Available in English