Montar SquadSolicitar Orçamento

Chat com documentos

Melhor modelo de IA para RAG: custo em reais e qualidade

Busca sobre a sua base: a pergunta chega junto com trechos recuperados. Os trechos mudam a cada consulta, então o cache ajuda menos que em chatbot e a entrada cresce.

Ranking pelos benchmarks relevantesSolicitar orçamento
Voltar ao comparativo completo

Snapshot de 6 set 2026. Revisado toda semana e a cada lançamento. Metodologia v1.0.

Premissas do perfil de carga

Consulta sobre base documental interna com recuperação de trechos. O contexto recuperado muda a cada consulta, então o cache cobre só o system prompt. Embeddings e indexação ficam fora do cálculo na v1. A escrita de cache fica fora do cálculo, então o custo de carga com cache alto é um piso.
Estes valores são premissas da X-Apps, propostas a partir de perfis típicos de projeto e ainda não aprovadas. Eles não descrevem nenhum cliente e não foram medidos: são a entrada da conta, e estão aqui para você conferir ou trocar pelos seus.
PremissaValorOrigem
Tokens de entrada por interação6.000tokenspremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0 (pergunta, system prompt e contexto recuperado)
Tokens de saída por interação400tokenspremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fração da entrada servida por cache0,3fracao da entrada servida por cachepremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fator de cachederivado do preço de cache de cada modelorazao cache_leitura / entrada, derivada por modelo em precos.json; 1 quando o modelo não publica preço de cache, ou seja, sem desconto (ver regras_de_custo.fator_cache). Nunca 0.premissa a aprovarderivada do dataset, não e premissa numerica; regra corrigida na fase 0c: a unidade anterior dizia 'null quando o modelo não tem cache' e o null lido como zero aplicava desconto integral sobre a fracao em cache
Interações por mês, nos três volumes5.000, 50.000, 500.000consultas por mês [pequeno, médio, grande]premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Tokens de contexto recuperado por consulta4.000tokens de contexto recuperado por consultapremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0

Ranking pelos benchmarks relevantes

Só entram os benchmarks declarados como relevantes para este caso, cada um com o peso que a X-Apps atribuiu. A ordem da tabela segue o benchmark de maior peso, e não somamos escalas diferentes em um índice único: porcentagem de acerto e pontos de arena não podem virar um número só sem inventar metodologia. Quando os intervalos de dois modelos se cruzam, a linha diz empate técnico.

Ordenado por: Arena Text, entre os 17 modelos com resultado neste benchmark. Modelo sem resultado no benchmark que ordena a tabela aparece depois dos numerados, sem posição e em ordem alfabética: não há critério que produza um lugar para ele. Os pesos são premissa da X-Apps e ainda não foram aprovados.

Modelos avaliados nos benchmarks relevantes deste caso, com o peso declarado de cada benchmark e a fonte de cada valor.
#ModeloArena Textpeso 0,30preferência humanaHumanity's Last Examfull, com ferramentaspeso 0,25medido por concorrenteEpoch Capabilities Indexpeso 0,25medição independenteGPQA Diamonddiamondpeso 0,20medição independente
1Claude Fable 5.1empate técnico1.513,7max65%max162,88nao-informadonão medido
2Claude Opus 5empate técnico1.505,02high63,6%max162,33nao-informado93,88%max
3Gemini 3.8 Flashempate técnico1.495,23highnão medidonão medidonão medido
4Claude Fable 5empate técnico1.494,14nao-informado63,8%max162,9nao-informado85,86%max
5Gemini 3.1 Pro Previewempate técnico1.480,06nao-informadonão medido154,9nao-informado94,44%high
6Qwen3.8-Maxempate técnico1.479,88maxnão medidonão medido92,68%xhigh
7Kimi K3empate técnico1.475,97maxnão medido157,62nao-informado93,12%max
8GLM-5.3empate técnico1.473,54maxnão medido155,3nao-informado90,91%max
9GPT-5.6 Solempate técnico1.454,87xhighnão medido162,03nao-informado93,5%max
10DeepSeek-V4-Proempate técnico1.451,07nao-informadonão medido149,2nao-informado91,67%max
11GPT-5.6 Terraempate técnico1.446,78xhighnão medido159,18nao-informado93,31%max
12Claude Sonnet 5empate técnico1.443,15highnão medido156,16nao-informado90,53%xhigh
13MiniMax M3empate técnico1.435,21nao-informadonão medido146,57nao-informado90,91%nao-informado
14DeepSeek-V4-Flashempate técnico1.431,91nao-informadonão medido146,26nao-informado91,04%max
15GPT-5.6 Lunaempate técnico1.430,31xhighnão medido156,33nao-informado91,6%max
16Mistral Large 3empate técnico1.427,68nao-informadonão medidonão medidonão medido
17Mistral Medium 3.5empate técnico1.421,03mediumnão medido141,37nao-informadonão medido
fora da ordenaçãoClaude Haiku 4.5não medidonão medido142,41nao-informado71,21%nao-informado
fora da ordenaçãoGPT-6 Astranão medidonão medido169,23nao-informado95,77%max
fora da ordenaçãoGrok 4.6não medidonão medido156,33nao-informado94%high

Custo mensal para três volumes

Custo mensal em reais para três volumes, calculado no momento em que a página é montada a partir do preço publicado pelo fabricante e do perfil de carga de cada caso. O perfil de carga é premissa da X-Apps e ainda não foi aprovado: por isso todo valor em reais aparece marcado, com a fórmula, as premissas e a cotação PTAX de venda do Banco Central com data e hora ao lado.

Melhor modelo de IA para RAG: custo em reais e qualidade

Consulta sobre base documental interna com recuperação de trechos. O contexto recuperado muda a cada consulta, então o cache cobre só o system prompt. Embeddings e indexação ficam fora do cálculo na v1. A escrita de cache fica fora do cálculo, então o custo de carga com cache alto é um piso.

Custo mensal em reais por modelo e por volume, com a marca de premissa a aprovar em cada valor.
Modelovolume pequenovolume médiovolume grande
MiniMax M3provedor minimax
R$ 47,36premissa a aprovar
R$ 473,58premissa a aprovar
R$ 4.735,78premissa a aprovar
DeepSeek-V4-Flashprovedor deepseek, tarifa de pico
R$ 61,53premissa a aprovar
R$ 615,34premissa a aprovar
R$ 6.153,44premissa a aprovar
Mistral Large 3provedor mistral, sem preço de cache: fator 1
R$ 92,26premissa a aprovar
R$ 922,55premissa a aprovar
R$ 9.225,54premissa a aprovar
Fórmulacusto_mensal_usd = interacoes_por_mes x (tokens_entrada_por_interacao x preco_entrada x (1 - proporcao_cache x (1 - fator_cache)) + tokens_saida_por_interacao x preco_saida) / 1000000; custo_mensal_brl = custo_mensal_usd x meta.cotacao.valor; para agentes e código, interacoes_por_mes = tarefas_por_mes x chamadas_por_tarefa Regras assumidas por esta fórmula em regras_de_custo: fator_cache, escrita_de_cache, horario_de_pico e provedor_por_modelo.MiniMax M3, volume médio: custo_mensal_usd = 50.000 x (6.000 x 0,3 x (1 - 0,3 x (1 - 0,2)) + 400 x 1,2) / 1000000; custo_mensal_brl = 92,4 x 5,1253
Cotação usadaR$ 5,13em 04/09/2026, 13:03:59
Premissas de carga deste caso
Tokens de entrada por interação
6.000 tokenspremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0 (pergunta, system prompt e contexto recuperado)
Tokens de saída por interação
400 tokenspremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fração da entrada servida por cache
0,3 fracao da entrada servida por cachepremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fator de cache
derivado do preço de cache de cada modelo razao cache_leitura / entrada, derivada por modelo em precos.json; 1 quando o modelo não publica preço de cache, ou seja, sem desconto (ver regras_de_custo.fator_cache). Nunca 0.premissa a aprovarderivada do dataset, não e premissa numerica; regra corrigida na fase 0c: a unidade anterior dizia 'null quando o modelo não tem cache' e o null lido como zero aplicava desconto integral sobre a fracao em cache
Volume mensal
5.000, 50.000, 500.000 consultas por mês [pequeno, médio, grande]premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0

com escrita de cache fora da conta, este valor é um piso

Ver o caso completoFalar com a X-Apps sobre este caso

IOF, spread, tributação de pessoa jurídica e escrita de cache ficam fora do cálculo; com escrita de cache fora, o valor é um piso para carga com muito cache.

Quatro regras que esta conta assume
Fator de cache
fator_cache = cache_leitura / entrada quando precos.json publica cache_leitura, e 1 quando cache_leitura e null, ou seja, sem desconto. Nunca 0: lido como 0, o termo (1 - proporcao_cache x (1 - fator_cache)) aplicaria desconto integral sobre toda a fracao em cache e subestimaria o custo (no caso código, com proporcao de cache de tres quartos, a subestimacao seria de metade do valor). Seis registros vigentes não publicam preço de cache: gemini-3-1-pro-preview e gemini-3-8-flash no provedor google, mistral-large-3, mistral-medium-3-5, mistral-small-4 e qwen3-8-max.
Escrita de cache
Fora do cálculo nesta versão e declarado como tal ao leitor. A escrita de cache custa 1,25x a entrada na janela de cinco minutos e 2x na de uma hora nos registros da Anthropic, e 1,25x nos da OpenAI; a taxa de reescrita do prefixo depende do padrão de uso, que o dataset não mede e que nenhuma fonte publica. Consequencia declarada: em carga com muito cache o custo publicado e um piso, não uma estimativa central.
Horário de pico
Modelo com horario_de_pico em precos.json entra na coluna de custo pela tarifa de PICO, que e a tarifa de referência da própria página (a DeepSeek apresenta o fora de pico como desconto de metade), e o fora de pico aparece como nota. Vale para deepseek-v4-pro e deepseek-v4-flash: pico das 01:00 as 04:00 e das 06:00 as 10:00 UTC, de segunda a sexta, 35 das 168 horas da semana, faixa que cobre o inicio do horario comercial brasileiro.
Provedor por modelo
Quando um modelo tem mais de um registro vigente em precos.json, a coluna de custo usa o registro nomeado aqui. muse-spark-1-3: provedor meta (Standard). O tier meta-contributor, doze vezes e meia mais barato, fica FORA da coluna de custo porque e o tier em que prompts e respostas do cliente treinam modelos da Meta; ele aparece so na secao de preços, com a pilula de treino de dados. gemini-3-1-pro-preview e gemini-3-8-flash: provedor google (os dois registros vigentes tem a mesma entrada e a mesma saida, então a escolha não muda o valor).
Fora do cálculo
IOF, spread bancario, tributacao de pessoa juridica, marketplace de nuvem, Batch, modo rápido, escrita de cache e custo de ferramentas ou de infraestrutura.

Veredito

O que esta página ainda não mede

  • contexto útil contra contexto anunciado, sem medição independente nesta versão
  • disciplina de citar a fonte dentro da resposta
  • custo de indexação e de embeddings, fora desta conta

Perguntas frequentes

A conta soma a pergunta, o system prompt e os trechos recuperados, mais a resposta. Os trechos mudam a cada consulta, então o cache ajuda menos que em chatbot. Esta página publica o custo mensal em reais para três volumes, com a fórmula e as premissas de carga visíveis; as premissas são propostas da X-Apps e ainda não foram aprovadas, então cada valor aparece marcado como premissa.

Leia também

Três artigos que explicam como ler um placar, como escolher para prototipar e o que muda entre níveis de esforço do mesmo modelo.

Quer este caso rodando na sua operação?

A X-Apps desenha, opera e governa soluções com estes modelos. Fale com a equipe.
Falar com a X-Apps sobre este casoSolicitar orçamento

Acelere a sua empresa com a X-Apps

Alocar profissionaisSolicitar Orçamento
A X-Apps é um provedor de TI parceiro e aconselhada pelo
Gartner
Receba nossos e-mails
Siga nossas redes sociais
O seu time de tecnologia e IA. Software sob medida, soluções de IA e alocação de profissionais.
Vamos conversar?
comercial@x-apps.com.br11 5083-0122

Rua Rodrigo Vieira, 126

Jardim Vila Mariana. São Paulo, SP.

CEP: 04115-060

Mapa do site
Termos de serviçoTermos de privacidade
Available in English