Snapshot de 6 set 2026. Revisado toda semana e a cada lançamento. Metodologia v1.0.
Resposta rápida
Comparativo com fonte
Quem lidera cada eixo, com o benchmark e a versão usados. Número publicado pelo fabricante leva a etiqueta correspondente; número de um fabricante medido por um concorrente leva outra; quando existe medição independente, ela manda. O eixo de preferência humana vem do Arena, sempre com o intervalo publicado: diferença menor que o intervalo é empate técnico, e o cartão diz isso em vez de fingir um vencedor.
empate técnico com Gemini 3.1 Pro Preview, Gemini 3.1 Pro Preview, Grok 4.6, Claude Opus 5, GPT-5.6 Sol, GPT-5.6 Terra, Grok 4.6, Kimi K3 e Claude Opus 5.
Ordene por qualquer coluna e filtre por fabricante, licença de pesos ou faixa de preço. Toda célula numérica abre a fonte, com a data do dado e a data da leitura.
24 modelos nesta tabela
Modelos de IA comparados: avaliações independentes e de preferência humana, preço por milhão de tokens, contexto, custo em reais, pesos abertos e situação. Cada célula numérica tem fonte e data. Nas avaliações, o número é o maior valor publicado pelo modelo naquele benchmark, com o nível de esforço escrito ao lado. A estrela marca o maior valor da coluna e o sinal de igual marca quem cruza o intervalo publicado do líder, ou seja, quem não pode ser separado dele; a dica de cada coluna diz quantos pares vizinhos também se sobrepõem.
Epoch Capabilities Index. medição independente. 17 modelos com resultado. a fonte publica intervalo, e 15 dos 16 pares vizinhos se sobrepõem: ordenar por esta coluna não separa esses modelos. a marca de empate na célula é reservada ao topo, entre o líder e quem cruza o intervalo dele. Fonte: Epoch AI, AI Benchmarking Hub (epoch_capabilities_index/eci_scores.csv do benchmark_data.zip), lido em 6 set 2026
GPQA Diamond. versão diamond. medição independente. 16 modelos com resultado. a fonte publica intervalo, e 13 dos 15 pares vizinhos se sobrepõem: ordenar por esta coluna não separa esses modelos. a marca de empate na célula é reservada ao topo, entre o líder e quem cruza o intervalo dele. Fonte: Epoch AI, AI Benchmarking Hub (gpqa_diamond.csv do benchmark_data.zip), lido em 6 set 2026
Arena WebDev (Code Arena). versão config webdev, split latest. preferência humana. 19 modelos com resultado. a fonte publica intervalo, e 10 dos 18 pares vizinhos se sobrepõem: ordenar por esta coluna não separa esses modelos. a marca de empate na célula é reservada ao topo, entre o líder e quem cruza o intervalo dele. Fonte: LMArena, dataset lmarena-ai/leaderboard-dataset (config webdev, split latest), lido em 6 set 2026
Arena Agent. versão config agent, split latest. preferência humana. 17 modelos com resultado. a fonte publica intervalo, e 14 dos 16 pares vizinhos se sobrepõem: ordenar por esta coluna não separa esses modelos. a marca de empate na célula é reservada ao topo, entre o líder e quem cruza o intervalo dele. Fonte: LMArena, dataset lmarena-ai/leaderboard-dataset (config agent, split latest), lido em 6 set 2026
Arena Text. versão dataset lmarena-ai/leaderboard-dataset, config text, split latest. preferência humana. 17 modelos com resultado. a fonte publica intervalo, e 14 dos 16 pares vizinhos se sobrepõem: ordenar por esta coluna não separa esses modelos. a marca de empate na célula é reservada ao topo, entre o líder e quem cruza o intervalo dele. Fonte: LMArena, dataset lmarena-ai/leaderboard-dataset (config text, split latest), lido em 6 set 2026
custo_brl_por_milhao_de_saida = preço de saída em US$ x cotação PTAX. Cotação de R$ 5,1253 por US$ 1,00, de 4 set 2026, 13:03:59, do Banco Central. IOF e spread ficam fora do cálculo.
GPT-6 AstraOpenAI
169,23=empate técnico com Claude Fable 5, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol
95,8%max de esforço=empate técnico com Gemini 3.1 Pro Preview, Grok 4.6, Claude Opus 5, GPT-5.6 Sol, GPT-5.6 Terra, Kimi K3
1.797,0max de esforço=empate técnico com Claude Fable 5.1
não medido
não medido
1.050.000
US$ 10,00
US$ 50,00
US$ 1,00
R$ 256,27
Afechado
Vverificado
Claude Fable 5Anthropic
162,90=empate técnico com GPT-6 Astra
85,9%max de esforço
1.629,1
10,23%high de esforço
1.494,1
1.000.000
US$ 10,00
US$ 50,00
US$ 1,00
R$ 256,27
Afechado
Vverificado
Claude Fable 5.1Anthropic
162,88=empate técnico com GPT-6 Astra
não medido
1.762,3max de esforço=empate técnico com GPT-6 Astra
15,87%max de esforço=empate técnico com Claude Opus 5
1.513,7max de esforço=empate técnico com Claude Opus 5, Gemini 3.8 Flash
1.000.000
US$ 10,00
US$ 50,00
US$ 0,25
R$ 256,27
Afechado
Vverificado
Claude Opus 5Anthropic
162,33=empate técnico com GPT-6 Astra
93,9%max de esforço=empate técnico com GPT-6 Astra
1.687,6max de esforço
12,68%high de esforço=empate técnico com Claude Fable 5.1
1.505,0high de esforço=empate técnico com Claude Fable 5.1
1.000.000
US$ 5,00
US$ 25,00
US$ 0,50
R$ 128,13
Afechado
Vverificado
GPT-5.6 SolOpenAI
162,03=empate técnico com GPT-6 Astra
93,5%max de esforço=empate técnico com GPT-6 Astra
1.617,4xhigh de esforço
9,31%xhigh de esforço
1.454,9xhigh de esforço
1.050.000
US$ 4,00
US$ 20,00
US$ 0,40
R$ 102,51
Afechado
Pparcial
GPT-5.6 TerraOpenAI
159,18
93,3%max de esforço=empate técnico com GPT-6 Astra
1.519,7xhigh de esforço
3,04%xhigh de esforço
1.446,8xhigh de esforço
1.050.000
US$ 2,00
US$ 12,00
US$ 0,20
R$ 61,50
Afechado
Pparcial
Kimi K3Moonshot AI
157,62
93,1%max de esforço=empate técnico com GPT-6 Astra
1.674,4max de esforço
7,96%max de esforço
1.476,0max de esforço
1.048.576
US$ 3,00
US$ 15,00
US$ 0,30
R$ 76,88
RKimi K3 License
Pparcial
GPT-5.6 LunaOpenAI
156,33
91,6%max de esforço
1.519,5xhigh de esforço
2,09%xhigh de esforço
1.430,3xhigh de esforço
1.050.000
US$ 0,20
US$ 1,20
US$ 0,02
R$ 6,15
Afechado
Pparcial
Grok 4.6xAI
156,33
94,0%high de esforço=empate técnico com GPT-6 Astra
1.624,9high de esforço
4,98%xhigh de esforço
não medido
500.000
US$ 2,00
US$ 6,00
US$ 0,50
R$ 30,75
Afechado
Vverificado
Claude Sonnet 5Anthropic
156,16
90,5%xhigh de esforço
1.536,9high de esforço
7,41%high de esforço
1.443,2high de esforço
1.000.000
US$ 2,00
US$ 10,00
US$ 0,20
R$ 51,25
Afechado
Vverificado
GLM-5.3Z.ai (Zhipu AI)
155,30
90,9%max de esforço
1.609,0max de esforço
3,80%max de esforço
1.473,5max de esforço
1.000.000
US$ 1,40
US$ 4,40
US$ 0,26
R$ 22,55
RGLM-5.3 License
Pparcial
Gemini 3.1 Pro PreviewGoogle DeepMind
154,90
94,4%high de esforço=empate técnico com GPT-6 Astra
1.445,5
-3,73%
1.480,1
1.048.576
US$ 2,00
US$ 12,00
não divulgado
R$ 61,50
Afechado
Pparcial
DeepSeek-V4-ProDeepSeek
149,20
91,7%max de esforço
1.581,7high de esforço
5,43%high de esforço
1.451,1
1.000.000
US$ 1,32tarifa de pico; há tarifa menor fora do picopico
US$ 3,96tarifa de pico; há tarifa menor fora do picopico
US$ 0,044
R$ 20,30
AMIT
Vverificado
MiniMax M3MiniMax
146,57
90,9%
1.487,3
-3,76%
1.435,2
1.000.000
US$ 0,30
US$ 1,20
US$ 0,06
R$ 6,15
RMiniMax Community License
Vverificado
DeepSeek-V4-FlashDeepSeek
146,26
91,0%max de esforço
1.579,6high de esforço
3,29%high de esforço
1.431,9
1.000.000
US$ 0,44tarifa de pico; há tarifa menor fora do picopico
US$ 1,32tarifa de pico; há tarifa menor fora do picopico
US$ 0,014
R$ 6,77
AMIT
Vverificado
Claude Haiku 4.5Anthropic
142,41
71,2%
não medido
não medido
não medido
200.000
US$ 1,00
US$ 5,00
US$ 0,10
R$ 25,63
Afechado
Vverificado
Mistral Medium 3.5Mistral AI
141,37
não medido
não medido
-7,16%medium de esforço
1.421,0medium de esforço
262.144
US$ 1,50
US$ 7,50
não divulgado
R$ 38,44
RModified MIT
Vverificado
Gemini 3.8 FlashGoogle DeepMind
não medido
não medido
1.567,2high de esforço
5,47%high de esforço
1.495,2high de esforço=empate técnico com Claude Fable 5.1
169,23=empate técnico com Claude Fable 5, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol
GPQA-D
95,8%max de esforço=empate técnico com Gemini 3.1 Pro Preview, Grok 4.6, Claude Opus 5, GPT-5.6 Sol, GPT-5.6 Terra, Kimi K3
Arena código
1.797,0max de esforço=empate técnico com Claude Fable 5.1
Arena agentes
não medido
Arena texto
não medido
Contexto
1.050.000
Entrada US$/M
US$ 10,00
Saída US$/M
US$ 50,00
Cache leitura
US$ 1,00
Custo R$ por 1M de saída
R$ 256,27
Pesos abertos
Afechado
Claude Fable 5
Vverificado
Índice Epoch
162,90=empate técnico com GPT-6 Astra
GPQA-D
85,9%max de esforço
Arena código
1.629,1
Arena agentes
10,23%high de esforço
Arena texto
1.494,1
Contexto
1.000.000
Entrada US$/M
US$ 10,00
Saída US$/M
US$ 50,00
Cache leitura
US$ 1,00
Custo R$ por 1M de saída
R$ 256,27
Pesos abertos
Afechado
Claude Fable 5.1
Vverificado
Índice Epoch
162,88=empate técnico com GPT-6 Astra
GPQA-D
não medido
Arena código
1.762,3max de esforço=empate técnico com GPT-6 Astra
Arena agentes
15,87%max de esforço=empate técnico com Claude Opus 5
Arena texto
1.513,7max de esforço=empate técnico com Claude Opus 5, Gemini 3.8 Flash
Contexto
1.000.000
Entrada US$/M
US$ 10,00
Saída US$/M
US$ 50,00
Cache leitura
US$ 0,25
Custo R$ por 1M de saída
R$ 256,27
Pesos abertos
Afechado
Claude Opus 5
Vverificado
Índice Epoch
162,33=empate técnico com GPT-6 Astra
GPQA-D
93,9%max de esforço=empate técnico com GPT-6 Astra
Arena código
1.687,6max de esforço
Arena agentes
12,68%high de esforço=empate técnico com Claude Fable 5.1
Arena texto
1.505,0high de esforço=empate técnico com Claude Fable 5.1
Contexto
1.000.000
Entrada US$/M
US$ 5,00
Saída US$/M
US$ 25,00
Cache leitura
US$ 0,50
Custo R$ por 1M de saída
R$ 128,13
Pesos abertos
Afechado
GPT-5.6 Sol
Pparcial
Índice Epoch
162,03=empate técnico com GPT-6 Astra
GPQA-D
93,5%max de esforço=empate técnico com GPT-6 Astra
Arena código
1.617,4xhigh de esforço
Arena agentes
9,31%xhigh de esforço
Arena texto
1.454,9xhigh de esforço
Contexto
1.050.000
Entrada US$/M
US$ 4,00
Saída US$/M
US$ 20,00
Cache leitura
US$ 0,40
Custo R$ por 1M de saída
R$ 102,51
Pesos abertos
Afechado
GPT-5.6 Terra
Pparcial
Índice Epoch
159,18
GPQA-D
93,3%max de esforço=empate técnico com GPT-6 Astra
Arena código
1.519,7xhigh de esforço
Arena agentes
3,04%xhigh de esforço
Arena texto
1.446,8xhigh de esforço
Contexto
1.050.000
Entrada US$/M
US$ 2,00
Saída US$/M
US$ 12,00
Cache leitura
US$ 0,20
Custo R$ por 1M de saída
R$ 61,50
Pesos abertos
Afechado
Kimi K3
Pparcial
Índice Epoch
157,62
GPQA-D
93,1%max de esforço=empate técnico com GPT-6 Astra
Arena código
1.674,4max de esforço
Arena agentes
7,96%max de esforço
Arena texto
1.476,0max de esforço
Contexto
1.048.576
Entrada US$/M
US$ 3,00
Saída US$/M
US$ 15,00
Cache leitura
US$ 0,30
Custo R$ por 1M de saída
R$ 76,88
Pesos abertos
RKimi K3 License
GPT-5.6 Luna
Pparcial
Índice Epoch
156,33
GPQA-D
91,6%max de esforço
Arena código
1.519,5xhigh de esforço
Arena agentes
2,09%xhigh de esforço
Arena texto
1.430,3xhigh de esforço
Contexto
1.050.000
Entrada US$/M
US$ 0,20
Saída US$/M
US$ 1,20
Cache leitura
US$ 0,02
Custo R$ por 1M de saída
R$ 6,15
Pesos abertos
Afechado
Grok 4.6
Vverificado
Índice Epoch
156,33
GPQA-D
94,0%high de esforço=empate técnico com GPT-6 Astra
Arena código
1.624,9high de esforço
Arena agentes
4,98%xhigh de esforço
Arena texto
não medido
Contexto
500.000
Entrada US$/M
US$ 2,00
Saída US$/M
US$ 6,00
Cache leitura
US$ 0,50
Custo R$ por 1M de saída
R$ 30,75
Pesos abertos
Afechado
Claude Sonnet 5
Vverificado
Índice Epoch
156,16
GPQA-D
90,5%xhigh de esforço
Arena código
1.536,9high de esforço
Arena agentes
7,41%high de esforço
Arena texto
1.443,2high de esforço
Contexto
1.000.000
Entrada US$/M
US$ 2,00
Saída US$/M
US$ 10,00
Cache leitura
US$ 0,20
Custo R$ por 1M de saída
R$ 51,25
Pesos abertos
Afechado
GLM-5.3
Pparcial
Índice Epoch
155,30
GPQA-D
90,9%max de esforço
Arena código
1.609,0max de esforço
Arena agentes
3,80%max de esforço
Arena texto
1.473,5max de esforço
Contexto
1.000.000
Entrada US$/M
US$ 1,40
Saída US$/M
US$ 4,40
Cache leitura
US$ 0,26
Custo R$ por 1M de saída
R$ 22,55
Pesos abertos
RGLM-5.3 License
Gemini 3.1 Pro Preview
Pparcial
Índice Epoch
154,90
GPQA-D
94,4%high de esforço=empate técnico com GPT-6 Astra
Arena código
1.445,5
Arena agentes
-3,73%
Arena texto
1.480,1
Contexto
1.048.576
Entrada US$/M
US$ 2,00
Saída US$/M
US$ 12,00
Cache leitura
não divulgado
Custo R$ por 1M de saída
R$ 61,50
Pesos abertos
Afechado
DeepSeek-V4-Pro
Vverificado
Índice Epoch
149,20
GPQA-D
91,7%max de esforço
Arena código
1.581,7high de esforço
Arena agentes
5,43%high de esforço
Arena texto
1.451,1
Contexto
1.000.000
Entrada US$/M
US$ 1,32tarifa de pico; há tarifa menor fora do picopico
Saída US$/M
US$ 3,96tarifa de pico; há tarifa menor fora do picopico
Cache leitura
US$ 0,044
Custo R$ por 1M de saída
R$ 20,30
Pesos abertos
AMIT
MiniMax M3
Vverificado
Índice Epoch
146,57
GPQA-D
90,9%
Arena código
1.487,3
Arena agentes
-3,76%
Arena texto
1.435,2
Contexto
1.000.000
Entrada US$/M
US$ 0,30
Saída US$/M
US$ 1,20
Cache leitura
US$ 0,06
Custo R$ por 1M de saída
R$ 6,15
Pesos abertos
RMiniMax Community License
DeepSeek-V4-Flash
Vverificado
Índice Epoch
146,26
GPQA-D
91,0%max de esforço
Arena código
1.579,6high de esforço
Arena agentes
3,29%high de esforço
Arena texto
1.431,9
Contexto
1.000.000
Entrada US$/M
US$ 0,44tarifa de pico; há tarifa menor fora do picopico
Saída US$/M
US$ 1,32tarifa de pico; há tarifa menor fora do picopico
Cache leitura
US$ 0,014
Custo R$ por 1M de saída
R$ 6,77
Pesos abertos
AMIT
Claude Haiku 4.5
Vverificado
Índice Epoch
142,41
GPQA-D
71,2%
Arena código
não medido
Arena agentes
não medido
Arena texto
não medido
Contexto
200.000
Entrada US$/M
US$ 1,00
Saída US$/M
US$ 5,00
Cache leitura
US$ 0,10
Custo R$ por 1M de saída
R$ 25,63
Pesos abertos
Afechado
Mistral Medium 3.5
Vverificado
Índice Epoch
141,37
GPQA-D
não medido
Arena código
não medido
Arena agentes
-7,16%medium de esforço
Arena texto
1.421,0medium de esforço
Contexto
262.144
Entrada US$/M
US$ 1,50
Saída US$/M
US$ 7,50
Cache leitura
não divulgado
Custo R$ por 1M de saída
R$ 38,44
Pesos abertos
RModified MIT
Gemini 3.8 Flash
Vverificado
Índice Epoch
não medido
GPQA-D
não medido
Arena código
1.567,2high de esforço
Arena agentes
5,47%high de esforço
Arena texto
1.495,2high de esforço=empate técnico com Claude Fable 5.1
Contexto
1.048.576
Entrada US$/M
US$ 0,75
Saída US$/M
US$ 3,75
Cache leitura
não divulgado
Custo R$ por 1M de saída
R$ 19,22
Pesos abertos
Afechado
Mistral Large 3
Vverificado
Índice Epoch
não medido
GPQA-D
não medido
Arena código
não medido
Arena agentes
não medido
Arena texto
1.427,7
Contexto
262.144
Entrada US$/M
US$ 0,50
Saída US$/M
US$ 1,50
Cache leitura
não divulgado
Custo R$ por 1M de saída
R$ 7,69
Pesos abertos
AApache 2.0
Mistral Small 4
Pparcial
Índice Epoch
não medido
GPQA-D
não medido
Arena código
não medido
Arena agentes
não medido
Arena texto
não medido
Contexto
256.000
Entrada US$/M
US$ 0,15
Saída US$/M
US$ 0,60
Cache leitura
não divulgado
Custo R$ por 1M de saída
R$ 3,08
Pesos abertos
AApache 2.0
Muse Glimmer-30B
Vverificado
Índice Epoch
não medido
GPQA-D
não medido
Arena código
1.359,6
Arena agentes
não medido
Arena texto
não medido
Contexto
131.072
Entrada US$/M
sem preço de API oficial
Saída US$/M
sem preço de API oficial
Cache leitura
sem preço de API oficial
Custo R$ por 1M de saída
sem preço de API oficial
Pesos abertos
AApache 2.0
Muse Spark 1.3
Vverificado
Índice Epoch
não medido
GPQA-D
não medido
Arena código
1.622,5xhigh de esforço
Arena agentes
não medido
Arena texto
não medido
Contexto
1.048.576
Entrada US$/M
US$ 1,25
Saída US$/M
US$ 4,25
Cache leitura
US$ 0,15
Custo R$ por 1M de saída
R$ 21,78
Pesos abertos
Afechado
Qwen3.8-2.4T-A95B
Pparcial
Índice Epoch
não medido
GPQA-D
não medido
Arena código
não medido
Arena agentes
não medido
Arena texto
não medido
Contexto
262.144
Entrada US$/M
sem preço de API oficial
Saída US$/M
sem preço de API oficial
Cache leitura
sem preço de API oficial
Custo R$ por 1M de saída
sem preço de API oficial
Pesos abertos
RQwen3.8-Max License
Qwen3.8-Max
Vverificado
Índice Epoch
não medido
GPQA-D
92,7%xhigh de esforço
Arena código
1.686,1max de esforço
Arena agentes
5,51%max de esforço
Arena texto
1.479,9max de esforço
Contexto
1.000.000
Entrada US$/M
US$ 2,00
Saída US$/M
US$ 6,00
Cache leitura
não divulgado
Custo R$ por 1M de saída
R$ 30,75
Pesos abertos
Afechado
O que cada coluna mede
Índice Epoch
Epoch Capabilities Index. medição independente. 17 modelos com resultado. a fonte publica intervalo, e 15 dos 16 pares vizinhos se sobrepõem: ordenar por esta coluna não separa esses modelos. a marca de empate na célula é reservada ao topo, entre o líder e quem cruza o intervalo dele. Fonte: Epoch AI, AI Benchmarking Hub (epoch_capabilities_index/eci_scores.csv do benchmark_data.zip), lido em 6 set 2026
GPQA-D
GPQA Diamond. versão diamond. medição independente. 16 modelos com resultado. a fonte publica intervalo, e 13 dos 15 pares vizinhos se sobrepõem: ordenar por esta coluna não separa esses modelos. a marca de empate na célula é reservada ao topo, entre o líder e quem cruza o intervalo dele. Fonte: Epoch AI, AI Benchmarking Hub (gpqa_diamond.csv do benchmark_data.zip), lido em 6 set 2026
Arena código
Arena WebDev (Code Arena). versão config webdev, split latest. preferência humana. 19 modelos com resultado. a fonte publica intervalo, e 10 dos 18 pares vizinhos se sobrepõem: ordenar por esta coluna não separa esses modelos. a marca de empate na célula é reservada ao topo, entre o líder e quem cruza o intervalo dele. Fonte: LMArena, dataset lmarena-ai/leaderboard-dataset (config webdev, split latest), lido em 6 set 2026
Arena agentes
Arena Agent. versão config agent, split latest. preferência humana. 17 modelos com resultado. a fonte publica intervalo, e 14 dos 16 pares vizinhos se sobrepõem: ordenar por esta coluna não separa esses modelos. a marca de empate na célula é reservada ao topo, entre o líder e quem cruza o intervalo dele. Fonte: LMArena, dataset lmarena-ai/leaderboard-dataset (config agent, split latest), lido em 6 set 2026
Arena texto
Arena Text. versão dataset lmarena-ai/leaderboard-dataset, config text, split latest. preferência humana. 17 modelos com resultado. a fonte publica intervalo, e 14 dos 16 pares vizinhos se sobrepõem: ordenar por esta coluna não separa esses modelos. a marca de empate na célula é reservada ao topo, entre o líder e quem cruza o intervalo dele. Fonte: LMArena, dataset lmarena-ai/leaderboard-dataset (config text, split latest), lido em 6 set 2026
Custo R$ por 1M de saída
custo_brl_por_milhao_de_saida = preço de saída em US$ x cotação PTAX. Cotação de R$ 5,1253 por US$ 1,00, de 4 set 2026, 13:03:59, do Banco Central. IOF e spread ficam fora do cálculo.
Comparar preço por milhão de tokens entre fabricantes sem considerar o tokenizador distorce a conta.
A coluna em reais converte o preço de saída publicado pelo fabricante pela cotação PTAX de venda do Banco Central, com data e hora ao lado do número. Ela não usa perfil de carga: é conversão de preço de tabela, não estimativa de conta mensal. A conta mensal por caso de uso fica na seção de custo por caso.
Benchmarks comparáveis
Cada grupo reúne só números que podem ser comparados: mesma versão, mesma fonte quando o placar é do fabricante, ou medição independente. Grupo com menos de três modelos não vira gráfico, sai como lista.
Mesmo nome, versão diferentePlacar com o mesmo nome pode medir coisas diferentes conforme a versão e as regras. Os grupos abaixo não são comparáveis entre si, e é por isso que a página troca de grupo em vez de juntar tudo numa lista só.
ARC-AGI-2 aparece nesta lista em mais de um recorte: 1. Não são comparáveis entre si.
Imedição independenteversão 2% de acertoEpoch AI, AI Benchmarking Hub (arc_agi_2_external.csv do benchmark_data.zip), 03/09/2026
Ver os mesmos valores em tabela
ARC-AGI-2. versão 2. % de acerto. medição independente
Modelo
Configuração
Valor
Intervalo
Evidência
GPT-6 Astra
max
95,0%
sem intervalo publicado
Imedição independente
GPT-6 Astra
xhigh
93,3%
sem intervalo publicado
Imedição independente
GPT-5.6 Sol
max
92,5%
sem intervalo publicado
Imedição independente
GPT-6 Astra
high
92,1%
sem intervalo publicado
Imedição independente
GPT-6 Astra
medium
92,1%
sem intervalo publicado
Imedição independente
Claude Opus 5
max
90,4%
sem intervalo publicado
Imedição independente
Claude Fable 5.1
max
90,0%
sem intervalo publicado
Imedição independente
Claude Fable 5.1
xhigh
90,0%
sem intervalo publicado
Imedição independente
GPT-5.6 Sol
xhigh
90,0%
sem intervalo publicado
Imedição independente
Claude Fable 5
max
89,2%
sem intervalo publicado
Imedição independente
Claude Fable 5.1
high
88,8%
sem intervalo publicado
Imedição independente
Claude Fable 5
xhigh
88,3%
sem intervalo publicado
Imedição independente
Claude Opus 5
high
88,3%
sem intervalo publicado
Imedição independente
Claude Fable 5
high
87,5%
sem intervalo publicado
Imedição independente
Claude Fable 5.1
medium
86,3%
sem intervalo publicado
Imedição independente
GPT-5.6 Sol
high
85,4%
sem intervalo publicado
Imedição independente
GPT-6 Astra
low
85,4%
sem intervalo publicado
Imedição independente
GPT-5.6 Terra
max
83,9%
sem intervalo publicado
Imedição independente
Claude Fable 5
medium
82,5%
sem intervalo publicado
Imedição independente
Claude Fable 5.1
low
78,3%
sem intervalo publicado
Imedição independente
Gemini 3.1 Pro Preview
não informada
77,1%
sem intervalo publicado
Imedição independente
Claude Fable 5
low
76,8%
sem intervalo publicado
Imedição independente
GPT-5.6 Terra
xhigh
74,2%
sem intervalo publicado
Imedição independente
GPT-5.6 Sol
medium
67,1%
sem intervalo publicado
Imedição independente
GPT-5.6 Terra
high
67,1%
sem intervalo publicado
Imedição independente
Grok 4.6
xhigh
67,1%
sem intervalo publicado
Imedição independente
Grok 4.6
high
65,1%
sem intervalo publicado
Imedição independente
DeepSeek-V4-Flash
max
61,4%
sem intervalo publicado
Imedição independente
DeepSeek-V4-Pro
max
61,3%
sem intervalo publicado
Imedição independente
Grok 4.6
medium
61,3%
sem intervalo publicado
Imedição independente
Kimi K3
max
60,4%
sem intervalo publicado
Imedição independente
DeepSeek-V4-Pro
high
59,7%
sem intervalo publicado
Imedição independente
GPT-6 Astra
padrão
59,6%
sem intervalo publicado
Imedição independente
GPT-5.6 Luna
max
59,5%
sem intervalo publicado
Imedição independente
DeepSeek-V4-Pro
low
56,3%
sem intervalo publicado
Imedição independente
DeepSeek-V4-Flash
high
56,0%
sem intervalo publicado
Imedição independente
Kimi K3
high
55,0%
sem intervalo publicado
Imedição independente
GPT-5.6 Luna
xhigh
47,6%
sem intervalo publicado
Imedição independente
DeepSeek-V4-Flash
low
46,0%
sem intervalo publicado
Imedição independente
GPT-5.6 Sol
low
42,5%
sem intervalo publicado
Imedição independente
GPT-5.6 Terra
medium
37,5%
sem intervalo publicado
Imedição independente
GPT-5.6 Luna
high
29,3%
sem intervalo publicado
Imedição independente
Grok 4.6
low
27,6%
sem intervalo publicado
Imedição independente
GPT-5.6 Terra
low
18,8%
sem intervalo publicado
Imedição independente
Kimi K3
low
12,4%
sem intervalo publicado
Imedição independente
GPT-5.6 Luna
medium
7,4%
sem intervalo publicado
Imedição independente
GPT-5.6 Luna
low
5,1%
sem intervalo publicado
Imedição independente
Claude Haiku 4.5
não informada
4,0%
sem intervalo publicado
Imedição independente
DeepSeek-V4-Flash
padrão
2,1%
sem intervalo publicado
Imedição independente
DeepSeek-V4-Pro
padrão
0,8%
sem intervalo publicado
Imedição independente
Barra maior é resultado melhor.
A faixa em volta da barra é o intervalo publicado pela fonte. Quando duas faixas se cruzam, a página marca empate técnico.
O eixo começa no zero em todos os grupos. Em placar de pontos, isso deixa as barras parecidas de propósito: cortar o eixo exageraria diferenças que o próprio intervalo diz não serem significativas.
Grupos com só dois modelos (62)
Estes grupos comparam apenas dois modelos neste snapshot. Sairiam como gráfico enganoso, então aparecem como lista, com a fonte de cada valor. Grupo com um único modelo não é comparação e fica fora desta lista.
BrowseComp, versão não declaradaFreportado pelo fabricante
DeepSeek-V4-Pro: 83,4%DeepSeek-V4-Flash: 73,2%
GPQA Diamond, versão diamondFreportado pelo fabricante
DeepSeek-V4-Pro: 90,1%DeepSeek-V4-Flash: 88,1%
Humanity's Last Exam, versão full, com ferramentasFreportado pelo fabricante
DeepSeek-V4-Pro: 48,2%DeepSeek-V4-Flash: 45,1%
LiveCodeBench, versão não declaradaFreportado pelo fabricante
DeepSeek-V4-Pro: 93,5%DeepSeek-V4-Flash: 91,6%
MCP-Atlas, versão não declaradaFreportado pelo fabricante
DeepSeek-V4-Pro: 73,6%DeepSeek-V4-Flash: 69,0%
MMLU-Pro, versão não declaradaFreportado pelo fabricante
DeepSeek-V4-Pro: 87,5%DeepSeek-V4-Flash: 86,2%
SimpleQA-Verified, versão não declaradaFreportado pelo fabricante
DeepSeek-V4-Pro: 57,9%DeepSeek-V4-Flash: 34,1%
SWE-bench Pro, versão pro (publico)Freportado pelo fabricante
DeepSeek-V4-Pro: 55,4%DeepSeek-V4-Flash: 52,6%
SWE-bench Verified, versão verifiedFreportado pelo fabricante
DeepSeek-V4-Pro: 80,6%DeepSeek-V4-Flash: 79,0%
Terminal-Bench, versão 2.0Freportado pelo fabricante
DeepSeek-V4-Pro: 67,9%DeepSeek-V4-Flash: 56,9%
Toolathlon, versão não declaradaFreportado pelo fabricante
DeepSeek-V4-Pro: 51,8%DeepSeek-V4-Flash: 47,8%
SWE-bench Verified, versão verifiedImedição independente
DeepSeek-V4-Pro: 77,6%Gemini 3.1 Pro Preview: 75,6%
BioMysteryBench (human difficult), versão human difficultCmedido por concorrente
Claude Opus 5: 49,4%Claude Sonnet 5: 34,1%
BioMysteryBench (human solvable), versão human solvableCmedido por concorrente
Claude Opus 5: 90,1%Claude Sonnet 5: 87,5%
CharXiv Reasoning, versão não declaradaCmedido por concorrente
Claude Opus 5: 83,7%Claude Sonnet 5: 70,1%
DeepSWE, versão 1.1Cmedido por concorrente
Claude Opus 5: 74,0%Claude Sonnet 5: 53,8%
GDP.PDF, versão não declaradaCmedido por concorrente
Claude Opus 5: 37,0%Claude Sonnet 5: 28,0%
GDPval-AA, versão v2Cmedido por concorrente
Claude Opus 5: 1.824Claude Sonnet 5: 1.584
Harvey's Legal Agent Benchmark, versão não declaradaCmedido por concorrente
Claude Opus 5: 6,7%Claude Sonnet 5: 5,0%
HLE-Verified, versão verifiedCmedido por concorrente
Claude Opus 5: 54,4%Claude Sonnet 5: 31,0%
LABBench2, versão não declaradaCmedido por concorrente
Claude Opus 5: 84,2%Claude Sonnet 5: 80,1%
LVBench, versão não declaradaCmedido por concorrente
Claude Opus 5: 75,4%Claude Sonnet 5: 68,5%
OSWorld 2.0, versão 2.0, partial scoreCmedido por concorrente
Claude Opus 5: 75,4%Claude Sonnet 5: 42,6%
Terminal-Bench, versão 2.1Cmedido por concorrente
Claude Opus 5: 89,1%Claude Sonnet 5: 80,4%
Terminal-Bench, versão 4.0Cmedido por concorrente
Claude Opus 5: 51,8%Claude Sonnet 5: 12,4%
Vals Finance Agent, versão v2Cmedido por concorrente
Claude Opus 5: 58,6Claude Sonnet 5: 53,9
BioMysteryBench (human difficult), versão human difficultCmedido por concorrente
GPT-5.6 Terra: 49,4%GPT-5.6 Sol: 44,7%
BioMysteryBench (human solvable), versão human solvableCmedido por concorrente
GPT-5.6 Terra: 83,8%GPT-5.6 Sol: 79,5%
CharXiv Reasoning, versão não declaradaCmedido por concorrente
GPT-5.6 Terra: 85,9%GPT-5.6 Sol: 85,8%
DeepSWE, versão 1.1Cmedido por concorrente
GPT-5.6 Sol: 72,7%GPT-5.6 Terra: 69,6%
GDP.PDF, versão não declaradaCmedido por concorrente
GPT-5.6 Sol: 40,0%GPT-5.6 Terra: 29,0%
GDPval-AA, versão v2Cmedido por concorrente
GPT-5.6 Sol: 1.710GPT-5.6 Terra: 1.528
Harvey's Legal Agent Benchmark, versão não declaradaCmedido por concorrente
GPT-5.6 Sol: 2,5%GPT-5.6 Terra: 0,8%
HLE-Verified, versão verifiedCmedido por concorrente
GPT-5.6 Sol: 54,5%GPT-5.6 Terra: 51,1%
LABBench2, versão não declaradaCmedido por concorrente
GPT-5.6 Sol: 82,1%GPT-5.6 Terra: 81,2%
LVBench, versão não declaradaCmedido por concorrente
GPT-5.6 Sol: 82,1%GPT-5.6 Terra: 78,9%
OSWorld 2.0, versão 2.0, partial scoreCmedido por concorrente
GPT-5.6 Sol: 62,6%GPT-5.6 Terra: 50,2%
Terminal-Bench, versão 2.1Cmedido por concorrente
GPT-5.6 Sol: 88,8%GPT-5.6 Terra: 87,4%
Terminal-Bench, versão 4.0Cmedido por concorrente
GPT-5.6 Sol: 37,3%GPT-5.6 Terra: 23,6%
Vals Finance Agent, versão v2Cmedido por concorrente
GPT-5.6 Terra: 54,4GPT-5.6 Sol: 53,8
Agents' Last Exam (Score), metrica score do leaderboard oficialCmedido por concorrente
Claude Opus 5: 55,5Claude Fable 5: 48,7
BrowseComp, versão não declaradaCmedido por concorrente
Claude Opus 5: 90,8%Claude Fable 5: 87,4%
Agents' Last Exam (Score), metrica score do leaderboard oficialFreportado pelo fabricante
GPT-6 Astra: 59,3GPT-5.6 Sol: 53,6
ARC-AGI-1, versão 1Freportado pelo fabricante
GPT-6 Astra: 98,5%GPT-5.6 Sol: 97,5%
ARC-AGI-2, versão 2Freportado pelo fabricante
GPT-6 Astra: 95,0%GPT-5.6 Sol: 92,5%
ARC-AGI-3, versão 3Freportado pelo fabricante
GPT-6 Astra: 99,9%GPT-5.6 Sol: 7,8%
AutomationBenchFreportado pelo fabricante
GPT-6 Astra: 41,4%GPT-5.6 Sol: 18,1%
BenchCAD, versão não declaradaFreportado pelo fabricante
GPT-6 Astra: 95,9GPT-5.6 Sol: 83,3
BrowseComp, versão não declaradaFreportado pelo fabricante
GPT-6 Astra: 91,5%GPT-5.6 Sol: 90,4%
DeepSWE, versão 1.1Freportado pelo fabricante
GPT-6 Astra: 74,1%GPT-5.6 Sol: 72,7%
ExploitBench, versão não declaradaFreportado pelo fabricante
GPT-6 Astra: 100,0%GPT-5.6 Sol: 78,5%
ExploitGym, versão não declaradaFreportado pelo fabricante
GPT-6 Astra: 42,4%GPT-5.6 Sol: 30,3%
FrontierCode Extended, versão 1.1Freportado pelo fabricante
GPT-6 Astra: 64,5GPT-5.6 Sol: 60,6
FrontierCode Main, versão 1.1Freportado pelo fabricante
GPT-6 Astra: 53,3GPT-5.6 Sol: 47,5
GPQA Diamond, versão diamondFreportado pelo fabricante
GPT-6 Astra: 96,0%GPT-5.6 Sol: 94,6%
HealthBench Professional, versão não declaradaFreportado pelo fabricante
GPT-6 Astra: 63,4GPT-5.6 Sol: 60,5
OpenAI MRCR v2, 8-needle, 256K a 512K, versão v2, 8-needle, 256K-512KFreportado pelo fabricante
GPT-6 Astra: 100,0%GPT-5.6 Sol: 91,5%
OpenAI MRCR v2, 8-needle, 512K a 1M, versão v2, 8-needle, 512K-1MFreportado pelo fabricante
ScreenSpot-Pro, versão não declaradaFreportado pelo fabricante
GPT-6 Astra: 92,7%GPT-5.6 Sol: 76,9%
Terminal-Bench, versão 4.0Freportado pelo fabricante
GPT-6 Astra: 57,9%GPT-5.6 Sol: 37,3%
Terminal-Bench Science, versão 0.1Freportado pelo fabricante
GPT-6 Astra: 64,6%GPT-5.6 Sol: 22,4%
Este benchmark aparece em mais de um recorte neste snapshot. Compare dentro do grupo escolhido, nunca entre grupos.
Preço contra qualidade
Fronteira de Pareto
Cada ponto é um modelo. A posição horizontal é o preço combinado por milhão de tokens, e a vertical é o resultado no eixo de qualidade que você escolher. A linha tracejada é a fronteira de Pareto: nela ficam os modelos que nenhum outro do gráfico supera nas duas coisas ao mesmo tempo, ou seja, para chegar a um resultado melhor é preciso pagar mais. Ponto abaixo da linha custa mais do que outro modelo que entrega o mesmo, ou entrega menos pelo mesmo preço.
No ar: Epoch Capabilities IndexImedição independenteEpoch AI, AI Benchmarking Hub (epoch_capabilities_index/eci_scores.csv do benchmark_data.zip), 3 set 2026
Ver os mesmos números em tabela
Epoch Capabilities Index. índice. medição independente. USD por milhão de tokens
Modelo
Preço combinado
Resultado
Intervalo
Evidência
Observação
GPT-6 Astra
US$ 20,00
169,23
164,85 a 174,02
Imedição independente
empate técnico com Claude Fable 5, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Solfronteira
Claude Fable 5
US$ 20,00
162,9
160,17 a 166,77
Imedição independente
empate técnico com GPT-6 Astra, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol, GPT-5.6 Terra
Claude Fable 5.1
US$ 20,00
162,88
160,1 a 166,34
Imedição independente
empate técnico com GPT-6 Astra, Claude Fable 5, Claude Opus 5, GPT-5.6 Sol, GPT-5.6 Terra, Kimi K3
Claude Opus 5
US$ 10,00
162,33
159,75 a 165,78
Imedição independente
empate técnico com GPT-6 Astra, Claude Fable 5, Claude Fable 5.1, GPT-5.6 Sol, GPT-5.6 Terra, Kimi K3fronteira
GPT-5.6 Sol
US$ 8,00
162,03
159,66 a 165
Imedição independente
empate técnico com GPT-6 Astra, Claude Fable 5, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Terra, Kimi K3fronteira
GPT-5.6 Terra
US$ 4,50
159,18
156,6 a 161,61
Imedição independente
empate técnico com Claude Fable 5, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol, Kimi K3, GPT-5.6 Luna, Grok 4.6, Claude Sonnet 5, GLM-5.3, Gemini 3.1 Pro Previewfronteira
Kimi K3
US$ 6,00
157,62
155,06 a 160,13
Imedição independente
empate técnico com Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Grok 4.6, Claude Sonnet 5, GLM-5.3, Gemini 3.1 Pro Preview
GPT-5.6 Luna
US$ 0,45
156,33
153,96 a 158,68
Imedição independente
empate técnico com GPT-5.6 Terra, Kimi K3, Grok 4.6, Claude Sonnet 5, GLM-5.3, Gemini 3.1 Pro Previewfronteira
Grok 4.6
US$ 3,00
156,33
154,53 a 158,44
Imedição independente
empate técnico com GPT-5.6 Terra, Kimi K3, GPT-5.6 Luna, Claude Sonnet 5, GLM-5.3, Gemini 3.1 Pro Preview
Claude Sonnet 5
US$ 4,00
156,16
153,77 a 158,36
Imedição independente
empate técnico com GPT-5.6 Terra, Kimi K3, GPT-5.6 Luna, Grok 4.6, GLM-5.3, Gemini 3.1 Pro Preview
GLM-5.3
US$ 2,15
155,3
153,14 a 157,68
Imedição independente
empate técnico com GPT-5.6 Terra, Kimi K3, GPT-5.6 Luna, Grok 4.6, Claude Sonnet 5, Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
US$ 4,50
154,9
152,51 a 157,46
Imedição independente
empate técnico com GPT-5.6 Terra, Kimi K3, GPT-5.6 Luna, Grok 4.6, Claude Sonnet 5, GLM-5.3
DeepSeek-V4-Pro
US$ 1,98
149,2
147,54 a 150,69
Imedição independente
empate técnico com MiniMax M3, DeepSeek-V4-Flash
MiniMax M3
US$ 0,525
146,57
142,3 a 149,34
Imedição independente
empate técnico com DeepSeek-V4-Pro, DeepSeek-V4-Flash, Claude Haiku 4.5, Mistral Medium 3.5
DeepSeek-V4-Flash
US$ 0,66
146,26
143,88 a 148,29
Imedição independente
empate técnico com DeepSeek-V4-Pro, MiniMax M3, Claude Haiku 4.5
Claude Haiku 4.5
US$ 2,00
142,41
139,61 a 144,02
Imedição independente
empate técnico com MiniMax M3, DeepSeek-V4-Flash, Mistral Medium 3.5
Mistral Medium 3.5
US$ 3,00
141,37
138,98 a 143,44
Imedição independente
empate técnico com MiniMax M3, Claude Haiku 4.5
A linha liga os modelos que ninguém supera nas duas coisas ao mesmo tempo: para cada ponto dela, não existe neste gráfico outro modelo mais barato e melhor neste eixo.
A etiqueta de evidência aparece pela cor e pela forma do ponto, nunca só pela cor. Neste eixo, cada ponto é um círculo: medição independente.
O eixo do preço é logarítmico: cada potência de dez recebe três marcas, em um, dois e cinco, porque a tabela vai de centavos a dezenas de dólares por milhão de tokens.
O eixo de qualidade não começa no zero, e sim no menor valor deste grupo: em placar de pontos Elo o zero não existe na escala. Compare pela barra de erro, não pela distância até a base.
A haste vertical é o intervalo publicado pela fonte. Quando dois intervalos se cruzam, a tabela marca empate técnico.
Cada ponto recebe foco pelo teclado e abre a mesma ficha que o mouse mostra.
Cada eixo é um grupo comparável só. Medição independente e número reportado pelo fabricante nunca dividem o mesmo eixo.
Custo por caso de uso
Custo mensal em reais para três volumes, calculado no momento em que a página é montada a partir do preço publicado pelo fabricante e do perfil de carga de cada caso. O perfil de carga é premissa da X-Apps e ainda não foi aprovado: por isso todo valor em reais aparece marcado, com a fórmula, as premissas e a cotação PTAX de venda do Banco Central com data e hora ao lado.
Melhor modelo de IA para chatbot: custo em reais e qualidade
Atendimento com system prompt fixo e histórico curto por conversa. O cache cobre o system prompt. Não inclui busca, ferramentas nem custo de infraestrutura. A escrita de cache fica fora do cálculo, então o custo de carga com cache alto é um piso.
Custo mensal em reais por modelo e por volume, com a marca de premissa a aprovar em cada valor.
Modelo
volume pequeno
volume médio
volume grande
MiniMax M3provedor minimax
R$ 30,44!premissa a aprovar
R$ 304,44!premissa a aprovar
R$ 3.044,43!premissa a aprovar
DeepSeek-V4-Flashprovedor deepseek, tarifa de pico
R$ 34,47!premissa a aprovar
R$ 344,73!premissa a aprovar
R$ 3.447,28!premissa a aprovar
Mistral Large 3provedor mistral, sem preço de cache: fator 1
R$ 61,50!premissa a aprovar
R$ 615,04!premissa a aprovar
R$ 6.150,36!premissa a aprovar
Fórmulacusto_mensal_usd = interacoes_por_mes x (tokens_entrada_por_interacao x preco_entrada x (1 - proporcao_cache x (1 - fator_cache)) + tokens_saida_por_interacao x preco_saida) / 1000000; custo_mensal_brl = custo_mensal_usd x meta.cotacao.valor; para agentes e código, interacoes_por_mes = tarefas_por_mes x chamadas_por_tarefa Regras assumidas por esta fórmula em regras_de_custo: fator_cache, escrita_de_cache, horario_de_pico e provedor_por_modelo.MiniMax M3, volume médio: custo_mensal_usd = 100.000 x (1.500 x 0,3 x (1 - 0,6 x (1 - 0,2)) + 300 x 1,2) / 1000000; custo_mensal_brl = 59,4 x 5,1253
Cotação usadaR$ 5,13em 04/09/2026, 13:03:59
Premissas de carga deste caso
Tokens de entrada por interação
1.500 tokens!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0 (system prompt mais histórico curto)
Tokens de saída por interação
300 tokens!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fração da entrada servida por cache
0,6 fracao da entrada servida por cache!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fator de cache
derivado do preço de cache de cada modelo razao cache_leitura / entrada, derivada por modelo em precos.json; 1 quando o modelo não publica preço de cache, ou seja, sem desconto (ver regras_de_custo.fator_cache). Nunca 0.!premissa a aprovarderivada do dataset, não e premissa numerica; regra corrigida na fase 0c: a unidade anterior dizia 'null quando o modelo não tem cache' e o null lido como zero aplicava desconto integral sobre a fracao em cache
Volume mensal
10.000, 100.000, 1.000.000 interações por mês [pequeno, médio, grande]!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
com escrita de cache fora da conta, este valor é um piso
Melhor modelo de IA para RAG: custo em reais e qualidade
Consulta sobre base documental interna com recuperação de trechos. O contexto recuperado muda a cada consulta, então o cache cobre só o system prompt. Embeddings e indexação ficam fora do cálculo na v1. A escrita de cache fica fora do cálculo, então o custo de carga com cache alto é um piso.
Custo mensal em reais por modelo e por volume, com a marca de premissa a aprovar em cada valor.
Modelo
volume pequeno
volume médio
volume grande
MiniMax M3provedor minimax
R$ 47,36!premissa a aprovar
R$ 473,58!premissa a aprovar
R$ 4.735,78!premissa a aprovar
DeepSeek-V4-Flashprovedor deepseek, tarifa de pico
R$ 61,53!premissa a aprovar
R$ 615,34!premissa a aprovar
R$ 6.153,44!premissa a aprovar
Mistral Large 3provedor mistral, sem preço de cache: fator 1
R$ 92,26!premissa a aprovar
R$ 922,55!premissa a aprovar
R$ 9.225,54!premissa a aprovar
Fórmulacusto_mensal_usd = interacoes_por_mes x (tokens_entrada_por_interacao x preco_entrada x (1 - proporcao_cache x (1 - fator_cache)) + tokens_saida_por_interacao x preco_saida) / 1000000; custo_mensal_brl = custo_mensal_usd x meta.cotacao.valor; para agentes e código, interacoes_por_mes = tarefas_por_mes x chamadas_por_tarefa Regras assumidas por esta fórmula em regras_de_custo: fator_cache, escrita_de_cache, horario_de_pico e provedor_por_modelo.MiniMax M3, volume médio: custo_mensal_usd = 50.000 x (6.000 x 0,3 x (1 - 0,3 x (1 - 0,2)) + 400 x 1,2) / 1000000; custo_mensal_brl = 92,4 x 5,1253
Cotação usadaR$ 5,13em 04/09/2026, 13:03:59
Premissas de carga deste caso
Tokens de entrada por interação
6.000 tokens!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0 (pergunta, system prompt e contexto recuperado)
Tokens de saída por interação
400 tokens!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fração da entrada servida por cache
0,3 fracao da entrada servida por cache!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fator de cache
derivado do preço de cache de cada modelo razao cache_leitura / entrada, derivada por modelo em precos.json; 1 quando o modelo não publica preço de cache, ou seja, sem desconto (ver regras_de_custo.fator_cache). Nunca 0.!premissa a aprovarderivada do dataset, não e premissa numerica; regra corrigida na fase 0c: a unidade anterior dizia 'null quando o modelo não tem cache' e o null lido como zero aplicava desconto integral sobre a fracao em cache
Volume mensal
5.000, 50.000, 500.000 consultas por mês [pequeno, médio, grande]!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
com escrita de cache fora da conta, este valor é um piso
Melhor modelo de IA para agentes: custo em reais e qualidade
Tarefa multi-etapa com ferramentas, em que o contexto cresce a cada chamada e o cache cobre o prefixo repetido. Custo de ferramentas externas e de execução fica fora. A escrita de cache fica fora do cálculo, então o custo de carga com cache alto é um piso.
Custo mensal em reais por modelo e por volume, com a marca de premissa a aprovar em cada valor.
Modelo
volume pequeno
volume médio
volume grande
MiniMax M3provedor minimax
R$ 123,99!premissa a aprovar
R$ 1.239,91!premissa a aprovar
R$ 12.399,13!premissa a aprovar
DeepSeek-V4-Flashprovedor deepseek, tarifa de pico
R$ 134,72!premissa a aprovar
R$ 1.347,17!premissa a aprovar
R$ 13.471,75!premissa a aprovar
Mistral Large 3provedor mistral, sem preço de cache: fator 1
R$ 319,82!premissa a aprovar
R$ 3.198,19!premissa a aprovar
R$ 31.981,87!premissa a aprovar
Fórmulacusto_mensal_usd = interacoes_por_mes x (tokens_entrada_por_interacao x preco_entrada x (1 - proporcao_cache x (1 - fator_cache)) + tokens_saida_por_interacao x preco_saida) / 1000000; custo_mensal_brl = custo_mensal_usd x meta.cotacao.valor; para agentes e código, interacoes_por_mes = tarefas_por_mes x chamadas_por_tarefa Regras assumidas por esta fórmula em regras_de_custo: fator_cache, escrita_de_cache, horario_de_pico e provedor_por_modelo.MiniMax M3, volume médio: custo_mensal_usd = 120.000 x (8.000 x 0,3 x (1 - 0,7 x (1 - 0,2)) + 800 x 1,2) / 1000000; custo_mensal_brl = 241,92 x 5,1253
Cotação usadaR$ 5,13em 04/09/2026, 13:03:59
Premissas de carga deste caso
Tokens de entrada por interação
8.000 tokens por chamada!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0 (contexto acumulado e resultados de ferramentas)
Tokens de saída por interação
800 tokens por chamada!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fração da entrada servida por cache
0,7 fracao da entrada servida por cache!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fator de cache
derivado do preço de cache de cada modelo razao cache_leitura / entrada, derivada por modelo em precos.json; 1 quando o modelo não publica preço de cache, ou seja, sem desconto (ver regras_de_custo.fator_cache). Nunca 0.!premissa a aprovarderivada do dataset, não e premissa numerica; regra corrigida na fase 0c: a unidade anterior dizia 'null quando o modelo não tem cache' e o null lido como zero aplicava desconto integral sobre a fracao em cache
Volume mensal
1.000, 10.000, 100.000 tarefas por mês [pequeno, médio, grande]!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Chamadas ao modelo por tarefa
12 chamadas ao modelo por tarefa!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
com escrita de cache fora da conta, este valor é um piso
Melhor modelo de IA para programação: custo em reais e qualidade
Agente de código em repositório real, com muitas chamadas curtas sobre um prefixo grande em cache. Assinaturas de IDE ficam fora: o cálculo é só de API. A escrita de cache fica fora do cálculo, então o custo de carga com cache alto é um piso.
Custo mensal em reais por modelo e por volume, com a marca de premissa a aprovar em cada valor.
Modelo
volume pequeno
volume médio
volume grande
MiniMax M3provedor minimax
R$ 307,52!premissa a aprovar
R$ 3.075,18!premissa a aprovar
R$ 30.751,80!premissa a aprovar
DeepSeek-V4-Flashprovedor deepseek, tarifa de pico
R$ 323,53!premissa a aprovar
R$ 3.235,35!premissa a aprovar
R$ 32.353,46!premissa a aprovar
Mistral Large 3provedor mistral, sem preço de cache: fator 1
R$ 832,86!premissa a aprovar
R$ 8.328,61!premissa a aprovar
R$ 83.286,13!premissa a aprovar
Fórmulacusto_mensal_usd = interacoes_por_mes x (tokens_entrada_por_interacao x preco_entrada x (1 - proporcao_cache x (1 - fator_cache)) + tokens_saida_por_interacao x preco_saida) / 1000000; custo_mensal_brl = custo_mensal_usd x meta.cotacao.valor; para agentes e código, interacoes_por_mes = tarefas_por_mes x chamadas_por_tarefa Regras assumidas por esta fórmula em regras_de_custo: fator_cache, escrita_de_cache, horario_de_pico e provedor_por_modelo.MiniMax M3, volume médio: custo_mensal_usd = 125.000 x (20.000 x 0,3 x (1 - 0,75 x (1 - 0,2)) + 2.000 x 1,2) / 1000000; custo_mensal_brl = 600 x 5,1253
Cotação usadaR$ 5,13em 04/09/2026, 13:03:59
Premissas de carga deste caso
Tokens de entrada por interação
20.000 tokens por chamada!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0 (arquivos abertos, diff e histórico do agente de código)
Tokens de saída por interação
2.000 tokens por chamada!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fração da entrada servida por cache
0,75 fracao da entrada servida por cache!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fator de cache
derivado do preço de cache de cada modelo razao cache_leitura / entrada, derivada por modelo em precos.json; 1 quando o modelo não publica preço de cache, ou seja, sem desconto (ver regras_de_custo.fator_cache). Nunca 0.!premissa a aprovarderivada do dataset, não e premissa numerica; regra corrigida na fase 0c: a unidade anterior dizia 'null quando o modelo não tem cache' e o null lido como zero aplicava desconto integral sobre a fracao em cache
Volume mensal
500, 5.000, 50.000 tarefas por mês [pequeno, médio, grande]!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Chamadas ao modelo por tarefa
25 chamadas ao modelo por tarefa!premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
com escrita de cache fora da conta, este valor é um piso
IOF, spread, tributação de pessoa jurídica e escrita de cache ficam fora do cálculo; com escrita de cache fora, o valor é um piso para carga com muito cache.
Quatro regras que esta conta assume
Fator de cache
fator_cache = cache_leitura / entrada quando precos.json publica cache_leitura, e 1 quando cache_leitura e null, ou seja, sem desconto. Nunca 0: lido como 0, o termo (1 - proporcao_cache x (1 - fator_cache)) aplicaria desconto integral sobre toda a fracao em cache e subestimaria o custo (no caso código, com proporcao de cache de tres quartos, a subestimacao seria de metade do valor). Seis registros vigentes não publicam preço de cache: gemini-3-1-pro-preview e gemini-3-8-flash no provedor google, mistral-large-3, mistral-medium-3-5, mistral-small-4 e qwen3-8-max.
Escrita de cache
Fora do cálculo nesta versão e declarado como tal ao leitor. A escrita de cache custa 1,25x a entrada na janela de cinco minutos e 2x na de uma hora nos registros da Anthropic, e 1,25x nos da OpenAI; a taxa de reescrita do prefixo depende do padrão de uso, que o dataset não mede e que nenhuma fonte publica. Consequencia declarada: em carga com muito cache o custo publicado e um piso, não uma estimativa central.
Horário de pico
Modelo com horario_de_pico em precos.json entra na coluna de custo pela tarifa de PICO, que e a tarifa de referência da própria página (a DeepSeek apresenta o fora de pico como desconto de metade), e o fora de pico aparece como nota. Vale para deepseek-v4-pro e deepseek-v4-flash: pico das 01:00 as 04:00 e das 06:00 as 10:00 UTC, de segunda a sexta, 35 das 168 horas da semana, faixa que cobre o inicio do horario comercial brasileiro.
Provedor por modelo
Quando um modelo tem mais de um registro vigente em precos.json, a coluna de custo usa o registro nomeado aqui. muse-spark-1-3: provedor meta (Standard). O tier meta-contributor, doze vezes e meia mais barato, fica FORA da coluna de custo porque e o tier em que prompts e respostas do cliente treinam modelos da Meta; ele aparece so na secao de preços, com a pilula de treino de dados. gemini-3-1-pro-preview e gemini-3-8-flash: provedor google (os dois registros vigentes tem a mesma entrada e a mesma saida, então a escolha não muda o valor).
Fora do cálculo
IOF, spread bancario, tributacao de pessoa juridica, marketplace de nuvem, Batch, modo rápido, escrita de cache e custo de ferramentas ou de infraestrutura.
Dois modelos lado a lado
Escolha dois
Escolha dois modelos e compare atributo por atributo. Cada número abre a fonte, com a data do dado e a data da leitura. Os benchmarks só entram quando os dois modelos aparecem no mesmo grupo comparável, com a mesma origem de medição e, quando existe, o mesmo nível de esforço: é isso que decide o que pode ser comparado. Quando os intervalos publicados se cruzam, a linha diz empate técnico em vez de apontar um vencedor.
Comparação lado a lado de dois modelos de IA: atributos, preço por milhão de tokens e benchmarks do mesmo grupo comparável.
Campo
Modelo A: GPT-6 AstraVverificado
Modelo B: Gemini 3.8 FlashVverificado
Fabricante
OpenAI
Google DeepMind
Lançamento
3 set 2026
2 set 2026
Corte de conhecimento
30 abr 2026
não divulgado
Contexto de entrada
1.050.000▲melhor
1.048.576
Saída máxima
128.000▲melhor
65.536
Modalidades
texto, imagem -> texto
texto, imagem, video, audio, pdf -> texto
Pesos abertos
Afechado
Afechado
Preço de entrada US$/M
US$ 10,00
US$ 0,75▲melhor
Preço de saída US$/M
US$ 50,00
US$ 3,75▲melhor
Cache de leitura US$/M
US$ 1,00
não divulgado
Batch US$/M
entradaUS$ 5,00saídaUS$ 25,00
entradaUS$ 0,375saídaUS$ 1,875
Faixas por tamanho de prompt
acima de 272.000 tokensentradaUS$ 20,00saídaUS$ 75,00
sem faixa por tamanho de prompt
Custo R$ por 1M de saída
R$ 256,27PTAX de 4 set 2026, 13:03:59
R$ 19,22PTAX de 4 set 2026, 13:03:59▲melhor
Situação
Vverificado
Vverificado
Aposentadoria
sem data anunciada
sem data anunciada
Benchmarks em comum
Arena WebDev (Code Arena)config webdev, split latestesforço max contra esforço highHpreferência humana!esforços diferentes
1.797,04intervalo 1.773,44 a 1.820,64
1.567,23intervalo 1.554,84 a 1.579,63
Só entram aqui os benchmarks em que os dois modelos aparecem no mesmo grupo comparável, com a mesma origem de medição.
Quer ajuda para decidir entre estes dois?
A X-Apps desenha, opera e governa soluções com estes modelos. A escolha depende da sua carga, do seu dado e do seu risco.
Aberto virou um termo com quatro significados. A tabela separa Apache 2.0, MIT ou MIT modificada, licença própria com gatilho de receita e licença própria restritiva.
Níveis de licença de pesos abertos e os modelos de cada nível, com a licença declarada pelo fabricante e a fonte de cada leitura.
Nível de licença
Modelos neste snapshot
Apache 2.0Uso comercial livre, com patente concedida e exigência de aviso de licença. É o nível mais permissivo desta tabela.
Mistral Large 3Apache 2.0
Mistral Small 4Apache 2.0
Muse Glimmer-30BApache 2.0
MIT ou MIT modificadaUso comercial livre com aviso de copyright. A versão modificada acrescenta cláusula do fabricante: leia o texto antes de assumir que é MIT pura.
DeepSeek-V4-FlashMIT
DeepSeek-V4-ProMIT
Mistral Medium 3.5Modified MIT
Licença própria com gatilho de receitaLivre até um limite de receita ou de usuários declarado pelo fabricante. Acima do gatilho, exige acordo comercial.
GLM-5.3GLM-5.3 License
Licença própria restritivaPesos publicados, uso limitado por cláusulas do fabricante. Aberto aqui quer dizer que dá para baixar, não que dá para usar como quiser.
Kimi K3Kimi K3 License
MiniMax M3MiniMax Community License
Qwen3.8-2.4T-A95BQwen3.8-Max License
A versão de pesos abertos pode não ser a versão de nuvem: há modelo que perde modalidades e contexto ao ser publicado.
Qwen3.8-2.4T-A95B: A versão de pesos abertos NAO e igual a versão de nuvem (Qwen3.8-Max): perde entrada de imagem e modo non-thinking; contexto nativo de 262k, não 1M.
Qwen3.8-Max: A versão de nuvem (Qwen3.8-Max) não tem pesos publicados como tal; a versão de pesos abertos e o Qwen3.8-2.4T-A95B (qwen3-8-2-4t-a95b), sob a licença Qwen3.8-Max License, sem entrada de imagem, sem modo non-thinking e com contexto nativo de 262k.
Modelos sem pesos publicados neste snapshot: Claude Fable 5, Claude Fable 5.1, Claude Haiku 4.5, Claude Opus 5, Claude Sonnet 5, Gemini 3.1 Pro Preview, Gemini 3.8 Flash, GPT-5.6 Luna, GPT-5.6 Sol, GPT-5.6 Terra, GPT-6 Astra, Grok 4.6, Muse Spark 1.3, Qwen3.8-Max.
Linha do tempo
O que mudou e quando
Uma raia por fabricante e um ponto por evento datado do dataset: lançamento, mudança de preço, fim de vida e correção. A forma do ponto diz o tipo, e a linha tracejada marca a data deste snapshot: o que está à direita dela é prazo anunciado pelo fabricante, não fato consumado. Evento com prazo de exibição vencido sai da linha sozinho, e a ordem dentro de uma raia é cronológica, nunca um ranking entre fabricantes.
A linha do tempo cobre de 15/10/2025 a 01/09/2027: 27 eventos de 11 fabricantes, um ponto por evento.
Ver os mesmos eventos em tabela
Eventos da linha do tempo, do mais recente para o mais antigo, com a fonte de cada um.
Data
Fabricante
Modelo
Tipo
O que aconteceu
Fonte
Anthropic
Claude Fable 5.1
fim de vida
Aposentadoria de Claude Fable 5.1 não antes da data indicadaData mínima de aposentadoria declarada pelo fabricante.
O que circulou e não entrou, com a URL conferida, a data e o que falta para entrar. Esta lista existe para o leitor conferir o que a página recusou, não só o que ela aceitou.
Afirmações conferidas que ficaram fora da tabela, com a URL lida, o veredito e a data da conferência.
Afirmação
Onde circulou
Conferido em
Veredito
Data
O que falta
Existe um modelo chamado ChatGPT 6 (ou ChatGPT 6 Astra)inferência editorial
Score independente na mesma versão e mesmo agente (Epoch cobre só terminal-bench/2.0 no snapshot). Até lá, cada versão é um grupo separado.
Intelligence Index, Coding Index e Agentic Index da Artificial Analysis por modelo (inclusive os embutidos no payload do OpenRouter e o 'AA Intelligence Index 61' citado pela xAI)fato confirmado
artificialanalysis.ai, OpenRouter, anúncio do Grok 4.6
Página oficial da xAI listando uma variante fast do Grok 4.6 com preço de tabela. Lidas em 2026-09-06, docs.x.ai/developers/models, /developers/models/grok-4.6 e /developers/pricing não listam essa variante; a página de preços descreve Priority Processing, cobrança ao dobro das tarifas padrão em todos os tipos de token só quando a resposta confirma service_tier priority, que não é um modelo nem um modo com preço próprio.
Qwen3.8-Max entrou em preview em 2026-07-19reportagem secundária
terceiros (parte do antigo item qwen3-8-max-saida-131k)
Data do preview em página oficial: o press release traz 2026-08-03 e o Model Studio não traz data. Nada de 2026-07-19 entra no dataset.
Grok 4.6 tem 500.000 tokens de saída máxima; Mistral Large 3 e Medium 3.5 tem 262.144; Mistral Small 4 tem 256.000; Muse Glimmer-30B tem 131.072fato confirmado
campo limit.output do catálogo models.dev, repetido por agregadores
Saída máxima em página oficial. Nesses cinco registros o models.dev repete limit.context em limit.output, o que afirmaria que a saída máxima é a janela inteira; o normalizador descarta o valor nesse caso e a célula fica vazia. A xAI publica 'Context window 500,000 tokens' e nenhum max output (docs.x.ai/developers/models/grok-4.6), e a Mistral não publica nenhum dos dois.
Gemini 3.1 Pro Preview e Gemini 3.8 Flash estão disponíveis na região southamerica-east1 do Vertex AIfonte primária
resto do item vertex-precos, após a leitura da tabela de preços na fase 0
A página de preços traz a tarifa do endpoint não global, que inclui southamerica-east1, mas não diz em que regiões cada modelo roda. Falta a tabela oficial de disponibilidade regional do Vertex; até lá a observação dos dois registros de preço declara que a disponibilidade em southamerica-east1 não foi verificada.
Resolvidos (19)
Afirmações que estavam nesta lista e já entraram ou já foram esclarecidas.
Preço por milhão de tokens do GLM-5.3 resolvido em 06/09/2026; preço lido na tabela oficial (1,4 entrada, 0,26 cache, 4,4 saída USD por milhão); registrado em curadoria (lote4) docs.z.ai
Preço por milhão de tokens do MiniMax M3 resolvido em 06/09/2026; preço de lista 0,60 e 2,40 (cache 0,12) até 512K e 1,20 e 4,80 acima, com 50% permanente declarado; registrado em curadoria (lote8) platform.minimax.io
Placares do GPT-6 Astra (ARC-AGI-3, FrontierMath Tier 4, DeepSWE v1.1, SRE-Bench etc.) resolvido em 06/09/2026; tabelas lidas em TEXTO no Browser pane (transcricao-gpt-6-astra.json) e incorporadas ao grupo openai-anuncio-gpt-6-astra com em_texto_na_pagina true openai.com
GPT-6 Astra custa 20 e 75 USD por milhão acima de 272.000 tokens de prompt resolvido em 06/09/2026; coluna long context da tabela Standard (20, 2 cache, 25 escrita, 75) com limiar de 272K na ficha oficial do modelo (lote6 e lote11); registrada como faixa developers.openai.com
DeepSWE v1.1 73,7 e demais placares do Gemini 3.8 Flash resolvido em 06/09/2026; imagem oficial gemini-evals-table.webp baixada por curl (sha256 3343387ccc4ea5219f6ef38f568b18d78e8488459309de6572e30c83e81bfd3a) e transcrita (lote4); DeepSWE v1.1 73,7 e demais linhas em curadoria com captura blog.google
Muse Spark 1.3 custa 1,25 e 4,25 USD por milhão (Standard) e 0,10 e 0,20 (Contributor) resolvido em 06/09/2026; tiers Standard (1,25 / 0,15 cache / 4,25) e Contributor (0,10 / 0,002 / 0,20) lidos na página oficial (lote13); dois registros de preço em curadoria dev.meta.ai
Muse Spark 1.3: DeepSWE 1.1 75,4, Terminal-Bench 2.1 88,8, SWEAtlas 59,4, recuperação em contexto longo 98,5 resolvido em 06/09/2026; PDF oficial de metodologia (sha256 315a5d1de2932bf772caf1945aa2c7460a1e040c5df3d8b6bbfb53eddea864fe) transcrito (lote10): DeepSWE v1.1 75,4, Terminal-Bench 2.1 88,8, SWEAtlas 59,4 em curadoria com captura; MRCR fica fora por versão não declarada research.meta.ai
Qwen3.8-Max custa 2 e 6 USD por milhão resolvido em 06/09/2026; preço lido no Model Studio international (2 e 6 USD por milhão, faixa 0 a 1M; lote6); registro qwen3-8-max criado em curadoria alibabacloud.com
Qwen3.8-Max: 1M de contexto, 131K de saída, lançamento 2026-08-03 (preview 2026-07-19) resolvido em 06/09/2026; press release lido no Browser pane (lote4): contexto até 1 milhão de tokens e data 2026-08-03 confirmados; saída 131K e preview 2026-07-19 continuam sem fonte (novo item qwen3-8-max-saida-131k) alibabacloud.com
Kimi K3 marca 43,5 e 56,0 em HLE-Full (dois regimes) resolvido em 06/09/2026; model card declara que HLE-Full reporta sem e com ferramentas nessa ordem (lote7): 43,5 em hle-full e 56,0 em hle-com-ferramentas huggingface.co
A Kimi K3 License permite uso comercial mas exige acordo para grandes negócios de modelo como serviço e impõe requisitos de marca resolvido em 06/09/2026; LICENSE lido por curl (lote6): cláusula 2 (MaaS acima de USD 20 mi em 12 meses exige acordo) e cláusula 3 (exibir Kimi K3 acima de 100 mi MAU ou USD 20 mi por mês) huggingface.co
A licença do GLM-5.3 exige revisão de segurança da Z.ai para grupos com receita acima de USD 10 bilhões resolvido em 06/09/2026; LICENSE lido por curl (lote6): cláusula 2 exige revisão de segurança da Z.AI para MaaS com receita agregada acima de USD 10 bilhões em 12 meses huggingface.co
Licença dos pesos do MiniMax M3 (entrada no Hugging Face em 2026-06-07) resolvido em 06/09/2026; MiniMax Community License lida por curl (lote6): exibir 'Built with MiniMax M3' e autorização prévia acima de USD 20 milhões de receita anual; domínio huggingface.co/MiniMaxAI fora da allowlist (fonte_url da Medida segue o anúncio, URL na nota) huggingface.co
DeepSeek V4 Pro e Flash são MIT resolvido em 06/09/2026; LICENSE MIT (Copyright 2023 DeepSeek) lido por curl (lote6) e README raw com license: mit; domínio huggingface.co/deepseek-ai fora da allowlist (fonte_url da Medida segue o anúncio, URL na nota) huggingface.co
Placares do DeepSeek V4 (v4-benchmark.png) resolvido em 06/09/2026; imagens v4-benchmark.png (sha256 71d8cb001f027a19afb8faa13af59354524efe83eec2d31e9364880fc3b84011) e v4-benchmark-2.png (sha256 9226203de8e24b331652417ceccb6d3b9a0328cbbebf7d2c24cde1b1ef2fb67e) baixadas por curl e transcritas (lote4); grupo deepseek-anuncio-v4-preview-2026-04-24 com captura api-docs.deepseek.com
Modelos Claude tem janela padrão de 200k (500k em Enterprise) resolvido em 06/09/2026; overview de modelos da Claude API lido no Browser pane (lote5) declara 1M para Fable 5.1, Opus 5 e Sonnet 5 e 200K para Haiku 4.5; claude.com/pricing descreve planos de assinatura platform.claude.com
Qwen3.8-Max tem saída máxima de 131K tokens (afirmada como fato oficial por terceiros) resolvido em 06/09/2026; Decisão registrada: a Alibaba não publica saída máxima em página oficial, e o dataset publica os 131.072 tokens do catálogo models.dev com classe 'fato confirmado', evidência 'agregador' e nota dizendo que não há leitura oficial. O catálogo traz valor próprio para este modelo (131.072 contra contexto de 1.000.000), diferente dos registros em que repete o contexto. A data de preview de 2026-07-19 continua sem fonte e virou o item qwen3-8-max-preview-19-07. models.dev
Mistral Medium 3.5 tem 256k de contexto e 128B de parâmetros (afirmados como fato oficial por terceiros) resolvido em 06/09/2026; Decisão registrada: docs.mistral.ai e mistral.ai/pricing/api não publicam contexto nem número de parâmetros (reconferido por curl em 2026-09-06). O contexto de 262.144 tokens entra pelo catálogo models.dev com classe 'fato confirmado', evidência 'agregador' e nota dizendo que não há leitura oficial; vale o mesmo para mistral-large-3 e mistral-small-4. Os 128B de parâmetros continuam fora do dataset: nenhuma fonte publica o número e o dataset não tem campo de parâmetros. models.dev
Preço de Claude e Gemini no Vertex AI resolvido em 06/09/2026; A página foi reaberta em navegador real na fase 0 (transcricoes-lote6.json, versão em pt-BR) e os números entraram em curadoria: Gemini 3.1 Pro Preview com entrada 2, cache 0,20 e saída 12 até 200K, e 4, 0,40 e 18 acima; Gemini 3.8 Flash com entrada 0,75, cache 0,075 e saída 3,75 no endpoint global até 2026-12-31, e endpoint não global 10% mais caro desde 2026-07-01. O que continua sem verificação é só a disponibilidade regional em southamerica-east1, que virou o item vertex-southamerica-east1 e já consta na observação dos dois registros de preço. cloud.google.com
Metodologia e fontes
Como cada número entra, o que reprova um número e quem é a fonte de cada valor. A metodologia é versionada: quando a regra muda, a versão muda junto.
Cotação usada: 4 set 2026, 13:03:59
Metodologia versão 1.0, atualizada em 06/09/2026
Versão 1.0 (rascunho da fase 1, 2026-09-06). Renderizada na seção Metodologia e fontes do hub. Toda mudança de regra ganha versão nova e uma linha em changelog.jsonl. Sem número solto: valores entram pelo dataset.
O que cada número carrega
Cada célula, cartão e barra desta página traz fonte (URL exata), data do dado na origem, data de coleta, classe, evidência e confiança. Quando falta um desses campos, o número não é publicado. Quando o fabricante não divulga, a célula diz "não divulgado". Nunca estimamos.
Classes de afirmação
Usamos o mesmo vocabulário do checador editorial do blog: fonte primária (página, documentação ou model card do fabricante), fato confirmado (medição de terceiro independente ou dado de agregador aberto), cálculo próprio (fórmula visível, recalculada pelo validador com tolerância de dois por cento) e inferência editorial (nossa leitura, sempre marcada). Reportagem secundária e alegação de entrevistado não entram na tabela; ficam na seção REPROVADO.
Rótulos de evidência
autorreportado: número do próprio fabricante dono da página. Entra só em grupo com scores da mesma página, nunca comparado com outro fabricante.
medido por concorrente: número de um fabricante que aparece na página de outro, medido ou citado por quem publica. Segue a mesma regra de grupo do autorreportado e nunca é apresentado como declaração do fabricante do modelo.
independente: medição de organização que não vende modelo (Epoch AI, ARC Prize) ou dado público (Banco Central).
preferência humana: votos em pares cegos do Arena, com intervalo de confiança. Sempre exibido com o intervalo: quando os intervalos de dois modelos se sobrepõem, a página diz empate técnico e nunca lista um acima do outro sem essa marca.
agregador: catálogo comunitário (models.dev), usado para enriquecer, nunca como única fonte de preço.
medido pela X-Apps: reservado para medições próprias (não há nenhuma nesta versão).
Hierarquia de fontes
Páginas oficiais dos fabricantes para preço, contexto, lançamento e licença de pesos.
Epoch AI e o Arena para qualidade comparável entre fabricantes: medição independente e preferência humana vencem número de fabricante quando existem para o mesmo modelo.
models.dev para catálogo e conferência; OpenRouter e llm-prices.com apenas como conferência interna, sem nada publicado.
Divergência entre páginas do mesmo fabricante se resolve pela documentação de API, com nota. Divergência acima de cinco por cento entre página oficial e models.dev publica a oficial e registra no changelog. Duas fontes independentes em conflito não publicam até resolução.
Versão de benchmark
Benchmark de mesmo nome muda de versão e de regras. Terminal-Bench 2.1, 3.0 e 4.0 são três catálogos; OSWorld 2.0 partial, strict e OSWorld-Verified são três medidas; HLE completo, HLE-Verified e HLE com ferramentas são três recortes. O id de cada benchmark carrega a versão, o gráfico mostra a versão no rótulo e um aviso fixo lembra que não são comparáveis entre si. Score publicado sem versão fica em grupo próprio. Métrica diferente com o mesmo nome também: o Agents' Last Exam tem catálogo separado para a taxa de aprovação, para o score e para a variante ALE-CLI, porque o mesmo modelo aparece com números muito distantes conforme a coluna; o SWE-Marathon tem catálogo separado para a versão 1.1 e para o ramo anterior a ela calibrado para outra GPU. Em SWE-bench e Terminal-Bench, o harness aparece ao lado do score, porque o mesmo modelo em agentes diferentes resolve quantidades diferentes de tarefas.
Nas páginas por caso de uso o cabeçalho da coluna só cabe a versão curta. A versão completa do recorte, que é o que separa duas medidas com o mesmo nome de catálogo, aparece na ficha de fonte de cada célula, no campo Versão.
Níveis de esforço
O mesmo modelo em esforço máximo e em esforço baixo tem placar e custo diferentes. Cada score carrega a configuração usada; quando a fonte não declara, o rótulo diz "não informado" e o score não entra em comparação cruzada.
Quatro datas
Data do dado na origem, data de coleta, data do snapshot (no topo da página) e vigência do preço. A página nunca mostra a data do build. Passados quinze dias desde a data do snapshot, o hero exibe "Em revisão". O prazo é contado da data do snapshot até o dia da visita, não da data do build do site.
Preço em reais
Preços oficiais são em dólar por milhão de tokens, e é assim que a tabela publica entrada e saída. Ao lado do preço de saída em dólar, a tabela publica também o mesmo preço convertido em reais pela cotação PTAX de venda do Banco Central, com data e hora visíveis. Essa coluna é conversão de preço de tabela, não estimativa de conta mensal.
A conta mensal fica na seção de custo por caso de uso. Ela é cálculo próprio, derivado no momento em que a página é montada a partir de precos.json e do perfil de carga de cada caso: não existe Medida de custo no dataset, e nenhum valor em reais é digitado na copy. A página mostra três volumes em vez de um número único, com a fórmula, as premissas de carga e a cotação usada ao lado dos valores, e declara as quatro regras que a conta assume (fator de cache, escrita de cache fora do cálculo, tarifa de pico e provedor por modelo).
As premissas de perfil de carga são propostas da X-Apps e ainda não foram aprovadas. Por isso todo valor em reais sai marcado como premissa a aprovar, ao lado do próprio número, e não apenas nesta metodologia. Elas não descrevem nenhum cliente e não foram medidas: estão publicadas para o leitor conferir ou trocar pelos números dele.
IOF, spread bancário, marketplace de nuvem, tributação de pessoa jurídica e escrita de cache ficam fora do cálculo e são declarados como tal. Com a escrita de cache fora, o valor é um piso para carga com muito cache.
Tokenizador
Comparar preço por milhão de tokens entre fabricantes sem considerar o tokenizador distorce a conta: a Anthropic declara que seus modelos recentes geram mais tokens para o mesmo texto. A nota só aparece na página com a Medida correspondente.
Velocidade
Não há coluna de latência nem de throughput. Nenhuma fonte aberta entrega TTFT e tokens por segundo com licença de republicação; o OpenRouter devolve nulo e a Artificial Analysis não concede redistribuição. Medição própria a partir do Brasil está prevista para uma fase futura.
Placares em imagem
Anúncios que publicam resultados só em gráfico entram apenas após transcrição em navegador real, com captura de tela, hash e data gravados no dataset. O valor transcrito chega ao leitor com a marca de transcrito de imagem e a data da transcrição na ficha de fonte. Até a transcrição, o número fica na seção REPROVADO como "aguardando transcrição".
Atribuições
Epoch AI, 'AI Benchmarking Hub'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks/use-this-data' [online resource]. Accessed 6 Sep 2026. Dados sob Creative Commons Attribution 4.0; dados de Aider Polyglot e Terminal-Bench embutidos mantêm licença Apache 2.0.
models.dev: MIT License. Copyright (c) 2025 models.dev. The above copyright notice and this permission notice shall be included in all copies or substantial portions of the Software.
LMArena: LMArena, 'Arena Leaderboard Dataset' (lmarena-ai/leaderboard-dataset). Publicado no Hugging Face em https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Acesso em 6 set 2026. A model card não publica frase de citação própria, então a atribuição segue o formato da licença (título, autor, fonte e licença). Lemos o dataset publicado no Hugging Face; nunca raspamos o site do Arena.
Banco Central do Brasil, cotação PTAX de venda.
OpenRouter rankings (somente se a fase 7 for aprovada): Source: OpenRouter (openrouter.ai/rankings), as of {as_of}. Licensed under CC BY 4.0.
Correções e contato
Erro encontrado vira correção datada que não sai da página, com o valor anterior e o novo registrados no changelog. Correções podem ser enviadas pelo formulário de contato do site, com a URL da fonte.
Fontes e licenças
Cada fonte entra com o papel que cumpre, a licença que a governa e o texto de atribuição exigido por ela, copiado sem alteração.
Nível 1: páginas oficiais dos fabricantes
Páginas oficiais dos fabricantes (preço, documentação de API, anúncio, model card)
Licença: página institucional do fabricante; fato de preço e especificacao citado com link
Republicação: permitida com atribuição; conferida em 06/09/2026
Restrições de uso
citar valor com fonte e data; nunca copiar tabela inteira com layout
openai.com/index devolve HTTP 403 a curl e WebFetch: abrir no Chrome real com captura
alibabacloud.com/en/press-room renderiza por JavaScript: HTML baixado sem texto
placares em imagem (Opus 5, Gemini 3.8 Flash, Muse Spark 1.3, DeepSeek V4) so entram por transcricao com captura, sha256 e data
para benchmark, evidencia sempre 'autorreportado' e grupo_comparavel restrito a uma fonte_url
Meta Model API (dev.meta.ai): pricing-rate-limits e models
Licença: página institucional do fabricante; fato de preço
Republicação: permitida com atribuição; conferida em 06/09/2026
Restrições de uso
citar valor com fonte e data; nunca copiar tabela inteira com layout
Meta AI Research, PDFs de metodologia (research.meta.ai/static)
Licença: página institucional do fabricante; fato de preço
Republicação: permitida com atribuição; conferida em 06/09/2026
Restrições de uso
citar valor com fonte e data; nunca copiar tabela inteira com layout
Alibaba Cloud Model Studio, Model inference pricing
Licença: página institucional do fabricante; fato de preço
Republicação: permitida com atribuição; conferida em 06/09/2026
Restrições de uso
citar valor com fonte e data; nunca copiar tabela inteira com layout
Alibaba Cloud Press Room
Licença: página institucional do fabricante; fato de preço
Republicação: permitida com atribuição; conferida em 06/09/2026
Restrições de uso
citar valor com fonte e data; nunca copiar tabela inteira com layout
MiniMax API Docs, Pay as You Go
Licença: página institucional do fabricante; fato de preço
Republicação: permitida com atribuição; conferida em 06/09/2026
Restrições de uso
citar valor com fonte e data; nunca copiar tabela inteira com layout
Z.AI Developer Document, Pricing
Licença: página institucional do fabricante; fato de preço
Republicação: permitida com atribuição; conferida em 06/09/2026
Restrições de uso
citar valor com fonte e data; nunca copiar tabela inteira com layout
Mistral, Pricing (API, plano Standard)
Licença: página institucional do fabricante; fato de preço
Republicação: permitida com atribuição; conferida em 06/09/2026
Restrições de uso
citar valor com fonte e data; nunca copiar tabela inteira com layout
Hugging Face, model cards e LICENSE mantidos pelos fabricantes (raw/main)
Licença: model card no Hugging Face mantida pelo fabricante; score citado com link; texto de licença citado por clausula
Republicação: permitida com atribuição; conferida em 06/09/2026
Restrições de uso
citar valor com fonte e data; nunca copiar tabela inteira com layout
AWS, Amazon Bedrock, Regional availability by models
Licença: página institucional do fabricante; fato de preço
Republicação: permitida com atribuição; conferida em 06/09/2026
Restrições de uso
citar valor com fonte e data; nunca copiar tabela inteira com layout
DeepSeek API Docs, imagens de placar do anúncio do V4
Licença: página institucional do fabricante; fato de preço
Republicação: permitida com atribuição; conferida em 06/09/2026
Restrições de uso
citar valor com fonte e data; nunca copiar tabela inteira com layout
Nível 2: medição independente
Epoch AI, AI Benchmarking Hub (benchmark_data.zip)
Republicação: permitida com atribuição; conferida em 06/09/2026
Atribuição exigidaEpoch AI, 'AI Benchmarking Hub'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks/use-this-data' [online resource]. Accessed 6 Sep 2026.
Restrições de uso
dados de Aider Polyglot e Terminal-Bench embutidos mantem licença Apache 2.0 original
questoes e respostas dos benchmarks pertencem aos criadores; publicar so scores
sem header CORS: consumir somente no build
nomes de modelo carregam o nível de esforco como sufixo (_max, _xhigh, _high, _low, _none, _unknown); nunca misturar esforcos
GPQA, model card do dataset Idavidrein/gpqa no Hugging Face
Licença: CC BY 4.0; condição de acesso: não revelar exemplos do dataset em texto ou imagem Texto da licença
Republicação: permitida com atribuição; conferida em 06/09/2026
Restrições de uso
publicar so o baseline humano e scores; nunca republicar questoes
sem frase de citacao publicada na página: texto_atribuicao null até aprovacao
Nível 2: preferência humana
LMArena, dataset lmarena-ai/leaderboard-dataset via datasets-server do Hugging Face
Licença: CC BY 4.0 (cardData.license: cc-by-4.0) Texto da licença
Republicação: permitida com atribuição; conferida em 06/09/2026
Atribuição exigidaLMArena, 'Arena Leaderboard Dataset' (lmarena-ai/leaderboard-dataset). Publicado no Hugging Face em https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Acesso em 6 set 2026.
Restrições de uso
NUNCA raspar arena.ai: os Termos de Uso proibem scrapers e reproducao do servico; a via legal e o dataset
lmarena.ai/leaderboard redireciona 301 para arena.ai/leaderboard
exibir sempre rating_lower e rating_upper; diferenca menor que o intervalo vira empate técnico
fonte_data = leaderboard_publish_date da linha, não a data da consulta
atribuicao montada no formato exigido pela CC BY 4.0 (titulo, autor, fonte e licença) porque a model card não publica frase de citacao própria; licença cc-by-4.0 reconferida na API do Hugging Face em 2026-09-07
Republicação: permitida com atribuição; conferida em 06/09/2026
Atribuição exigidaMIT License. Copyright (c) 2025 models.dev. The above copyright notice and this permission notice shall be included in all copies or substantial portions of the Software.
Restrições de uso
manter aviso de copyright e licença em metodologia.md
preço comunitario pode atrasar horas ou dias após mudanca do fabricante: camada de enriquecimento, nunca única fonte de preço
a home do models.dev mostra $0.00 para modelos com preço; usar so o api.json
Republicação: permitida com atribuição; conferida em 06/09/2026
Atribuição exigidaSource: OpenRouter (openrouter.ai/rankings), as of {as_of}. Para os demais endpoints: Source: OpenRouter Data API (openrouter.ai/docs/cookbook/administration/data-api), as of {as_of}. Ao republicar o dado: Licensed under CC BY 4.0.
Restrições de uso
exige Authorization Bearer; 30 requisicoes por minuto e 500 por dia
mede so trafego do OpenRouter, não o mercado
LLM Stats (llm-stats.com), API em api.zeroeval.com/stats/v1
Licença: Termos de Servico (2026-09-06) permitem copiar, modificar, compartilhar e republicar, inclusive comercialmente, com credito visivel a llm-stats.com e link Texto da licença
Republicação: permitida com atribuição; conferida em 06/09/2026
Restrições de uso
base URL em conflito entre api.zeroeval.com/stats/v1 e api.llm-stats.com/stats/v1
chave emitida em huggle.ai
agregador: GPQA mostra Verified 0 e Self-reported 244; sempre cruzar com fonte primaria
Fora do dataset
Artificial Analysis
Licença: atribuicao obrigatoria em todos os tiers; tier gratuito 'Internal use only with attribution', sem redistribuicao Texto da licença
Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026
Restrições de uso
nunca entra no dataset, nem via campo benchmarks do OpenRouter
citacao em prosa com link e byline, no máximo um número por afirmacao
PDF de Terms of Use não lido (fonte com CMap); abrir em leitor grafico na fase 0
Descartada
Hugging Face Open LLM Leaderboard
Licença:
Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026
Restrições de uso
arquivado (v1 em junho de 2024, v2 depois); inutil para 2026
Aider polyglot leaderboard
Licença: Apache 2.0 (via Epoch)
Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026
Restrições de uso
página parada em 2025-11-20; se usar, so via aider_polyglot_external.csv da Epoch
openai/simple-evals
Licença: MIT
Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026
Restrições de uso
congelado desde julho de 2025; vale so como definicao metodologica
pricepertoken.com
Licença:
Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026
Restrições de uso
HTTP 403 para bots, sem endpoint, sem termos, deriva do OpenRouter
Vellum LLM Leaderboard
Licença:
Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026
Restrições de uso
mistura autorreportado e verificado sem separar; página de metodologia 404
HateBR
Licença: uso comercial proibido
Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026
Restrições de uso
licença proibe uso comercial
Conflito de interesse
A X-Apps presta consultoria e desenvolve software com vários dos fornecedores desta tabela e mantém páginas comerciais por tecnologia. Não recebe pagamento de nenhum fabricante por esta página. Os números vêm das fontes citadas, não de acordos comerciais.
Perguntas frequentes
Depende do eixo. A tabela desta página separa raciocínio, código, agentes e preferência humana, sempre com a fonte e a data de cada número, e marca quando o placar foi publicado pelo próprio fabricante ou medido por um concorrente dele. O líder de cada eixo aparece nos cartões do topo com o benchmark e a versão usados. No eixo de preferência humana, que vem do Arena, o cartão mostra o intervalo publicado: quando a diferença cabe dentro do intervalo, a página diz empate técnico em vez de escolher um vencedor.
'As pessoas tambem perguntam' observado na busca em 2026-09-06 (plano, secao 7.15)
O preço oficial é publicado em dólar por milhão de tokens, e esta página mostra os dois. Na tabela principal há uma coluna com o preço de saída convertido em reais pela cotação PTAX de venda do Banco Central, com a data e a hora da cotação ao lado do número. Na seção de custo por caso de uso a conta vai além do preço de tabela e estima a fatura mensal em três volumes, a partir de um perfil de carga que é premissa da X-Apps e ainda não foi aprovado: por isso todo valor em reais aparece marcado como premissa. IOF, spread, tributação de pessoa jurídica e escrita de cache ficam declarados como fora do cálculo.
'As pessoas tambem perguntam' observado na busca em 2026-09-06 (plano, secao 7.15)
Nenhuma fonte aberta que esta página usa mede qualidade em português de forma independente. Por isso a coluna não existe: preferimos deixar em branco a estimar. Uma medição própria está prevista para uma fase futura, e até lá o critério aparece na lista do que a página ainda não mede.
'As pessoas tambem perguntam' observado na busca em 2026-09-06 (plano, secao 7.15)
Para empresa, o custo total por caso de uso pesa tanto quanto o placar. As páginas de chatbot, chat com documentos, agentes e programação mostram os benchmarks relevantes de cada caso com os pesos declarados, e o custo mensal em reais para três volumes, com a fórmula, as premissas de carga e a cotação usada visíveis ao lado do valor. As premissas de carga são propostas da X-Apps e ainda não foram aprovadas, então trate os valores como ponto de partida para trocar pelos seus números, não como orçamento.
'As pessoas tambem perguntam' observado na busca em 2026-09-06 (plano, secao 7.15)
Porque benchmarks de mesmo nome mudam de versão e de regras, e porque placares publicados pelo fabricante usam condições que ninguém reproduz. Um número de um fabricante medido por um concorrente dele também não é a mesma coisa que uma medição independente, e leva etiqueta própria. Só comparamos entre fabricantes dentro do mesmo grupo, e grupo com menos de três modelos sai como lista, nunca como gráfico.
Toda semana e a cada lançamento relevante. A data do snapshot aparece no topo, junto da versão da metodologia, e um aviso de revisão surge automaticamente quando o dado passa do prazo de frescor declarado.
Leia também
Três artigos que explicam como ler um placar, como escolher para prototipar e o que muda entre níveis de esforço do mesmo modelo.