Montar SquadSolicitar Orçamento

Comparativo com fonte

Comparativo de modelos de IA: preço em reais e benchmarks

Os modelos mais recentes lado a lado, com a URL e a data de cada número, custo mensal em reais por caso de uso e uma seção do que não entrou.

Ver a tabelaSolicitar orçamento

Frescor do quadro

Snapshot de 6 set 2026. Revisado toda semana e a cada lançamento. Metodologia v1.0.

Resposta rápida

Comparativo com fonte

Quem lidera cada eixo, com o benchmark e a versão usados. Número publicado pelo fabricante leva a etiqueta correspondente; número de um fabricante medido por um concorrente leva outra; quando existe medição independente, ela manda. O eixo de preferência humana vem do Arena, sempre com o intervalo publicado: diferença menor que o intervalo é empate técnico, e o cartão diz isso em vez de fingir um vencedor.

  • Raciocínio

    GPT-6 Astra

    95,77%
    medição independenteempate técnico

    GPQA Diamond, versão diamond

    Métrica: % de acerto

    intervalo 94,4 a 97,14

    empate técnico com Gemini 3.1 Pro Preview, Gemini 3.1 Pro Preview, Grok 4.6, Claude Opus 5, GPT-5.6 Sol, GPT-5.6 Terra, Grok 4.6, Kimi K3 e Claude Opus 5.

    entre os 16 modelos deste grupo

  • Código

    GPT-6 Astra

    1.797,04
    preferência humanaempate técnico

    Arena WebDev (Code Arena), versão config webdev, split latest

    Métrica: pontos Elo (Bradley-Terry)

    intervalo 1.773,44 a 1.820,64

    empate técnico com Claude Fable 5.1.

    entre os 19 modelos deste grupo

  • Agentes

    Claude Fable 5.1

    15,87%
    preferência humanaempate técnico

    Arena Agent, versão config agent, split latest

    Métrica: IPS (%)

    intervalo 13,04 a 18,71

    empate técnico com Claude Opus 5 e Claude Opus 5.

    entre os 17 modelos deste grupo

  • Mais barato (preço de tabela em dólar)

    Mistral Small 4

    US$ 0,2625USD por milhão de tokens
    reportado pelo fabricante

    proporção 3 de entrada para 1 de saída

    entre os 22 modelos com preço oficial nesta tabela

  • Maior contexto

    GPT-5.6 Luna

    1.050.000tokens
    reportado pelo fabricante

    entre os 24 modelos desta tabela

  • Melhor de pesos abertos

    Kimi K3

    157,62
    medição independenteempate técnico

    Epoch Capabilities Index

    Métrica: índice

    Licença dos pesos: Kimi K3 License

    intervalo 155,06 a 160,13

    empate técnico com GLM-5.3.

    entre os 6 modelos de pesos abertos deste grupo

Tabela principal

Ordene por qualquer coluna e filtre por fabricante, licença de pesos ou faixa de preço. Toda célula numérica abre a fonte, com a data do dado e a data da leitura.

24 modelos nesta tabela

Modelos de IA comparados: avaliações independentes e de preferência humana, preço por milhão de tokens, contexto, custo em reais, pesos abertos e situação. Cada célula numérica tem fonte e data. Nas avaliações, o número é o maior valor publicado pelo modelo naquele benchmark, com o nível de esforço escrito ao lado. A estrela marca o maior valor da coluna e o sinal de igual marca quem cruza o intervalo publicado do líder, ou seja, quem não pode ser separado dele; a dica de cada coluna diz quantos pares vizinhos também se sobrepõem.
GPT-6 AstraOpenAI
169,23empate técnico com Claude Fable 5, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol95,8%max de esforçoempate técnico com Gemini 3.1 Pro Preview, Grok 4.6, Claude Opus 5, GPT-5.6 Sol, GPT-5.6 Terra, Kimi K31.797,0max de esforçoempate técnico com Claude Fable 5.1não medidonão medido1.050.000US$ 10,00US$ 50,00US$ 1,00R$ 256,27fechadoverificado
Claude Fable 5Anthropic
162,90empate técnico com GPT-6 Astra85,9%max de esforço1.629,110,23%high de esforço1.494,11.000.000US$ 10,00US$ 50,00US$ 1,00R$ 256,27fechadoverificado
Claude Fable 5.1Anthropic
162,88empate técnico com GPT-6 Astranão medido1.762,3max de esforçoempate técnico com GPT-6 Astra15,87%max de esforçoempate técnico com Claude Opus 51.513,7max de esforçoempate técnico com Claude Opus 5, Gemini 3.8 Flash1.000.000US$ 10,00US$ 50,00US$ 0,25R$ 256,27fechadoverificado
Claude Opus 5Anthropic
162,33empate técnico com GPT-6 Astra93,9%max de esforçoempate técnico com GPT-6 Astra1.687,6max de esforço12,68%high de esforçoempate técnico com Claude Fable 5.11.505,0high de esforçoempate técnico com Claude Fable 5.11.000.000US$ 5,00US$ 25,00US$ 0,50R$ 128,13fechadoverificado
GPT-5.6 SolOpenAI
162,03empate técnico com GPT-6 Astra93,5%max de esforçoempate técnico com GPT-6 Astra1.617,4xhigh de esforço9,31%xhigh de esforço1.454,9xhigh de esforço1.050.000US$ 4,00US$ 20,00US$ 0,40R$ 102,51fechadoparcial
GPT-5.6 TerraOpenAI
159,1893,3%max de esforçoempate técnico com GPT-6 Astra1.519,7xhigh de esforço3,04%xhigh de esforço1.446,8xhigh de esforço1.050.000US$ 2,00US$ 12,00US$ 0,20R$ 61,50fechadoparcial
Kimi K3Moonshot AI
157,6293,1%max de esforçoempate técnico com GPT-6 Astra1.674,4max de esforço7,96%max de esforço1.476,0max de esforço1.048.576US$ 3,00US$ 15,00US$ 0,30R$ 76,88Kimi K3 Licenseparcial
GPT-5.6 LunaOpenAI
156,3391,6%max de esforço1.519,5xhigh de esforço2,09%xhigh de esforço1.430,3xhigh de esforço1.050.000US$ 0,20US$ 1,20US$ 0,02R$ 6,15fechadoparcial
Grok 4.6xAI
156,3394,0%high de esforçoempate técnico com GPT-6 Astra1.624,9high de esforço4,98%xhigh de esforçonão medido500.000US$ 2,00US$ 6,00US$ 0,50R$ 30,75fechadoverificado
Claude Sonnet 5Anthropic
156,1690,5%xhigh de esforço1.536,9high de esforço7,41%high de esforço1.443,2high de esforço1.000.000US$ 2,00US$ 10,00US$ 0,20R$ 51,25fechadoverificado
GLM-5.3Z.ai (Zhipu AI)
155,3090,9%max de esforço1.609,0max de esforço3,80%max de esforço1.473,5max de esforço1.000.000US$ 1,40US$ 4,40US$ 0,26R$ 22,55GLM-5.3 Licenseparcial
Gemini 3.1 Pro PreviewGoogle DeepMind
154,9094,4%high de esforçoempate técnico com GPT-6 Astra1.445,5-3,73%1.480,11.048.576US$ 2,00US$ 12,00não divulgadoR$ 61,50fechadoparcial
DeepSeek-V4-ProDeepSeek
149,2091,7%max de esforço1.581,7high de esforço5,43%high de esforço1.451,11.000.000US$ 1,32tarifa de pico; há tarifa menor fora do picoUS$ 3,96tarifa de pico; há tarifa menor fora do picoUS$ 0,044R$ 20,30MITverificado
MiniMax M3MiniMax
146,5790,9%1.487,3-3,76%1.435,21.000.000US$ 0,30US$ 1,20US$ 0,06R$ 6,15MiniMax Community Licenseverificado
DeepSeek-V4-FlashDeepSeek
146,2691,0%max de esforço1.579,6high de esforço3,29%high de esforço1.431,91.000.000US$ 0,44tarifa de pico; há tarifa menor fora do picoUS$ 1,32tarifa de pico; há tarifa menor fora do picoUS$ 0,014R$ 6,77MITverificado
Claude Haiku 4.5Anthropic
142,4171,2%não medidonão medidonão medido200.000US$ 1,00US$ 5,00US$ 0,10R$ 25,63fechadoverificado
Mistral Medium 3.5Mistral AI
141,37não medidonão medido-7,16%medium de esforço1.421,0medium de esforço262.144US$ 1,50US$ 7,50não divulgadoR$ 38,44Modified MITverificado
Gemini 3.8 FlashGoogle DeepMind
não medidonão medido1.567,2high de esforço5,47%high de esforço1.495,2high de esforçoempate técnico com Claude Fable 5.11.048.576US$ 0,75US$ 3,75não divulgadoR$ 19,22fechadoverificado
Mistral Large 3Mistral AI
não medidonão medidonão medidonão medido1.427,7262.144US$ 0,50US$ 1,50não divulgadoR$ 7,69Apache 2.0verificado
Mistral Small 4Mistral AI
não medidonão medidonão medidonão medidonão medido256.000US$ 0,15US$ 0,60não divulgadoR$ 3,08Apache 2.0parcial
Muse Glimmer-30BMeta (Meta Superintelligence Labs)
não medidonão medido1.359,6não medidonão medido131.072sem preço de API oficialsem preço de API oficialsem preço de API oficialsem preço de API oficialApache 2.0verificado
Muse Spark 1.3Meta (Meta Superintelligence Labs)
não medidonão medido1.622,5xhigh de esforçonão medidonão medido1.048.576US$ 1,25US$ 4,25US$ 0,15R$ 21,78fechadoverificado
Qwen3.8-2.4T-A95BAlibaba (Qwen)
não medidonão medidonão medidonão medidonão medido262.144sem preço de API oficialsem preço de API oficialsem preço de API oficialsem preço de API oficialQwen3.8-Max Licenseparcial
Qwen3.8-MaxAlibaba (Qwen)
não medido92,7%xhigh de esforço1.686,1max de esforço5,51%max de esforço1.479,9max de esforço1.000.000US$ 2,00US$ 6,00não divulgadoR$ 30,75fechadoverificado
  • GPT-6 Astra
    verificado
    Índice Epoch
    169,23empate técnico com Claude Fable 5, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol
    GPQA-D
    95,8%max de esforçoempate técnico com Gemini 3.1 Pro Preview, Grok 4.6, Claude Opus 5, GPT-5.6 Sol, GPT-5.6 Terra, Kimi K3
    Arena código
    1.797,0max de esforçoempate técnico com Claude Fable 5.1
    Arena agentes
    não medido
    Arena texto
    não medido
    Contexto
    1.050.000
    Entrada US$/M
    US$ 10,00
    Saída US$/M
    US$ 50,00
    Cache leitura
    US$ 1,00
    Custo R$ por 1M de saída
    R$ 256,27
    Pesos abertos
    fechado
  • Claude Fable 5
    verificado
    Índice Epoch
    162,90empate técnico com GPT-6 Astra
    GPQA-D
    85,9%max de esforço
    Arena código
    1.629,1
    Arena agentes
    10,23%high de esforço
    Arena texto
    1.494,1
    Contexto
    1.000.000
    Entrada US$/M
    US$ 10,00
    Saída US$/M
    US$ 50,00
    Cache leitura
    US$ 1,00
    Custo R$ por 1M de saída
    R$ 256,27
    Pesos abertos
    fechado
  • Claude Fable 5.1
    verificado
    Índice Epoch
    162,88empate técnico com GPT-6 Astra
    GPQA-D
    não medido
    Arena código
    1.762,3max de esforçoempate técnico com GPT-6 Astra
    Arena agentes
    15,87%max de esforçoempate técnico com Claude Opus 5
    Arena texto
    1.513,7max de esforçoempate técnico com Claude Opus 5, Gemini 3.8 Flash
    Contexto
    1.000.000
    Entrada US$/M
    US$ 10,00
    Saída US$/M
    US$ 50,00
    Cache leitura
    US$ 0,25
    Custo R$ por 1M de saída
    R$ 256,27
    Pesos abertos
    fechado
  • Claude Opus 5
    verificado
    Índice Epoch
    162,33empate técnico com GPT-6 Astra
    GPQA-D
    93,9%max de esforçoempate técnico com GPT-6 Astra
    Arena código
    1.687,6max de esforço
    Arena agentes
    12,68%high de esforçoempate técnico com Claude Fable 5.1
    Arena texto
    1.505,0high de esforçoempate técnico com Claude Fable 5.1
    Contexto
    1.000.000
    Entrada US$/M
    US$ 5,00
    Saída US$/M
    US$ 25,00
    Cache leitura
    US$ 0,50
    Custo R$ por 1M de saída
    R$ 128,13
    Pesos abertos
    fechado
  • GPT-5.6 Sol
    parcial
    Índice Epoch
    162,03empate técnico com GPT-6 Astra
    GPQA-D
    93,5%max de esforçoempate técnico com GPT-6 Astra
    Arena código
    1.617,4xhigh de esforço
    Arena agentes
    9,31%xhigh de esforço
    Arena texto
    1.454,9xhigh de esforço
    Contexto
    1.050.000
    Entrada US$/M
    US$ 4,00
    Saída US$/M
    US$ 20,00
    Cache leitura
    US$ 0,40
    Custo R$ por 1M de saída
    R$ 102,51
    Pesos abertos
    fechado
  • GPT-5.6 Terra
    parcial
    Índice Epoch
    159,18
    GPQA-D
    93,3%max de esforçoempate técnico com GPT-6 Astra
    Arena código
    1.519,7xhigh de esforço
    Arena agentes
    3,04%xhigh de esforço
    Arena texto
    1.446,8xhigh de esforço
    Contexto
    1.050.000
    Entrada US$/M
    US$ 2,00
    Saída US$/M
    US$ 12,00
    Cache leitura
    US$ 0,20
    Custo R$ por 1M de saída
    R$ 61,50
    Pesos abertos
    fechado
  • Kimi K3
    parcial
    Índice Epoch
    157,62
    GPQA-D
    93,1%max de esforçoempate técnico com GPT-6 Astra
    Arena código
    1.674,4max de esforço
    Arena agentes
    7,96%max de esforço
    Arena texto
    1.476,0max de esforço
    Contexto
    1.048.576
    Entrada US$/M
    US$ 3,00
    Saída US$/M
    US$ 15,00
    Cache leitura
    US$ 0,30
    Custo R$ por 1M de saída
    R$ 76,88
    Pesos abertos
    Kimi K3 License
  • GPT-5.6 Luna
    parcial
    Índice Epoch
    156,33
    GPQA-D
    91,6%max de esforço
    Arena código
    1.519,5xhigh de esforço
    Arena agentes
    2,09%xhigh de esforço
    Arena texto
    1.430,3xhigh de esforço
    Contexto
    1.050.000
    Entrada US$/M
    US$ 0,20
    Saída US$/M
    US$ 1,20
    Cache leitura
    US$ 0,02
    Custo R$ por 1M de saída
    R$ 6,15
    Pesos abertos
    fechado
  • Grok 4.6
    verificado
    Índice Epoch
    156,33
    GPQA-D
    94,0%high de esforçoempate técnico com GPT-6 Astra
    Arena código
    1.624,9high de esforço
    Arena agentes
    4,98%xhigh de esforço
    Arena texto
    não medido
    Contexto
    500.000
    Entrada US$/M
    US$ 2,00
    Saída US$/M
    US$ 6,00
    Cache leitura
    US$ 0,50
    Custo R$ por 1M de saída
    R$ 30,75
    Pesos abertos
    fechado
  • Claude Sonnet 5
    verificado
    Índice Epoch
    156,16
    GPQA-D
    90,5%xhigh de esforço
    Arena código
    1.536,9high de esforço
    Arena agentes
    7,41%high de esforço
    Arena texto
    1.443,2high de esforço
    Contexto
    1.000.000
    Entrada US$/M
    US$ 2,00
    Saída US$/M
    US$ 10,00
    Cache leitura
    US$ 0,20
    Custo R$ por 1M de saída
    R$ 51,25
    Pesos abertos
    fechado
  • GLM-5.3
    parcial
    Índice Epoch
    155,30
    GPQA-D
    90,9%max de esforço
    Arena código
    1.609,0max de esforço
    Arena agentes
    3,80%max de esforço
    Arena texto
    1.473,5max de esforço
    Contexto
    1.000.000
    Entrada US$/M
    US$ 1,40
    Saída US$/M
    US$ 4,40
    Cache leitura
    US$ 0,26
    Custo R$ por 1M de saída
    R$ 22,55
    Pesos abertos
    GLM-5.3 License
  • Gemini 3.1 Pro Preview
    parcial
    Índice Epoch
    154,90
    GPQA-D
    94,4%high de esforçoempate técnico com GPT-6 Astra
    Arena código
    1.445,5
    Arena agentes
    -3,73%
    Arena texto
    1.480,1
    Contexto
    1.048.576
    Entrada US$/M
    US$ 2,00
    Saída US$/M
    US$ 12,00
    Cache leitura
    não divulgado
    Custo R$ por 1M de saída
    R$ 61,50
    Pesos abertos
    fechado
  • DeepSeek-V4-Pro
    verificado
    Índice Epoch
    149,20
    GPQA-D
    91,7%max de esforço
    Arena código
    1.581,7high de esforço
    Arena agentes
    5,43%high de esforço
    Arena texto
    1.451,1
    Contexto
    1.000.000
    Entrada US$/M
    US$ 1,32tarifa de pico; há tarifa menor fora do pico
    Saída US$/M
    US$ 3,96tarifa de pico; há tarifa menor fora do pico
    Cache leitura
    US$ 0,044
    Custo R$ por 1M de saída
    R$ 20,30
    Pesos abertos
    MIT
  • MiniMax M3
    verificado
    Índice Epoch
    146,57
    GPQA-D
    90,9%
    Arena código
    1.487,3
    Arena agentes
    -3,76%
    Arena texto
    1.435,2
    Contexto
    1.000.000
    Entrada US$/M
    US$ 0,30
    Saída US$/M
    US$ 1,20
    Cache leitura
    US$ 0,06
    Custo R$ por 1M de saída
    R$ 6,15
    Pesos abertos
    MiniMax Community License
  • DeepSeek-V4-Flash
    verificado
    Índice Epoch
    146,26
    GPQA-D
    91,0%max de esforço
    Arena código
    1.579,6high de esforço
    Arena agentes
    3,29%high de esforço
    Arena texto
    1.431,9
    Contexto
    1.000.000
    Entrada US$/M
    US$ 0,44tarifa de pico; há tarifa menor fora do pico
    Saída US$/M
    US$ 1,32tarifa de pico; há tarifa menor fora do pico
    Cache leitura
    US$ 0,014
    Custo R$ por 1M de saída
    R$ 6,77
    Pesos abertos
    MIT
  • Claude Haiku 4.5
    verificado
    Índice Epoch
    142,41
    GPQA-D
    71,2%
    Arena código
    não medido
    Arena agentes
    não medido
    Arena texto
    não medido
    Contexto
    200.000
    Entrada US$/M
    US$ 1,00
    Saída US$/M
    US$ 5,00
    Cache leitura
    US$ 0,10
    Custo R$ por 1M de saída
    R$ 25,63
    Pesos abertos
    fechado
  • Mistral Medium 3.5
    verificado
    Índice Epoch
    141,37
    GPQA-D
    não medido
    Arena código
    não medido
    Arena agentes
    -7,16%medium de esforço
    Arena texto
    1.421,0medium de esforço
    Contexto
    262.144
    Entrada US$/M
    US$ 1,50
    Saída US$/M
    US$ 7,50
    Cache leitura
    não divulgado
    Custo R$ por 1M de saída
    R$ 38,44
    Pesos abertos
    Modified MIT
  • Gemini 3.8 Flash
    verificado
    Índice Epoch
    não medido
    GPQA-D
    não medido
    Arena código
    1.567,2high de esforço
    Arena agentes
    5,47%high de esforço
    Arena texto
    1.495,2high de esforçoempate técnico com Claude Fable 5.1
    Contexto
    1.048.576
    Entrada US$/M
    US$ 0,75
    Saída US$/M
    US$ 3,75
    Cache leitura
    não divulgado
    Custo R$ por 1M de saída
    R$ 19,22
    Pesos abertos
    fechado
  • Mistral Large 3
    verificado
    Índice Epoch
    não medido
    GPQA-D
    não medido
    Arena código
    não medido
    Arena agentes
    não medido
    Arena texto
    1.427,7
    Contexto
    262.144
    Entrada US$/M
    US$ 0,50
    Saída US$/M
    US$ 1,50
    Cache leitura
    não divulgado
    Custo R$ por 1M de saída
    R$ 7,69
    Pesos abertos
    Apache 2.0
  • Mistral Small 4
    parcial
    Índice Epoch
    não medido
    GPQA-D
    não medido
    Arena código
    não medido
    Arena agentes
    não medido
    Arena texto
    não medido
    Contexto
    256.000
    Entrada US$/M
    US$ 0,15
    Saída US$/M
    US$ 0,60
    Cache leitura
    não divulgado
    Custo R$ por 1M de saída
    R$ 3,08
    Pesos abertos
    Apache 2.0
  • Muse Glimmer-30B
    verificado
    Índice Epoch
    não medido
    GPQA-D
    não medido
    Arena código
    1.359,6
    Arena agentes
    não medido
    Arena texto
    não medido
    Contexto
    131.072
    Entrada US$/M
    sem preço de API oficial
    Saída US$/M
    sem preço de API oficial
    Cache leitura
    sem preço de API oficial
    Custo R$ por 1M de saída
    sem preço de API oficial
    Pesos abertos
    Apache 2.0
  • Muse Spark 1.3
    verificado
    Índice Epoch
    não medido
    GPQA-D
    não medido
    Arena código
    1.622,5xhigh de esforço
    Arena agentes
    não medido
    Arena texto
    não medido
    Contexto
    1.048.576
    Entrada US$/M
    US$ 1,25
    Saída US$/M
    US$ 4,25
    Cache leitura
    US$ 0,15
    Custo R$ por 1M de saída
    R$ 21,78
    Pesos abertos
    fechado
  • Qwen3.8-2.4T-A95B
    parcial
    Índice Epoch
    não medido
    GPQA-D
    não medido
    Arena código
    não medido
    Arena agentes
    não medido
    Arena texto
    não medido
    Contexto
    262.144
    Entrada US$/M
    sem preço de API oficial
    Saída US$/M
    sem preço de API oficial
    Cache leitura
    sem preço de API oficial
    Custo R$ por 1M de saída
    sem preço de API oficial
    Pesos abertos
    Qwen3.8-Max License
  • Qwen3.8-Max
    verificado
    Índice Epoch
    não medido
    GPQA-D
    92,7%xhigh de esforço
    Arena código
    1.686,1max de esforço
    Arena agentes
    5,51%max de esforço
    Arena texto
    1.479,9max de esforço
    Contexto
    1.000.000
    Entrada US$/M
    US$ 2,00
    Saída US$/M
    US$ 6,00
    Cache leitura
    não divulgado
    Custo R$ por 1M de saída
    R$ 30,75
    Pesos abertos
    fechado
O que cada coluna mede
Índice Epoch
Epoch Capabilities Index. medição independente. 17 modelos com resultado. a fonte publica intervalo, e 15 dos 16 pares vizinhos se sobrepõem: ordenar por esta coluna não separa esses modelos. a marca de empate na célula é reservada ao topo, entre o líder e quem cruza o intervalo dele. Fonte: Epoch AI, AI Benchmarking Hub (epoch_capabilities_index/eci_scores.csv do benchmark_data.zip), lido em 6 set 2026
GPQA-D
GPQA Diamond. versão diamond. medição independente. 16 modelos com resultado. a fonte publica intervalo, e 13 dos 15 pares vizinhos se sobrepõem: ordenar por esta coluna não separa esses modelos. a marca de empate na célula é reservada ao topo, entre o líder e quem cruza o intervalo dele. Fonte: Epoch AI, AI Benchmarking Hub (gpqa_diamond.csv do benchmark_data.zip), lido em 6 set 2026
Arena código
Arena WebDev (Code Arena). versão config webdev, split latest. preferência humana. 19 modelos com resultado. a fonte publica intervalo, e 10 dos 18 pares vizinhos se sobrepõem: ordenar por esta coluna não separa esses modelos. a marca de empate na célula é reservada ao topo, entre o líder e quem cruza o intervalo dele. Fonte: LMArena, dataset lmarena-ai/leaderboard-dataset (config webdev, split latest), lido em 6 set 2026
Arena agentes
Arena Agent. versão config agent, split latest. preferência humana. 17 modelos com resultado. a fonte publica intervalo, e 14 dos 16 pares vizinhos se sobrepõem: ordenar por esta coluna não separa esses modelos. a marca de empate na célula é reservada ao topo, entre o líder e quem cruza o intervalo dele. Fonte: LMArena, dataset lmarena-ai/leaderboard-dataset (config agent, split latest), lido em 6 set 2026
Arena texto
Arena Text. versão dataset lmarena-ai/leaderboard-dataset, config text, split latest. preferência humana. 17 modelos com resultado. a fonte publica intervalo, e 14 dos 16 pares vizinhos se sobrepõem: ordenar por esta coluna não separa esses modelos. a marca de empate na célula é reservada ao topo, entre o líder e quem cruza o intervalo dele. Fonte: LMArena, dataset lmarena-ai/leaderboard-dataset (config text, split latest), lido em 6 set 2026
Custo R$ por 1M de saída
custo_brl_por_milhao_de_saida = preço de saída em US$ x cotação PTAX. Cotação de R$ 5,1253 por US$ 1,00, de 4 set 2026, 13:03:59, do Banco Central. IOF e spread ficam fora do cálculo.

Fontes desta tabela: 1. OpenAI, documentação de API, lido em 6 set 2026; 2. OpenAI, tabela oficial de preços, lido em 6 set 2026; 3. Banco Central do Brasil, PTAX (Olinda, CotacaoDolarPeriodo), lido em 6 set 2026; 4. Epoch AI, AI Benchmarking Hub (epoch_capabilities_index/eci_scores.csv do benchmark_data.zip), lido em 6 set 2026; 5. Epoch AI, AI Benchmarking Hub (gpqa_diamond.csv do benchmark_data.zip), lido em 6 set 2026; 6. Epoch AI, AI Benchmarking Hub (arc_agi_2_external.csv do benchmark_data.zip), lido em 6 set 2026; 7. LMArena, dataset lmarena-ai/leaderboard-dataset (config webdev, split latest), lido em 6 set 2026; 8. Anthropic, documentação da Claude API, lido em 6 set 2026; 9. Anthropic, tabela oficial de preços, lido em 6 set 2026; 10. LMArena, dataset lmarena-ai/leaderboard-dataset (config agent, split latest), lido em 6 set 2026; 11. LMArena, dataset lmarena-ai/leaderboard-dataset (config text, split latest), lido em 6 set 2026; 12. LMArena, dataset lmarena-ai/leaderboard-dataset (config vision, split latest), lido em 6 set 2026; 13. Anthropic, documentação da Claude API, lido em 6 set 2026; 14. Anthropic, documentação da Claude API, lido em 6 set 2026; 15. OpenAI, documentação de API, lido em 6 set 2026; 16. Moonshot AI, model card no Hugging Face, lido em 6 set 2026; 17. Moonshot AI, preço por modelo (chat-k3), lido em 6 set 2026; 18. Moonshot AI, LICENSE do repositorio Kimi-K3 no Hugging Face, lido em 6 set 2026; 19. xAI, documentação de modelos, lido em 6 set 2026; 20. Anthropic, documentação da Claude API, lido em 6 set 2026; 21. Z.ai, lido em 6 set 2026; 22. Z.AI Developer Document, Pricing, lido em 6 set 2026; 23. Z.ai, LICENSE do repositorio GLM-5.3 no Hugging Face, lido em 6 set 2026; 24. Google AI for Developers, Gemini 3.1 Pro Preview, lido em 6 set 2026; 25. Google, preços da Gemini API, lido em 6 set 2026; 26. Google, documentação da Gemini API, lido em 6 set 2026; 27. DeepSeek, documentação de API, lido em 6 set 2026; 28. DeepSeek, documentação de API, lido em 6 set 2026; 29. MiniMax, anúncio do M3, lido em 6 set 2026; 30. MiniMax API Docs, Pay as You Go (Standard), lido em 6 set 2026; 31. Anthropic, documentação da Claude API, lido em 6 set 2026; 32. models.dev, catalogo aberto (api.json), lido em 6 set 2026; 33. Mistral, Pricing (API, Standard), lido em 6 set 2026; 34. Mistral AI, catalogo com licenças, lido em 6 set 2026; 35. Google, documentação da Gemini API, lido em 6 set 2026; 36. Meta AI Research, model card no Hugging Face, lido em 6 set 2026; 37. Meta Model API, Models, lido em 6 set 2026; 38. Meta Model API, Pricing and rate limits, lido em 6 set 2026; 39. Meta AI Research, lido em 6 set 2026; 40. Qwen, model card no Hugging Face, lido em 6 set 2026; 41. Qwen, LICENSE do repositorio Qwen3.8-2.4T-A95B no Hugging Face, lido em 6 set 2026; 42. Alibaba Cloud Press Room, Alibaba unveils Qwen3.8-Max, lido em 6 set 2026; 43. Alibaba Cloud Model Studio, Model inference pricing (international), lido em 6 set 2026; 44. Qwen, model card do Qwen3.8-2.4T-A95B no Hugging Face, lido em 6 set 2026.

Comparar preço por milhão de tokens entre fabricantes sem considerar o tokenizador distorce a conta.

A coluna em reais converte o preço de saída publicado pelo fabricante pela cotação PTAX de venda do Banco Central, com data e hora ao lado do número. Ela não usa perfil de carga: é conversão de preço de tabela, não estimativa de conta mensal. A conta mensal por caso de uso fica na seção de custo por caso.

Benchmarks comparáveis

Cada grupo reúne só números que podem ser comparados: mesma versão, mesma fonte quando o placar é do fabricante, ou medição independente. Grupo com menos de três modelos não vira gráfico, sai como lista.

Mesmo nome, versão diferentePlacar com o mesmo nome pode medir coisas diferentes conforme a versão e as regras. Os grupos abaixo não são comparáveis entre si, e é por isso que a página troca de grupo em vez de juntar tudo numa lista só.
ARC-AGI-2 aparece nesta lista em mais de um recorte: 1. Não são comparáveis entre si.
medição independenteversão 2% de acertoEpoch AI, AI Benchmarking Hub (arc_agi_2_external.csv do benchmark_data.zip), 03/09/2026
GPT-6 Astra, esforço max, 95,0%, medição independenteGPT-6 Astra, esforço max95,0%Imedição independenteGPT-6 Astra, esforço xhigh, 93,3%, medição independenteGPT-6 Astra, esforço xhigh93,3%Imedição independenteGPT-5.6 Sol, esforço max, 92,5%, medição independenteGPT-5.6 Sol, esforço max92,5%Imedição independenteGPT-6 Astra, esforço high, 92,1%, medição independenteGPT-6 Astra, esforço high92,1%Imedição independenteGPT-6 Astra, esforço medium, 92,1%, medição independenteGPT-6 Astra, esforço medium92,1%Imedição independenteClaude Opus 5, esforço max, 90,4%, medição independenteClaude Opus 5, esforço max90,4%Imedição independenteClaude Fable 5.1, esforço max, 90,0%, medição independenteClaude Fable 5.1, esforço max90,0%Imedição independenteClaude Fable 5.1, esforço xhigh, 90,0%, medição independenteClaude Fable 5.1, esforço xhigh90,0%Imedição independenteGPT-5.6 Sol, esforço xhigh, 90,0%, medição independenteGPT-5.6 Sol, esforço xhigh90,0%Imedição independenteClaude Fable 5, esforço max, 89,2%, medição independenteClaude Fable 5, esforço max89,2%Imedição independenteClaude Fable 5.1, esforço high, 88,8%, medição independenteClaude Fable 5.1, esforço high88,8%Imedição independenteClaude Fable 5, esforço xhigh, 88,3%, medição independenteClaude Fable 5, esforço xhigh88,3%Imedição independenteClaude Opus 5, esforço high, 88,3%, medição independenteClaude Opus 5, esforço high88,3%Imedição independenteClaude Fable 5, esforço high, 87,5%, medição independenteClaude Fable 5, esforço high87,5%Imedição independenteClaude Fable 5.1, esforço medium, 86,3%, medição independenteClaude Fable 5.1, esforço medium86,3%Imedição independenteGPT-5.6 Sol, esforço high, 85,4%, medição independenteGPT-5.6 Sol, esforço high85,4%Imedição independenteGPT-6 Astra, esforço low, 85,4%, medição independenteGPT-6 Astra, esforço low85,4%Imedição independenteGPT-5.6 Terra, esforço max, 83,9%, medição independenteGPT-5.6 Terra, esforço max83,9%Imedição independenteClaude Fable 5, esforço medium, 82,5%, medição independenteClaude Fable 5, esforço medium82,5%Imedição independenteClaude Fable 5.1, esforço low, 78,3%, medição independenteClaude Fable 5.1, esforço low78,3%Imedição independenteGemini 3.1 Pro Preview, 77,1%, medição independenteGemini 3.1 Pro Preview77,1%Imedição independenteClaude Fable 5, esforço low, 76,8%, medição independenteClaude Fable 5, esforço low76,8%Imedição independenteGPT-5.6 Terra, esforço xhigh, 74,2%, medição independenteGPT-5.6 Terra, esforço xhigh74,2%Imedição independenteGPT-5.6 Sol, esforço medium, 67,1%, medição independenteGPT-5.6 Sol, esforço medium67,1%Imedição independenteGPT-5.6 Terra, esforço high, 67,1%, medição independenteGPT-5.6 Terra, esforço high67,1%Imedição independenteGrok 4.6, esforço xhigh, 67,1%, medição independenteGrok 4.6, esforço xhigh67,1%Imedição independenteGrok 4.6, esforço high, 65,1%, medição independenteGrok 4.6, esforço high65,1%Imedição independenteDeepSeek-V4-Flash, esforço max, 61,4%, medição independenteDeepSeek-V4-Flash, esforço max61,4%Imedição independenteDeepSeek-V4-Pro, esforço max, 61,3%, medição independenteDeepSeek-V4-Pro, esforço max61,3%Imedição independenteGrok 4.6, esforço medium, 61,3%, medição independenteGrok 4.6, esforço medium61,3%Imedição independenteKimi K3, esforço max, 60,4%, medição independenteKimi K3, esforço max60,4%Imedição independenteDeepSeek-V4-Pro, esforço high, 59,7%, medição independenteDeepSeek-V4-Pro, esforço high59,7%Imedição independenteGPT-6 Astra, 59,6%, medição independenteGPT-6 Astra59,6%Imedição independenteGPT-5.6 Luna, esforço max, 59,5%, medição independenteGPT-5.6 Luna, esforço max59,5%Imedição independenteDeepSeek-V4-Pro, esforço low, 56,3%, medição independenteDeepSeek-V4-Pro, esforço low56,3%Imedição independenteDeepSeek-V4-Flash, esforço high, 56,0%, medição independenteDeepSeek-V4-Flash, esforço high56,0%Imedição independenteKimi K3, esforço high, 55,0%, medição independenteKimi K3, esforço high55,0%Imedição independenteGPT-5.6 Luna, esforço xhigh, 47,6%, medição independenteGPT-5.6 Luna, esforço xhigh47,6%Imedição independenteDeepSeek-V4-Flash, esforço low, 46,0%, medição independenteDeepSeek-V4-Flash, esforço low46,0%Imedição independenteGPT-5.6 Sol, esforço low, 42,5%, medição independenteGPT-5.6 Sol, esforço low42,5%Imedição independenteGPT-5.6 Terra, esforço medium, 37,5%, medição independenteGPT-5.6 Terra, esforço medium37,5%Imedição independenteGPT-5.6 Luna, esforço high, 29,3%, medição independenteGPT-5.6 Luna, esforço high29,3%Imedição independenteGrok 4.6, esforço low, 27,6%, medição independenteGrok 4.6, esforço low27,6%Imedição independenteGPT-5.6 Terra, esforço low, 18,8%, medição independenteGPT-5.6 Terra, esforço low18,8%Imedição independenteKimi K3, esforço low, 12,4%, medição independenteKimi K3, esforço low12,4%Imedição independenteGPT-5.6 Luna, esforço medium, 7,4%, medição independenteGPT-5.6 Luna, esforço medium7,4%Imedição independenteGPT-5.6 Luna, esforço low, 5,1%, medição independenteGPT-5.6 Luna, esforço low5,1%Imedição independenteClaude Haiku 4.5, 4,0%, medição independenteClaude Haiku 4.54,0%Imedição independenteDeepSeek-V4-Flash, 2,1%, medição independenteDeepSeek-V4-Flash2,1%Imedição independenteDeepSeek-V4-Pro, 0,8%, medição independenteDeepSeek-V4-Pro0,8%Imedição independente
Ver os mesmos valores em tabela
ARC-AGI-2. versão 2. % de acerto. medição independente
ModeloConfiguraçãoValorIntervaloEvidência
GPT-6 Astramax95,0%sem intervalo publicadomedição independente
GPT-6 Astraxhigh93,3%sem intervalo publicadomedição independente
GPT-5.6 Solmax92,5%sem intervalo publicadomedição independente
GPT-6 Astrahigh92,1%sem intervalo publicadomedição independente
GPT-6 Astramedium92,1%sem intervalo publicadomedição independente
Claude Opus 5max90,4%sem intervalo publicadomedição independente
Claude Fable 5.1max90,0%sem intervalo publicadomedição independente
Claude Fable 5.1xhigh90,0%sem intervalo publicadomedição independente
GPT-5.6 Solxhigh90,0%sem intervalo publicadomedição independente
Claude Fable 5max89,2%sem intervalo publicadomedição independente
Claude Fable 5.1high88,8%sem intervalo publicadomedição independente
Claude Fable 5xhigh88,3%sem intervalo publicadomedição independente
Claude Opus 5high88,3%sem intervalo publicadomedição independente
Claude Fable 5high87,5%sem intervalo publicadomedição independente
Claude Fable 5.1medium86,3%sem intervalo publicadomedição independente
GPT-5.6 Solhigh85,4%sem intervalo publicadomedição independente
GPT-6 Astralow85,4%sem intervalo publicadomedição independente
GPT-5.6 Terramax83,9%sem intervalo publicadomedição independente
Claude Fable 5medium82,5%sem intervalo publicadomedição independente
Claude Fable 5.1low78,3%sem intervalo publicadomedição independente
Gemini 3.1 Pro Previewnão informada77,1%sem intervalo publicadomedição independente
Claude Fable 5low76,8%sem intervalo publicadomedição independente
GPT-5.6 Terraxhigh74,2%sem intervalo publicadomedição independente
GPT-5.6 Solmedium67,1%sem intervalo publicadomedição independente
GPT-5.6 Terrahigh67,1%sem intervalo publicadomedição independente
Grok 4.6xhigh67,1%sem intervalo publicadomedição independente
Grok 4.6high65,1%sem intervalo publicadomedição independente
DeepSeek-V4-Flashmax61,4%sem intervalo publicadomedição independente
DeepSeek-V4-Promax61,3%sem intervalo publicadomedição independente
Grok 4.6medium61,3%sem intervalo publicadomedição independente
Kimi K3max60,4%sem intervalo publicadomedição independente
DeepSeek-V4-Prohigh59,7%sem intervalo publicadomedição independente
GPT-6 Astrapadrão59,6%sem intervalo publicadomedição independente
GPT-5.6 Lunamax59,5%sem intervalo publicadomedição independente
DeepSeek-V4-Prolow56,3%sem intervalo publicadomedição independente
DeepSeek-V4-Flashhigh56,0%sem intervalo publicadomedição independente
Kimi K3high55,0%sem intervalo publicadomedição independente
GPT-5.6 Lunaxhigh47,6%sem intervalo publicadomedição independente
DeepSeek-V4-Flashlow46,0%sem intervalo publicadomedição independente
GPT-5.6 Sollow42,5%sem intervalo publicadomedição independente
GPT-5.6 Terramedium37,5%sem intervalo publicadomedição independente
GPT-5.6 Lunahigh29,3%sem intervalo publicadomedição independente
Grok 4.6low27,6%sem intervalo publicadomedição independente
GPT-5.6 Terralow18,8%sem intervalo publicadomedição independente
Kimi K3low12,4%sem intervalo publicadomedição independente
GPT-5.6 Lunamedium7,4%sem intervalo publicadomedição independente
GPT-5.6 Lunalow5,1%sem intervalo publicadomedição independente
Claude Haiku 4.5não informada4,0%sem intervalo publicadomedição independente
DeepSeek-V4-Flashpadrão2,1%sem intervalo publicadomedição independente
DeepSeek-V4-Propadrão0,8%sem intervalo publicadomedição independente
  • Barra maior é resultado melhor.
  • A faixa em volta da barra é o intervalo publicado pela fonte. Quando duas faixas se cruzam, a página marca empate técnico.
  • O eixo começa no zero em todos os grupos. Em placar de pontos, isso deixa as barras parecidas de propósito: cortar o eixo exageraria diferenças que o próprio intervalo diz não serem significativas.
Grupos com só dois modelos (62)

Estes grupos comparam apenas dois modelos neste snapshot. Sairiam como gráfico enganoso, então aparecem como lista, com a fonte de cada valor. Grupo com um único modelo não é comparação e fica fora desta lista.

  • BrowseComp, versão não declarada reportado pelo fabricante
    DeepSeek-V4-Pro: 83,4%DeepSeek-V4-Flash: 73,2%
  • GPQA Diamond, versão diamond reportado pelo fabricante
    DeepSeek-V4-Pro: 90,1%DeepSeek-V4-Flash: 88,1%
  • Humanity's Last Exam, versão full, com ferramentas reportado pelo fabricante
    DeepSeek-V4-Pro: 48,2%DeepSeek-V4-Flash: 45,1%
  • LiveCodeBench, versão não declarada reportado pelo fabricante
    DeepSeek-V4-Pro: 93,5%DeepSeek-V4-Flash: 91,6%
  • MCP-Atlas, versão não declarada reportado pelo fabricante
    DeepSeek-V4-Pro: 73,6%DeepSeek-V4-Flash: 69,0%
  • MMLU-Pro, versão não declarada reportado pelo fabricante
    DeepSeek-V4-Pro: 87,5%DeepSeek-V4-Flash: 86,2%
  • SimpleQA-Verified, versão não declarada reportado pelo fabricante
    DeepSeek-V4-Pro: 57,9%DeepSeek-V4-Flash: 34,1%
  • SWE-bench Pro, versão pro (publico) reportado pelo fabricante
    DeepSeek-V4-Pro: 55,4%DeepSeek-V4-Flash: 52,6%
  • SWE-bench Verified, versão verified reportado pelo fabricante
    DeepSeek-V4-Pro: 80,6%DeepSeek-V4-Flash: 79,0%
  • Terminal-Bench, versão 2.0 reportado pelo fabricante
    DeepSeek-V4-Pro: 67,9%DeepSeek-V4-Flash: 56,9%
  • Toolathlon, versão não declarada reportado pelo fabricante
    DeepSeek-V4-Pro: 51,8%DeepSeek-V4-Flash: 47,8%
  • SWE-bench Verified, versão verified medição independente
    DeepSeek-V4-Pro: 77,6%Gemini 3.1 Pro Preview: 75,6%
  • BioMysteryBench (human difficult), versão human difficult medido por concorrente
    Claude Opus 5: 49,4%Claude Sonnet 5: 34,1%
  • BioMysteryBench (human solvable), versão human solvable medido por concorrente
    Claude Opus 5: 90,1%Claude Sonnet 5: 87,5%
  • CharXiv Reasoning, versão não declarada medido por concorrente
    Claude Opus 5: 83,7%Claude Sonnet 5: 70,1%
  • DeepSWE, versão 1.1 medido por concorrente
    Claude Opus 5: 74,0%Claude Sonnet 5: 53,8%
  • GDP.PDF, versão não declarada medido por concorrente
    Claude Opus 5: 37,0%Claude Sonnet 5: 28,0%
  • GDPval-AA, versão v2 medido por concorrente
    Claude Opus 5: 1.824Claude Sonnet 5: 1.584
  • Harvey's Legal Agent Benchmark, versão não declarada medido por concorrente
    Claude Opus 5: 6,7%Claude Sonnet 5: 5,0%
  • HLE-Verified, versão verified medido por concorrente
    Claude Opus 5: 54,4%Claude Sonnet 5: 31,0%
  • LABBench2, versão não declarada medido por concorrente
    Claude Opus 5: 84,2%Claude Sonnet 5: 80,1%
  • LVBench, versão não declarada medido por concorrente
    Claude Opus 5: 75,4%Claude Sonnet 5: 68,5%
  • OSWorld 2.0, versão 2.0, partial score medido por concorrente
    Claude Opus 5: 75,4%Claude Sonnet 5: 42,6%
  • Terminal-Bench, versão 2.1 medido por concorrente
    Claude Opus 5: 89,1%Claude Sonnet 5: 80,4%
  • Terminal-Bench, versão 4.0 medido por concorrente
    Claude Opus 5: 51,8%Claude Sonnet 5: 12,4%
  • Vals Finance Agent, versão v2 medido por concorrente
    Claude Opus 5: 58,6Claude Sonnet 5: 53,9
  • BioMysteryBench (human difficult), versão human difficult medido por concorrente
    GPT-5.6 Terra: 49,4%GPT-5.6 Sol: 44,7%
  • BioMysteryBench (human solvable), versão human solvable medido por concorrente
    GPT-5.6 Terra: 83,8%GPT-5.6 Sol: 79,5%
  • CharXiv Reasoning, versão não declarada medido por concorrente
    GPT-5.6 Terra: 85,9%GPT-5.6 Sol: 85,8%
  • DeepSWE, versão 1.1 medido por concorrente
    GPT-5.6 Sol: 72,7%GPT-5.6 Terra: 69,6%
  • GDP.PDF, versão não declarada medido por concorrente
    GPT-5.6 Sol: 40,0%GPT-5.6 Terra: 29,0%
  • GDPval-AA, versão v2 medido por concorrente
    GPT-5.6 Sol: 1.710GPT-5.6 Terra: 1.528
  • Harvey's Legal Agent Benchmark, versão não declarada medido por concorrente
    GPT-5.6 Sol: 2,5%GPT-5.6 Terra: 0,8%
  • HLE-Verified, versão verified medido por concorrente
    GPT-5.6 Sol: 54,5%GPT-5.6 Terra: 51,1%
  • LABBench2, versão não declarada medido por concorrente
    GPT-5.6 Sol: 82,1%GPT-5.6 Terra: 81,2%
  • LVBench, versão não declarada medido por concorrente
    GPT-5.6 Sol: 82,1%GPT-5.6 Terra: 78,9%
  • OSWorld 2.0, versão 2.0, partial score medido por concorrente
    GPT-5.6 Sol: 62,6%GPT-5.6 Terra: 50,2%
  • Terminal-Bench, versão 2.1 medido por concorrente
    GPT-5.6 Sol: 88,8%GPT-5.6 Terra: 87,4%
  • Terminal-Bench, versão 4.0 medido por concorrente
    GPT-5.6 Sol: 37,3%GPT-5.6 Terra: 23,6%
  • Vals Finance Agent, versão v2 medido por concorrente
    GPT-5.6 Terra: 54,4GPT-5.6 Sol: 53,8
  • Agents' Last Exam (Score), metrica score do leaderboard oficial medido por concorrente
    Claude Opus 5: 55,5Claude Fable 5: 48,7
  • BrowseComp, versão não declarada medido por concorrente
    Claude Opus 5: 90,8%Claude Fable 5: 87,4%
  • Agents' Last Exam (Score), metrica score do leaderboard oficial reportado pelo fabricante
    GPT-6 Astra: 59,3GPT-5.6 Sol: 53,6
  • ARC-AGI-1, versão 1 reportado pelo fabricante
    GPT-6 Astra: 98,5%GPT-5.6 Sol: 97,5%
  • ARC-AGI-2, versão 2 reportado pelo fabricante
    GPT-6 Astra: 95,0%GPT-5.6 Sol: 92,5%
  • ARC-AGI-3, versão 3 reportado pelo fabricante
    GPT-6 Astra: 99,9%GPT-5.6 Sol: 7,8%
  • AutomationBench reportado pelo fabricante
    GPT-6 Astra: 41,4%GPT-5.6 Sol: 18,1%
  • BenchCAD, versão não declarada reportado pelo fabricante
    GPT-6 Astra: 95,9GPT-5.6 Sol: 83,3
  • BrowseComp, versão não declarada reportado pelo fabricante
    GPT-6 Astra: 91,5%GPT-5.6 Sol: 90,4%
  • DeepSWE, versão 1.1 reportado pelo fabricante
    GPT-6 Astra: 74,1%GPT-5.6 Sol: 72,7%
  • ExploitBench, versão não declarada reportado pelo fabricante
    GPT-6 Astra: 100,0%GPT-5.6 Sol: 78,5%
  • ExploitGym, versão não declarada reportado pelo fabricante
    GPT-6 Astra: 42,4%GPT-5.6 Sol: 30,3%
  • FrontierCode Extended, versão 1.1 reportado pelo fabricante
    GPT-6 Astra: 64,5GPT-5.6 Sol: 60,6
  • FrontierCode Main, versão 1.1 reportado pelo fabricante
    GPT-6 Astra: 53,3GPT-5.6 Sol: 47,5
  • GPQA Diamond, versão diamond reportado pelo fabricante
    GPT-6 Astra: 96,0%GPT-5.6 Sol: 94,6%
  • HealthBench Professional, versão não declarada reportado pelo fabricante
    GPT-6 Astra: 63,4GPT-5.6 Sol: 60,5
  • OpenAI MRCR v2, 8-needle, 256K a 512K, versão v2, 8-needle, 256K-512K reportado pelo fabricante
    GPT-6 Astra: 100,0%GPT-5.6 Sol: 91,5%
  • OpenAI MRCR v2, 8-needle, 512K a 1M, versão v2, 8-needle, 512K-1M reportado pelo fabricante
    GPT-6 Astra: 96,3%GPT-5.6 Sol: 73,8%
  • OSWorld 2.0, offline set, partial score, 2.0, v2026.08.08, offline set, partial score reportado pelo fabricante
    GPT-6 Astra: 72,6%GPT-5.6 Sol: 65,7%
  • ScreenSpot-Pro, versão não declarada reportado pelo fabricante
    GPT-6 Astra: 92,7%GPT-5.6 Sol: 76,9%
  • Terminal-Bench, versão 4.0 reportado pelo fabricante
    GPT-6 Astra: 57,9%GPT-5.6 Sol: 37,3%
  • Terminal-Bench Science, versão 0.1 reportado pelo fabricante
    GPT-6 Astra: 64,6%GPT-5.6 Sol: 22,4%

Este benchmark aparece em mais de um recorte neste snapshot. Compare dentro do grupo escolhido, nunca entre grupos.

Preço contra qualidade

Fronteira de Pareto

Cada ponto é um modelo. A posição horizontal é o preço combinado por milhão de tokens, e a vertical é o resultado no eixo de qualidade que você escolher. A linha tracejada é a fronteira de Pareto: nela ficam os modelos que nenhum outro do gráfico supera nas duas coisas ao mesmo tempo, ou seja, para chegar a um resultado melhor é preciso pagar mais. Ponto abaixo da linha custa mais do que outro modelo que entrega o mesmo, ou entrega menos pelo mesmo preço.

No ar: Epoch Capabilities Indexmedição independenteEpoch AI, AI Benchmarking Hub (epoch_capabilities_index/eci_scores.csv do benchmark_data.zip), 3 set 2026
GPT-6 Astra, Preço combinado: US$ 20,00, Epoch Capabilities Index: 169,23, Intervalo: 164,85 a 174,02, medição independente, 3 set 2026, na fronteira de preço e qualidade, empate técnico com Claude Fable 5, Claude Fable 5.1, Claude Opus 5, GPT-5.6 SolClaude Fable 5, Preço combinado: US$ 20,00, Epoch Capabilities Index: 162,9, Intervalo: 160,17 a 166,77, medição independente, 9 jun 2026, empate técnico com GPT-6 Astra, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol, GPT-5.6 TerraClaude Fable 5.1, Preço combinado: US$ 20,00, Epoch Capabilities Index: 162,88, Intervalo: 160,1 a 166,34, medição independente, 1 set 2026, empate técnico com GPT-6 Astra, Claude Fable 5, Claude Opus 5, GPT-5.6 Sol, GPT-5.6 Terra, Kimi K3Claude Opus 5, Preço combinado: US$ 10,00, Epoch Capabilities Index: 162,33, Intervalo: 159,75 a 165,78, medição independente, 24 jul 2026, na fronteira de preço e qualidade, empate técnico com GPT-6 Astra, Claude Fable 5, Claude Fable 5.1, GPT-5.6 Sol, GPT-5.6 Terra, Kimi K3GPT-5.6 Sol, Preço combinado: US$ 8,00, Epoch Capabilities Index: 162,03, Intervalo: 159,66 a 165, medição independente, 9 jul 2026, na fronteira de preço e qualidade, empate técnico com GPT-6 Astra, Claude Fable 5, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Terra, Kimi K3GPT-5.6 Terra, Preço combinado: US$ 4,50, Epoch Capabilities Index: 159,18, Intervalo: 156,6 a 161,61, medição independente, 9 jul 2026, na fronteira de preço e qualidade, empate técnico com Claude Fable 5, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol, Kimi K3, GPT-5.6 Luna, Grok 4.6, Claude Sonnet 5, GLM-5.3, Gemini 3.1 Pro PreviewKimi K3, Preço combinado: US$ 6,00, Epoch Capabilities Index: 157,62, Intervalo: 155,06 a 160,13, medição independente, 16 jul 2026, empate técnico com Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Grok 4.6, Claude Sonnet 5, GLM-5.3, Gemini 3.1 Pro PreviewGPT-5.6 Luna, Preço combinado: US$ 0,45, Epoch Capabilities Index: 156,33, Intervalo: 153,96 a 158,68, medição independente, 9 jul 2026, na fronteira de preço e qualidade, empate técnico com GPT-5.6 Terra, Kimi K3, Grok 4.6, Claude Sonnet 5, GLM-5.3, Gemini 3.1 Pro PreviewGrok 4.6, Preço combinado: US$ 3,00, Epoch Capabilities Index: 156,33, Intervalo: 154,53 a 158,44, medição independente, 12 ago 2026, empate técnico com GPT-5.6 Terra, Kimi K3, GPT-5.6 Luna, Claude Sonnet 5, GLM-5.3, Gemini 3.1 Pro PreviewClaude Sonnet 5, Preço combinado: US$ 4,00, Epoch Capabilities Index: 156,16, Intervalo: 153,77 a 158,36, medição independente, 30 jun 2026, empate técnico com GPT-5.6 Terra, Kimi K3, GPT-5.6 Luna, Grok 4.6, GLM-5.3, Gemini 3.1 Pro PreviewGLM-5.3, Preço combinado: US$ 2,15, Epoch Capabilities Index: 155,3, Intervalo: 153,14 a 157,68, medição independente, 14 ago 2026, empate técnico com GPT-5.6 Terra, Kimi K3, GPT-5.6 Luna, Grok 4.6, Claude Sonnet 5, Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview, Preço combinado: US$ 4,50, Epoch Capabilities Index: 154,9, Intervalo: 152,51 a 157,46, medição independente, 19 fev 2026, empate técnico com GPT-5.6 Terra, Kimi K3, GPT-5.6 Luna, Grok 4.6, Claude Sonnet 5, GLM-5.3DeepSeek-V4-Pro, Preço combinado: US$ 1,98, Epoch Capabilities Index: 149,2, Intervalo: 147,54 a 150,69, medição independente, 24 abr 2026, empate técnico com MiniMax M3, DeepSeek-V4-FlashMiniMax M3, Preço combinado: US$ 0,525, Epoch Capabilities Index: 146,57, Intervalo: 142,3 a 149,34, medição independente, 1 jun 2026, empate técnico com DeepSeek-V4-Pro, DeepSeek-V4-Flash, Claude Haiku 4.5, Mistral Medium 3.5DeepSeek-V4-Flash, Preço combinado: US$ 0,66, Epoch Capabilities Index: 146,26, Intervalo: 143,88 a 148,29, medição independente, 24 abr 2026, empate técnico com DeepSeek-V4-Pro, MiniMax M3, Claude Haiku 4.5Claude Haiku 4.5, Preço combinado: US$ 2,00, Epoch Capabilities Index: 142,41, Intervalo: 139,61 a 144,02, medição independente, 15 out 2025, empate técnico com MiniMax M3, DeepSeek-V4-Flash, Mistral Medium 3.5Mistral Medium 3.5, Preço combinado: US$ 3,00, Epoch Capabilities Index: 141,37, Intervalo: 138,98 a 143,44, medição independente, 28 abr 2026, empate técnico com MiniMax M3, Claude Haiku 4.5
Ver os mesmos números em tabela
Epoch Capabilities Index. índice. medição independente. USD por milhão de tokens
ModeloPreço combinadoResultadoIntervaloEvidênciaObservação
GPT-6 AstraUS$ 20,00169,23164,85 a 174,02medição independenteempate técnico com Claude Fable 5, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Solfronteira
Claude Fable 5US$ 20,00162,9160,17 a 166,77medição independenteempate técnico com GPT-6 Astra, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol, GPT-5.6 Terra
Claude Fable 5.1US$ 20,00162,88160,1 a 166,34medição independenteempate técnico com GPT-6 Astra, Claude Fable 5, Claude Opus 5, GPT-5.6 Sol, GPT-5.6 Terra, Kimi K3
Claude Opus 5US$ 10,00162,33159,75 a 165,78medição independenteempate técnico com GPT-6 Astra, Claude Fable 5, Claude Fable 5.1, GPT-5.6 Sol, GPT-5.6 Terra, Kimi K3fronteira
GPT-5.6 SolUS$ 8,00162,03159,66 a 165medição independenteempate técnico com GPT-6 Astra, Claude Fable 5, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Terra, Kimi K3fronteira
GPT-5.6 TerraUS$ 4,50159,18156,6 a 161,61medição independenteempate técnico com Claude Fable 5, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol, Kimi K3, GPT-5.6 Luna, Grok 4.6, Claude Sonnet 5, GLM-5.3, Gemini 3.1 Pro Previewfronteira
Kimi K3US$ 6,00157,62155,06 a 160,13medição independenteempate técnico com Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Grok 4.6, Claude Sonnet 5, GLM-5.3, Gemini 3.1 Pro Preview
GPT-5.6 LunaUS$ 0,45156,33153,96 a 158,68medição independenteempate técnico com GPT-5.6 Terra, Kimi K3, Grok 4.6, Claude Sonnet 5, GLM-5.3, Gemini 3.1 Pro Previewfronteira
Grok 4.6US$ 3,00156,33154,53 a 158,44medição independenteempate técnico com GPT-5.6 Terra, Kimi K3, GPT-5.6 Luna, Claude Sonnet 5, GLM-5.3, Gemini 3.1 Pro Preview
Claude Sonnet 5US$ 4,00156,16153,77 a 158,36medição independenteempate técnico com GPT-5.6 Terra, Kimi K3, GPT-5.6 Luna, Grok 4.6, GLM-5.3, Gemini 3.1 Pro Preview
GLM-5.3US$ 2,15155,3153,14 a 157,68medição independenteempate técnico com GPT-5.6 Terra, Kimi K3, GPT-5.6 Luna, Grok 4.6, Claude Sonnet 5, Gemini 3.1 Pro Preview
Gemini 3.1 Pro PreviewUS$ 4,50154,9152,51 a 157,46medição independenteempate técnico com GPT-5.6 Terra, Kimi K3, GPT-5.6 Luna, Grok 4.6, Claude Sonnet 5, GLM-5.3
DeepSeek-V4-ProUS$ 1,98149,2147,54 a 150,69medição independenteempate técnico com MiniMax M3, DeepSeek-V4-Flash
MiniMax M3US$ 0,525146,57142,3 a 149,34medição independenteempate técnico com DeepSeek-V4-Pro, DeepSeek-V4-Flash, Claude Haiku 4.5, Mistral Medium 3.5
DeepSeek-V4-FlashUS$ 0,66146,26143,88 a 148,29medição independenteempate técnico com DeepSeek-V4-Pro, MiniMax M3, Claude Haiku 4.5
Claude Haiku 4.5US$ 2,00142,41139,61 a 144,02medição independenteempate técnico com MiniMax M3, DeepSeek-V4-Flash, Mistral Medium 3.5
Mistral Medium 3.5US$ 3,00141,37138,98 a 143,44medição independenteempate técnico com MiniMax M3, Claude Haiku 4.5
  • A linha liga os modelos que ninguém supera nas duas coisas ao mesmo tempo: para cada ponto dela, não existe neste gráfico outro modelo mais barato e melhor neste eixo.
  • A etiqueta de evidência aparece pela cor e pela forma do ponto, nunca só pela cor. Neste eixo, cada ponto é um círculo: medição independente.
  • O eixo do preço é logarítmico: cada potência de dez recebe três marcas, em um, dois e cinco, porque a tabela vai de centavos a dezenas de dólares por milhão de tokens.
  • O eixo de qualidade não começa no zero, e sim no menor valor deste grupo: em placar de pontos Elo o zero não existe na escala. Compare pela barra de erro, não pela distância até a base.
  • A haste vertical é o intervalo publicado pela fonte. Quando dois intervalos se cruzam, a tabela marca empate técnico.
  • Cada ponto recebe foco pelo teclado e abre a mesma ficha que o mouse mostra.

Cada eixo é um grupo comparável só. Medição independente e número reportado pelo fabricante nunca dividem o mesmo eixo.

Custo por caso de uso

Custo mensal em reais para três volumes, calculado no momento em que a página é montada a partir do preço publicado pelo fabricante e do perfil de carga de cada caso. O perfil de carga é premissa da X-Apps e ainda não foi aprovado: por isso todo valor em reais aparece marcado, com a fórmula, as premissas e a cotação PTAX de venda do Banco Central com data e hora ao lado.

Melhor modelo de IA para chatbot: custo em reais e qualidade

Atendimento com system prompt fixo e histórico curto por conversa. O cache cobre o system prompt. Não inclui busca, ferramentas nem custo de infraestrutura. A escrita de cache fica fora do cálculo, então o custo de carga com cache alto é um piso.

Custo mensal em reais por modelo e por volume, com a marca de premissa a aprovar em cada valor.
Modelovolume pequenovolume médiovolume grande
MiniMax M3provedor minimax
R$ 30,44premissa a aprovar
R$ 304,44premissa a aprovar
R$ 3.044,43premissa a aprovar
DeepSeek-V4-Flashprovedor deepseek, tarifa de pico
R$ 34,47premissa a aprovar
R$ 344,73premissa a aprovar
R$ 3.447,28premissa a aprovar
Mistral Large 3provedor mistral, sem preço de cache: fator 1
R$ 61,50premissa a aprovar
R$ 615,04premissa a aprovar
R$ 6.150,36premissa a aprovar
Fórmulacusto_mensal_usd = interacoes_por_mes x (tokens_entrada_por_interacao x preco_entrada x (1 - proporcao_cache x (1 - fator_cache)) + tokens_saida_por_interacao x preco_saida) / 1000000; custo_mensal_brl = custo_mensal_usd x meta.cotacao.valor; para agentes e código, interacoes_por_mes = tarefas_por_mes x chamadas_por_tarefa Regras assumidas por esta fórmula em regras_de_custo: fator_cache, escrita_de_cache, horario_de_pico e provedor_por_modelo.MiniMax M3, volume médio: custo_mensal_usd = 100.000 x (1.500 x 0,3 x (1 - 0,6 x (1 - 0,2)) + 300 x 1,2) / 1000000; custo_mensal_brl = 59,4 x 5,1253
Cotação usadaR$ 5,13em 04/09/2026, 13:03:59
Premissas de carga deste caso
Tokens de entrada por interação
1.500 tokenspremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0 (system prompt mais histórico curto)
Tokens de saída por interação
300 tokenspremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fração da entrada servida por cache
0,6 fracao da entrada servida por cachepremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fator de cache
derivado do preço de cache de cada modelo razao cache_leitura / entrada, derivada por modelo em precos.json; 1 quando o modelo não publica preço de cache, ou seja, sem desconto (ver regras_de_custo.fator_cache). Nunca 0.premissa a aprovarderivada do dataset, não e premissa numerica; regra corrigida na fase 0c: a unidade anterior dizia 'null quando o modelo não tem cache' e o null lido como zero aplicava desconto integral sobre a fracao em cache
Volume mensal
10.000, 100.000, 1.000.000 interações por mês [pequeno, médio, grande]premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0

com escrita de cache fora da conta, este valor é um piso

Ver o caso completoFalar com a X-Apps sobre este caso

Melhor modelo de IA para RAG: custo em reais e qualidade

Consulta sobre base documental interna com recuperação de trechos. O contexto recuperado muda a cada consulta, então o cache cobre só o system prompt. Embeddings e indexação ficam fora do cálculo na v1. A escrita de cache fica fora do cálculo, então o custo de carga com cache alto é um piso.

Custo mensal em reais por modelo e por volume, com a marca de premissa a aprovar em cada valor.
Modelovolume pequenovolume médiovolume grande
MiniMax M3provedor minimax
R$ 47,36premissa a aprovar
R$ 473,58premissa a aprovar
R$ 4.735,78premissa a aprovar
DeepSeek-V4-Flashprovedor deepseek, tarifa de pico
R$ 61,53premissa a aprovar
R$ 615,34premissa a aprovar
R$ 6.153,44premissa a aprovar
Mistral Large 3provedor mistral, sem preço de cache: fator 1
R$ 92,26premissa a aprovar
R$ 922,55premissa a aprovar
R$ 9.225,54premissa a aprovar
Fórmulacusto_mensal_usd = interacoes_por_mes x (tokens_entrada_por_interacao x preco_entrada x (1 - proporcao_cache x (1 - fator_cache)) + tokens_saida_por_interacao x preco_saida) / 1000000; custo_mensal_brl = custo_mensal_usd x meta.cotacao.valor; para agentes e código, interacoes_por_mes = tarefas_por_mes x chamadas_por_tarefa Regras assumidas por esta fórmula em regras_de_custo: fator_cache, escrita_de_cache, horario_de_pico e provedor_por_modelo.MiniMax M3, volume médio: custo_mensal_usd = 50.000 x (6.000 x 0,3 x (1 - 0,3 x (1 - 0,2)) + 400 x 1,2) / 1000000; custo_mensal_brl = 92,4 x 5,1253
Cotação usadaR$ 5,13em 04/09/2026, 13:03:59
Premissas de carga deste caso
Tokens de entrada por interação
6.000 tokenspremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0 (pergunta, system prompt e contexto recuperado)
Tokens de saída por interação
400 tokenspremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fração da entrada servida por cache
0,3 fracao da entrada servida por cachepremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fator de cache
derivado do preço de cache de cada modelo razao cache_leitura / entrada, derivada por modelo em precos.json; 1 quando o modelo não publica preço de cache, ou seja, sem desconto (ver regras_de_custo.fator_cache). Nunca 0.premissa a aprovarderivada do dataset, não e premissa numerica; regra corrigida na fase 0c: a unidade anterior dizia 'null quando o modelo não tem cache' e o null lido como zero aplicava desconto integral sobre a fracao em cache
Volume mensal
5.000, 50.000, 500.000 consultas por mês [pequeno, médio, grande]premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0

com escrita de cache fora da conta, este valor é um piso

Melhor modelo de IA para agentes: custo em reais e qualidade

Tarefa multi-etapa com ferramentas, em que o contexto cresce a cada chamada e o cache cobre o prefixo repetido. Custo de ferramentas externas e de execução fica fora. A escrita de cache fica fora do cálculo, então o custo de carga com cache alto é um piso.

Custo mensal em reais por modelo e por volume, com a marca de premissa a aprovar em cada valor.
Modelovolume pequenovolume médiovolume grande
MiniMax M3provedor minimax
R$ 123,99premissa a aprovar
R$ 1.239,91premissa a aprovar
R$ 12.399,13premissa a aprovar
DeepSeek-V4-Flashprovedor deepseek, tarifa de pico
R$ 134,72premissa a aprovar
R$ 1.347,17premissa a aprovar
R$ 13.471,75premissa a aprovar
Mistral Large 3provedor mistral, sem preço de cache: fator 1
R$ 319,82premissa a aprovar
R$ 3.198,19premissa a aprovar
R$ 31.981,87premissa a aprovar
Fórmulacusto_mensal_usd = interacoes_por_mes x (tokens_entrada_por_interacao x preco_entrada x (1 - proporcao_cache x (1 - fator_cache)) + tokens_saida_por_interacao x preco_saida) / 1000000; custo_mensal_brl = custo_mensal_usd x meta.cotacao.valor; para agentes e código, interacoes_por_mes = tarefas_por_mes x chamadas_por_tarefa Regras assumidas por esta fórmula em regras_de_custo: fator_cache, escrita_de_cache, horario_de_pico e provedor_por_modelo.MiniMax M3, volume médio: custo_mensal_usd = 120.000 x (8.000 x 0,3 x (1 - 0,7 x (1 - 0,2)) + 800 x 1,2) / 1000000; custo_mensal_brl = 241,92 x 5,1253
Cotação usadaR$ 5,13em 04/09/2026, 13:03:59
Premissas de carga deste caso
Tokens de entrada por interação
8.000 tokens por chamadapremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0 (contexto acumulado e resultados de ferramentas)
Tokens de saída por interação
800 tokens por chamadapremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fração da entrada servida por cache
0,7 fracao da entrada servida por cachepremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fator de cache
derivado do preço de cache de cada modelo razao cache_leitura / entrada, derivada por modelo em precos.json; 1 quando o modelo não publica preço de cache, ou seja, sem desconto (ver regras_de_custo.fator_cache). Nunca 0.premissa a aprovarderivada do dataset, não e premissa numerica; regra corrigida na fase 0c: a unidade anterior dizia 'null quando o modelo não tem cache' e o null lido como zero aplicava desconto integral sobre a fracao em cache
Volume mensal
1.000, 10.000, 100.000 tarefas por mês [pequeno, médio, grande]premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Chamadas ao modelo por tarefa
12 chamadas ao modelo por tarefapremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0

com escrita de cache fora da conta, este valor é um piso

Melhor modelo de IA para programação: custo em reais e qualidade

Agente de código em repositório real, com muitas chamadas curtas sobre um prefixo grande em cache. Assinaturas de IDE ficam fora: o cálculo é só de API. A escrita de cache fica fora do cálculo, então o custo de carga com cache alto é um piso.

Custo mensal em reais por modelo e por volume, com a marca de premissa a aprovar em cada valor.
Modelovolume pequenovolume médiovolume grande
MiniMax M3provedor minimax
R$ 307,52premissa a aprovar
R$ 3.075,18premissa a aprovar
R$ 30.751,80premissa a aprovar
DeepSeek-V4-Flashprovedor deepseek, tarifa de pico
R$ 323,53premissa a aprovar
R$ 3.235,35premissa a aprovar
R$ 32.353,46premissa a aprovar
Mistral Large 3provedor mistral, sem preço de cache: fator 1
R$ 832,86premissa a aprovar
R$ 8.328,61premissa a aprovar
R$ 83.286,13premissa a aprovar
Fórmulacusto_mensal_usd = interacoes_por_mes x (tokens_entrada_por_interacao x preco_entrada x (1 - proporcao_cache x (1 - fator_cache)) + tokens_saida_por_interacao x preco_saida) / 1000000; custo_mensal_brl = custo_mensal_usd x meta.cotacao.valor; para agentes e código, interacoes_por_mes = tarefas_por_mes x chamadas_por_tarefa Regras assumidas por esta fórmula em regras_de_custo: fator_cache, escrita_de_cache, horario_de_pico e provedor_por_modelo.MiniMax M3, volume médio: custo_mensal_usd = 125.000 x (20.000 x 0,3 x (1 - 0,75 x (1 - 0,2)) + 2.000 x 1,2) / 1000000; custo_mensal_brl = 600 x 5,1253
Cotação usadaR$ 5,13em 04/09/2026, 13:03:59
Premissas de carga deste caso
Tokens de entrada por interação
20.000 tokens por chamadapremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0 (arquivos abertos, diff e histórico do agente de código)
Tokens de saída por interação
2.000 tokens por chamadapremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fração da entrada servida por cache
0,75 fracao da entrada servida por cachepremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Fator de cache
derivado do preço de cache de cada modelo razao cache_leitura / entrada, derivada por modelo em precos.json; 1 quando o modelo não publica preço de cache, ou seja, sem desconto (ver regras_de_custo.fator_cache). Nunca 0.premissa a aprovarderivada do dataset, não e premissa numerica; regra corrigida na fase 0c: a unidade anterior dizia 'null quando o modelo não tem cache' e o null lido como zero aplicava desconto integral sobre a fracao em cache
Volume mensal
500, 5.000, 50.000 tarefas por mês [pequeno, médio, grande]premissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0
Chamadas ao modelo por tarefa
25 chamadas ao modelo por tarefapremissa a aprovarproposta do agente de contrato em 2026-09-06 a partir de perfis típicos de projeto; sem base em cliente específico; o usuario aprova ou corrige na fase 0

com escrita de cache fora da conta, este valor é um piso

IOF, spread, tributação de pessoa jurídica e escrita de cache ficam fora do cálculo; com escrita de cache fora, o valor é um piso para carga com muito cache.

Quatro regras que esta conta assume
Fator de cache
fator_cache = cache_leitura / entrada quando precos.json publica cache_leitura, e 1 quando cache_leitura e null, ou seja, sem desconto. Nunca 0: lido como 0, o termo (1 - proporcao_cache x (1 - fator_cache)) aplicaria desconto integral sobre toda a fracao em cache e subestimaria o custo (no caso código, com proporcao de cache de tres quartos, a subestimacao seria de metade do valor). Seis registros vigentes não publicam preço de cache: gemini-3-1-pro-preview e gemini-3-8-flash no provedor google, mistral-large-3, mistral-medium-3-5, mistral-small-4 e qwen3-8-max.
Escrita de cache
Fora do cálculo nesta versão e declarado como tal ao leitor. A escrita de cache custa 1,25x a entrada na janela de cinco minutos e 2x na de uma hora nos registros da Anthropic, e 1,25x nos da OpenAI; a taxa de reescrita do prefixo depende do padrão de uso, que o dataset não mede e que nenhuma fonte publica. Consequencia declarada: em carga com muito cache o custo publicado e um piso, não uma estimativa central.
Horário de pico
Modelo com horario_de_pico em precos.json entra na coluna de custo pela tarifa de PICO, que e a tarifa de referência da própria página (a DeepSeek apresenta o fora de pico como desconto de metade), e o fora de pico aparece como nota. Vale para deepseek-v4-pro e deepseek-v4-flash: pico das 01:00 as 04:00 e das 06:00 as 10:00 UTC, de segunda a sexta, 35 das 168 horas da semana, faixa que cobre o inicio do horario comercial brasileiro.
Provedor por modelo
Quando um modelo tem mais de um registro vigente em precos.json, a coluna de custo usa o registro nomeado aqui. muse-spark-1-3: provedor meta (Standard). O tier meta-contributor, doze vezes e meia mais barato, fica FORA da coluna de custo porque e o tier em que prompts e respostas do cliente treinam modelos da Meta; ele aparece so na secao de preços, com a pilula de treino de dados. gemini-3-1-pro-preview e gemini-3-8-flash: provedor google (os dois registros vigentes tem a mesma entrada e a mesma saida, então a escolha não muda o valor).
Fora do cálculo
IOF, spread bancario, tributacao de pessoa juridica, marketplace de nuvem, Batch, modo rápido, escrita de cache e custo de ferramentas ou de infraestrutura.

Dois modelos lado a lado

Escolha dois

Escolha dois modelos e compare atributo por atributo. Cada número abre a fonte, com a data do dado e a data da leitura. Os benchmarks só entram quando os dois modelos aparecem no mesmo grupo comparável, com a mesma origem de medição e, quando existe, o mesmo nível de esforço: é isso que decide o que pode ser comparado. Quando os intervalos publicados se cruzam, a linha diz empate técnico em vez de apontar um vencedor.

Comparação lado a lado de dois modelos de IA: atributos, preço por milhão de tokens e benchmarks do mesmo grupo comparável.
CampoModelo A: GPT-6 AstraverificadoModelo B: Gemini 3.8 Flashverificado
FabricanteOpenAIGoogle DeepMind
Lançamento3 set 20262 set 2026
Corte de conhecimento30 abr 2026não divulgado
Contexto de entrada1.050.000melhor1.048.576
Saída máxima128.000melhor65.536
Modalidadestexto, imagem -> textotexto, imagem, video, audio, pdf -> texto
Pesos abertosfechadofechado
Preço de entrada US$/MUS$ 10,00US$ 0,75melhor
Preço de saída US$/MUS$ 50,00US$ 3,75melhor
Cache de leitura US$/MUS$ 1,00não divulgado
Batch US$/MentradaUS$ 5,00saídaUS$ 25,00entradaUS$ 0,375saídaUS$ 1,875
Faixas por tamanho de prompt
acima de 272.000 tokensentradaUS$ 20,00saídaUS$ 75,00
sem faixa por tamanho de prompt
Custo R$ por 1M de saídaR$ 256,27PTAX de 4 set 2026, 13:03:59R$ 19,22PTAX de 4 set 2026, 13:03:59melhor
Situaçãoverificadoverificado
Aposentadoriasem data anunciadasem data anunciada
Benchmarks em comum
Arena WebDev (Code Arena)config webdev, split latestesforço max contra esforço highpreferência humanaesforços diferentes1.797,04intervalo 1.773,44 a 1.820,641.567,23intervalo 1.554,84 a 1.579,63

Só entram aqui os benchmarks em que os dois modelos aparecem no mesmo grupo comparável, com a mesma origem de medição.

Quer ajuda para decidir entre estes dois?

A X-Apps desenha, opera e governa soluções com estes modelos. A escolha depende da sua carga, do seu dado e do seu risco.

Solicitar orçamento

O que significa aberto

Aberto virou um termo com quatro significados. A tabela separa Apache 2.0, MIT ou MIT modificada, licença própria com gatilho de receita e licença própria restritiva.

Níveis de licença de pesos abertos e os modelos de cada nível, com a licença declarada pelo fabricante e a fonte de cada leitura.
Nível de licençaModelos neste snapshot
Apache 2.0Uso comercial livre, com patente concedida e exigência de aviso de licença. É o nível mais permissivo desta tabela.
  • Mistral Large 3Apache 2.0
  • Mistral Small 4Apache 2.0
  • Muse Glimmer-30BApache 2.0
MIT ou MIT modificadaUso comercial livre com aviso de copyright. A versão modificada acrescenta cláusula do fabricante: leia o texto antes de assumir que é MIT pura.
  • DeepSeek-V4-FlashMIT
  • DeepSeek-V4-ProMIT
  • Mistral Medium 3.5Modified MIT
Licença própria com gatilho de receitaLivre até um limite de receita ou de usuários declarado pelo fabricante. Acima do gatilho, exige acordo comercial.
  • GLM-5.3GLM-5.3 License
Licença própria restritivaPesos publicados, uso limitado por cláusulas do fabricante. Aberto aqui quer dizer que dá para baixar, não que dá para usar como quiser.
  • Kimi K3Kimi K3 License
  • MiniMax M3MiniMax Community License
  • Qwen3.8-2.4T-A95BQwen3.8-Max License

A versão de pesos abertos pode não ser a versão de nuvem: há modelo que perde modalidades e contexto ao ser publicado.

  • Qwen3.8-2.4T-A95B: A versão de pesos abertos NAO e igual a versão de nuvem (Qwen3.8-Max): perde entrada de imagem e modo non-thinking; contexto nativo de 262k, não 1M.
  • Qwen3.8-Max: A versão de nuvem (Qwen3.8-Max) não tem pesos publicados como tal; a versão de pesos abertos e o Qwen3.8-2.4T-A95B (qwen3-8-2-4t-a95b), sob a licença Qwen3.8-Max License, sem entrada de imagem, sem modo non-thinking e com contexto nativo de 262k.

Modelos sem pesos publicados neste snapshot: Claude Fable 5, Claude Fable 5.1, Claude Haiku 4.5, Claude Opus 5, Claude Sonnet 5, Gemini 3.1 Pro Preview, Gemini 3.8 Flash, GPT-5.6 Luna, GPT-5.6 Sol, GPT-5.6 Terra, GPT-6 Astra, Grok 4.6, Muse Spark 1.3, Qwen3.8-Max.

Linha do tempo

O que mudou e quando

Uma raia por fabricante e um ponto por evento datado do dataset: lançamento, mudança de preço, fim de vida e correção. A forma do ponto diz o tipo, e a linha tracejada marca a data deste snapshot: o que está à direita dela é prazo anunciado pelo fabricante, não fato consumado. Evento com prazo de exibição vencido sai da linha sozinho, e a ordem dentro de uma raia é cronológica, nunca um ranking entre fabricantes.

A linha do tempo cobre de 15/10/2025 a 01/09/2027: 27 eventos de 11 fabricantes, um ponto por evento.

snapshot desta página: 06/09/2026snapshot desta página: 06/09/2026Anthropic, 10 eventos15/10/2025, Anthropic, Claude Haiku 4.5, lançamento, Lançamento de Claude Haiku 4.509/06/2026, Anthropic, Claude Fable 5, lançamento, Lançamento de Claude Fable 530/06/2026, Anthropic, Claude Sonnet 5, lançamento, Lançamento de Claude Sonnet 524/07/2026, Anthropic, Claude Opus 5, lançamento, Lançamento de Claude Opus 501/09/2026, Anthropic, Claude Fable 5.1, lançamento, Lançamento de Claude Fable 5.115/10/2026, Anthropic, Claude Haiku 4.5, fim de vida, Aposentadoria de Claude Haiku 4.5 não antes da data indicada09/06/2027, Anthropic, Claude Fable 5, fim de vida, Aposentadoria de Claude Fable 5 não antes da data indicada30/06/2027, Anthropic, Claude Sonnet 5, fim de vida, Aposentadoria de Claude Sonnet 5 não antes da data indicada24/07/2027, Anthropic, Claude Opus 5, fim de vida, Aposentadoria de Claude Opus 5 não antes da data indicada01/09/2027, Anthropic, Claude Fable 5.1, fim de vida, Aposentadoria de Claude Fable 5.1 não antes da data indicadaGoogle DeepMind, 2 eventos19/02/2026, Google DeepMind, Gemini 3.1 Pro Preview, lançamento, Lançamento de Gemini 3.1 Pro Preview02/09/2026, Google DeepMind, Gemini 3.8 Flash, lançamento, Lançamento de Gemini 3.8 FlashMistral AI, 1 evento16/03/2026, Mistral AI, Mistral Small 4, lançamento, Lançamento de Mistral Small 4DeepSeek, 2 eventosGrupo de 2 eventos, de 24/04/2026 a 24/04/2026: 24/04/2026, DeepSeek, DeepSeek-V4-Flash, lançamento, Lançamento de DeepSeek-V4-Flash; 24/04/2026, DeepSeek, DeepSeek-V4-Pro, lançamento, Lançamento de DeepSeek-V4-Pro2MiniMax, 1 evento01/06/2026, MiniMax, MiniMax M3, lançamento, Lançamento de MiniMax M3OpenAI, 4 eventosGrupo de 3 eventos, de 09/07/2026 a 09/07/2026: 09/07/2026, OpenAI, GPT-5.6 Luna, lançamento, Lançamento de GPT-5.6 Luna; 09/07/2026, OpenAI, GPT-5.6 Sol, lançamento, Lançamento de GPT-5.6 Sol; 09/07/2026, OpenAI, GPT-5.6 Terra, lançamento, Lançamento de GPT-5.6 Terra303/09/2026, OpenAI, GPT-6 Astra, lançamento, Lançamento de GPT-6 AstraMoonshot AI, 1 evento16/07/2026, Moonshot AI, Kimi K3, lançamento, Lançamento de Kimi K3Alibaba (Qwen), 2 eventosGrupo de 2 eventos, de 03/08/2026 a 12/08/2026: 03/08/2026, Alibaba (Qwen), Qwen3.8-Max, lançamento, Lançamento de Qwen3.8-Max; 12/08/2026, Alibaba (Qwen), Qwen3.8-2.4T-A95B, lançamento, Lançamento de Qwen3.8-2.4T-A95B2Meta (Meta Superintelligence Labs), 2 eventos10/08/2026, Meta (Meta Superintelligence Labs), Muse Glimmer-30B, lançamento, Lançamento de Muse Glimmer-30B02/09/2026, Meta (Meta Superintelligence Labs), Muse Spark 1.3, lançamento, Lançamento de Muse Spark 1.3xAI, 1 evento12/08/2026, xAI, Grok 4.6, lançamento, Lançamento de Grok 4.6Z.ai (Zhipu AI), 1 evento14/08/2026, Z.ai (Zhipu AI), GLM-5.3, lançamento, Lançamento de GLM-5.3out 2025jan 2026abr 2026jul 2026out 2026jan 2027abr 2027jul 2027
Ver os mesmos eventos em tabela
Eventos da linha do tempo, do mais recente para o mais antigo, com a fonte de cada um.
DataFabricanteModeloTipoO que aconteceuFonte
AnthropicClaude Fable 5.1fim de vidaAposentadoria de Claude Fable 5.1 não antes da data indicadaData mínima de aposentadoria declarada pelo fabricante.Anthropic, documentação da Claude API
AnthropicClaude Opus 5fim de vidaAposentadoria de Claude Opus 5 não antes da data indicadaData mínima de aposentadoria declarada pelo fabricante.Anthropic, documentação da Claude API
AnthropicClaude Sonnet 5fim de vidaAposentadoria de Claude Sonnet 5 não antes da data indicadaData mínima de aposentadoria declarada pelo fabricante.Anthropic, documentação da Claude API
AnthropicClaude Fable 5fim de vidaAposentadoria de Claude Fable 5 não antes da data indicadaData mínima de aposentadoria declarada pelo fabricante.Anthropic, documentação da Claude API
AnthropicClaude Haiku 4.5fim de vidaAposentadoria de Claude Haiku 4.5 não antes da data indicadaData mínima de aposentadoria declarada pelo fabricante.Anthropic, documentação da Claude API
OpenAIGPT-6 AstralançamentoLançamento de GPT-6 AstraData de lançamento declarada pelo fabricante.OpenAI Developer Community, anúncio oficial
Google DeepMindGemini 3.8 FlashlançamentoLançamento de Gemini 3.8 FlashData de lançamento declarada pelo fabricante.Google, anúncio do Gemini 3.8 Flash
Meta (Meta Superintelligence Labs)Muse Spark 1.3lançamentoLançamento de Muse Spark 1.3Data de lançamento declarada pelo fabricante.Meta AI Research, anúncio do Muse Spark 1.3
AnthropicClaude Fable 5.1lançamentoLançamento de Claude Fable 5.1Data de lançamento declarada pelo fabricante.Anthropic, anúncio do Claude Fable 5.1 e Mythos 5.1
Z.ai (Zhipu AI)GLM-5.3lançamentoLançamento de GLM-5.3Data de lançamento registrada no catálogo models.dev; sem anúncio oficial lido.models.dev, catalogo aberto (api.json)
xAIGrok 4.6lançamentoLançamento de Grok 4.6Data de lançamento declarada pelo fabricante.xAI, anúncio do Grok 4.6
Alibaba (Qwen)Qwen3.8-2.4T-A95BlançamentoLançamento de Qwen3.8-2.4T-A95BData de lançamento registrada no catálogo models.dev; sem anúncio oficial lido.models.dev, catalogo aberto (models.json)
Meta (Meta Superintelligence Labs)Muse Glimmer-30BlançamentoLançamento de Muse Glimmer-30BData de lançamento declarada pelo fabricante.Meta AI Research, anúncio do Muse Glimmer
Alibaba (Qwen)Qwen3.8-MaxlançamentoLançamento de Qwen3.8-MaxData de lançamento declarada pelo fabricante.Alibaba Cloud Press Room, Alibaba unveils Qwen3.8-Max
AnthropicClaude Opus 5lançamentoLançamento de Claude Opus 5Data de lançamento declarada pelo fabricante.Anthropic, anúncio do Claude Opus 5
Moonshot AIKimi K3lançamentoLançamento de Kimi K3Data de lançamento registrada no catálogo models.dev; sem anúncio oficial lido.models.dev, catalogo aberto (api.json)
OpenAIGPT-5.6 LunalançamentoLançamento de GPT-5.6 LunaData de lançamento registrada no catálogo models.dev; sem anúncio oficial lido.models.dev, catalogo aberto (api.json)
OpenAIGPT-5.6 SollançamentoLançamento de GPT-5.6 SolData de lançamento registrada no catálogo models.dev; sem anúncio oficial lido.models.dev, catalogo aberto (api.json)
OpenAIGPT-5.6 TerralançamentoLançamento de GPT-5.6 TerraData de lançamento registrada no catálogo models.dev; sem anúncio oficial lido.models.dev, catalogo aberto (api.json)
AnthropicClaude Sonnet 5lançamentoLançamento de Claude Sonnet 5Data de lançamento declarada pelo fabricante.Anthropic, anúncio do Claude Sonnet 5
AnthropicClaude Fable 5lançamentoLançamento de Claude Fable 5Data de lançamento declarada pelo fabricante.Anthropic, documentação da Claude API
MiniMaxMiniMax M3lançamentoLançamento de MiniMax M3Data de lançamento declarada pelo fabricante.MiniMax, anúncio do M3
DeepSeekDeepSeek-V4-FlashlançamentoLançamento de DeepSeek-V4-FlashData de lançamento declarada pelo fabricante.DeepSeek, anúncio do V4 (preview)
DeepSeekDeepSeek-V4-ProlançamentoLançamento de DeepSeek-V4-ProData de lançamento declarada pelo fabricante.DeepSeek, anúncio do V4 (preview e open source)
Mistral AIMistral Small 4lançamentoLançamento de Mistral Small 4Data de lançamento registrada no catálogo models.dev; sem anúncio oficial lido.models.dev, catalogo aberto (api.json)
Google DeepMindGemini 3.1 Pro PreviewlançamentoLançamento de Gemini 3.1 Pro PreviewData de lançamento registrada no catálogo models.dev; sem anúncio oficial lido.models.dev, catalogo aberto (api.json)
AnthropicClaude Haiku 4.5lançamentoLançamento de Claude Haiku 4.5Data de lançamento declarada pelo fabricante.Anthropic, documentação da Claude API
  • A forma do ponto diz o tipo do evento:
  • lançamento
  • fim de vida
  • O marcador com número reúne eventos próximos demais para caber lado a lado; todos continuam na tabela.
  • Data depois do snapshot é prazo anunciado pelo fabricante, não fato consumado.

Cada ponto é um evento datado com fonte própria. A ordem dentro de uma raia é cronológica, e não um ranking entre fabricantes.

Novidades

O que mudou desde o snapshot anterior, com a data do anúncio e o link oficial.

fim de vidaAnthropic

Aposentadoria de Claude Fable 5.1 não antes da data indicada

Data mínima de aposentadoria declarada pelo fabricante.

Ver o anúncio oficial
fim de vidaAnthropic

Aposentadoria de Claude Opus 5 não antes da data indicada

Data mínima de aposentadoria declarada pelo fabricante.

Ver o anúncio oficial
fim de vidaAnthropic

Aposentadoria de Claude Sonnet 5 não antes da data indicada

Data mínima de aposentadoria declarada pelo fabricante.

Ver o anúncio oficial
fim de vidaAnthropic

Aposentadoria de Claude Fable 5 não antes da data indicada

Data mínima de aposentadoria declarada pelo fabricante.

Ver o anúncio oficial
fim de vidaAnthropic

Aposentadoria de Claude Haiku 4.5 não antes da data indicada

Data mínima de aposentadoria declarada pelo fabricante.

Ver o anúncio oficial
lançamentoOpenAI

Lançamento de GPT-6 Astra

Data de lançamento declarada pelo fabricante.

Ver o anúncio oficial

REPROVADO

O que circulou e não entrou, com a URL conferida, a data e o que falta para entrar. Esta lista existe para o leitor conferir o que a página recusou, não só o que ela aceitou.

Afirmações conferidas que ficaram fora da tabela, com a URL lida, o veredito e a data da conferência.
AfirmaçãoOnde circulouConferido emVereditoDataO que falta
Existe um modelo chamado ChatGPT 6 (ou ChatGPT 6 Astra)inferência editorialpedido inicial do usuário e conteúdo de terceirosdevelopers.openai.comnão existeNada a entrar: o modelo oficial é GPT-6 Astra (id gpt-6-astra); ChatGPT é o aplicativo. Alias bloqueado em identidade.json.
Grok 5 foi lançado, com especificações e datareportagem secundáriasites de SEO com specs inventadasdocs.x.ainão existeAparecer na lista oficial de modelos da xAI com preço e contexto. Até lá, só 'anunciado como em treinamento'.
Mistral Large 4 (ou Medium 4) existeinferência editorialpedido inicial do usuáriodocs.mistral.ainão existeConstar na tabela oficial de modelos da Mistral. O flagship em 2026-09-06 é o Large 3 (dez/2025).
DeepSeek R2 existe como linha de raciocínio separadainferência editorialpedido inicial do usuárioapi-docs.deepseek.comnão existeNada: a família atual é V4 com raciocínio integrado; a documentação lista v4-pro, v4-flash e v4-flash-vision-exp.
Terminal-Bench de fabricantes diferentes na mesma coluna (Anthropic 4.0; Kimi, Qwen, Meta e MiniMax 2.1; xAI e Z.ai 3.0)inferência editorialtabelas comparativas de terceirostbench.ainão comparávelScore independente na mesma versão e mesmo agente (Epoch cobre só terminal-bench/2.0 no snapshot). Até lá, cada versão é um grupo separado.
Intelligence Index, Coding Index e Agentic Index da Artificial Analysis por modelo (inclusive os embutidos no payload do OpenRouter e o 'AA Intelligence Index 61' citado pela xAI)fato confirmadoartificialanalysis.ai, OpenRouter, anúncio do Grok 4.6artificialanalysis.ailicença impedeTier Commercial com redistribuição, ou citação pontual em prosa com byline (no máximo um número por afirmação).
Placares do anúncio do Opus 5 (Frontier-Bench, ARC-AGI 3, DeepSearchQA, OSS-Fuzz)fonte primáriaanthropic.com/news/claude-opus-5 (gráficos sem texto)anthropic.comaguardando transcriçãoTranscrever no Chrome real com captura, sha256 e data. Os números publicados em texto na página do Fable 5.1 já estão em curadoria.
Qwen3.8-2.4T-A95B marca 43,6 em HLEfonte primáriamodel card no Hugging Facehuggingface.conão comparávelA card diz só 'HLE': confirmar se é full ou verified e se houve ferramentas.
Kimi K3 marca 67,5 (model card) ou 67,3 (blog) em DeepSWEfonte primáriaduas páginas oficiais da Moonshothuggingface.conão confirmadoEscolher a fonte com versão e configuração declaradas e registrar a divergência em conflitos_resolvidos; a versão 1.1 também não está declarada.
GLM-5.3 (48,2 em AutomationBench v1.0.6) supera Fable 5.1 (31,4) e Kimi K3 (30,8)inferência editorialcomparação direta entre model card e anúncioshuggingface.conão comparávelAnthropic e Moonshot não declaram versão; ids separados (automationbench-1-0-6 e automationbench-sem-versao) impedem a mistura.
Modelo chamado Kimi 3inferência editorialpedido inicial do usuáriokimi.ainão existeNada: o nome oficial é Kimi K3. Alias bloqueado.
Modelo chamado Meta Museinferência editorialpedido inicial do usuárioresearch.meta.ainão existeNada: Muse é a família; o topo de linha é Muse Spark 1.3. Alias bloqueado.
FrontierSWE de Qwen (73,5), Kimi (81,2) e Z.ai (78,1) comparável com o FrontierSWE V2 da Epoch (0,56 para Fable 5.1 max)inferência editorialmodel cards e Epochfrontierswe.comnão comparávelVersão e escala declaradas pelos fabricantes; provável divisão do id em frontierswe-sem-versao e frontierswe-v2 (dúvida de contrato).
O Grok 4.6 teria uma variante fast com preço próprio, o dobro da tarifa padrão (entrada 4 e saída 12 USD por milhão de tokens).inferência editorialdossiê de apuração de 2026-09-06 (estava em curadoria.json como modo_rapido até a revisão do mesmo dia)docs.x.ainão confirmadoPágina oficial da xAI listando uma variante fast do Grok 4.6 com preço de tabela. Lidas em 2026-09-06, docs.x.ai/developers/models, /developers/models/grok-4.6 e /developers/pricing não listam essa variante; a página de preços descreve Priority Processing, cobrança ao dobro das tarifas padrão em todos os tipos de token só quando a resposta confirma service_tier priority, que não é um modelo nem um modo com preço próprio.
Qwen3.8-Max entrou em preview em 2026-07-19reportagem secundáriaterceiros (parte do antigo item qwen3-8-max-saida-131k)alibabacloud.comnão confirmadoData do preview em página oficial: o press release traz 2026-08-03 e o Model Studio não traz data. Nada de 2026-07-19 entra no dataset.
Grok 4.6 tem 500.000 tokens de saída máxima; Mistral Large 3 e Medium 3.5 tem 262.144; Mistral Small 4 tem 256.000; Muse Glimmer-30B tem 131.072fato confirmadocampo limit.output do catálogo models.dev, repetido por agregadoresmodels.devnão confirmadoSaída máxima em página oficial. Nesses cinco registros o models.dev repete limit.context em limit.output, o que afirmaria que a saída máxima é a janela inteira; o normalizador descarta o valor nesse caso e a célula fica vazia. A xAI publica 'Context window 500,000 tokens' e nenhum max output (docs.x.ai/developers/models/grok-4.6), e a Mistral não publica nenhum dos dois.
Gemini 3.1 Pro Preview e Gemini 3.8 Flash estão disponíveis na região southamerica-east1 do Vertex AIfonte primáriaresto do item vertex-precos, após a leitura da tabela de preços na fase 0cloud.google.comaguardando fonte oficialA página de preços traz a tarifa do endpoint não global, que inclui southamerica-east1, mas não diz em que regiões cada modelo roda. Falta a tabela oficial de disponibilidade regional do Vertex; até lá a observação dos dois registros de preço declara que a disponibilidade em southamerica-east1 não foi verificada.
Resolvidos (19)

Afirmações que estavam nesta lista e já entraram ou já foram esclarecidas.

  • Preço por milhão de tokens do GLM-5.3 resolvido em 06/09/2026; preço lido na tabela oficial (1,4 entrada, 0,26 cache, 4,4 saída USD por milhão); registrado em curadoria (lote4) docs.z.ai
  • Preço por milhão de tokens do MiniMax M3 resolvido em 06/09/2026; preço de lista 0,60 e 2,40 (cache 0,12) até 512K e 1,20 e 4,80 acima, com 50% permanente declarado; registrado em curadoria (lote8) platform.minimax.io
  • Placares do GPT-6 Astra (ARC-AGI-3, FrontierMath Tier 4, DeepSWE v1.1, SRE-Bench etc.) resolvido em 06/09/2026; tabelas lidas em TEXTO no Browser pane (transcricao-gpt-6-astra.json) e incorporadas ao grupo openai-anuncio-gpt-6-astra com em_texto_na_pagina true openai.com
  • GPT-6 Astra custa 20 e 75 USD por milhão acima de 272.000 tokens de prompt resolvido em 06/09/2026; coluna long context da tabela Standard (20, 2 cache, 25 escrita, 75) com limiar de 272K na ficha oficial do modelo (lote6 e lote11); registrada como faixa developers.openai.com
  • DeepSWE v1.1 73,7 e demais placares do Gemini 3.8 Flash resolvido em 06/09/2026; imagem oficial gemini-evals-table.webp baixada por curl (sha256 3343387ccc4ea5219f6ef38f568b18d78e8488459309de6572e30c83e81bfd3a) e transcrita (lote4); DeepSWE v1.1 73,7 e demais linhas em curadoria com captura blog.google
  • Muse Spark 1.3 custa 1,25 e 4,25 USD por milhão (Standard) e 0,10 e 0,20 (Contributor) resolvido em 06/09/2026; tiers Standard (1,25 / 0,15 cache / 4,25) e Contributor (0,10 / 0,002 / 0,20) lidos na página oficial (lote13); dois registros de preço em curadoria dev.meta.ai
  • Muse Spark 1.3: DeepSWE 1.1 75,4, Terminal-Bench 2.1 88,8, SWEAtlas 59,4, recuperação em contexto longo 98,5 resolvido em 06/09/2026; PDF oficial de metodologia (sha256 315a5d1de2932bf772caf1945aa2c7460a1e040c5df3d8b6bbfb53eddea864fe) transcrito (lote10): DeepSWE v1.1 75,4, Terminal-Bench 2.1 88,8, SWEAtlas 59,4 em curadoria com captura; MRCR fica fora por versão não declarada research.meta.ai
  • Qwen3.8-Max custa 2 e 6 USD por milhão resolvido em 06/09/2026; preço lido no Model Studio international (2 e 6 USD por milhão, faixa 0 a 1M; lote6); registro qwen3-8-max criado em curadoria alibabacloud.com
  • Qwen3.8-Max: 1M de contexto, 131K de saída, lançamento 2026-08-03 (preview 2026-07-19) resolvido em 06/09/2026; press release lido no Browser pane (lote4): contexto até 1 milhão de tokens e data 2026-08-03 confirmados; saída 131K e preview 2026-07-19 continuam sem fonte (novo item qwen3-8-max-saida-131k) alibabacloud.com
  • Kimi K3 marca 43,5 e 56,0 em HLE-Full (dois regimes) resolvido em 06/09/2026; model card declara que HLE-Full reporta sem e com ferramentas nessa ordem (lote7): 43,5 em hle-full e 56,0 em hle-com-ferramentas huggingface.co
  • A Kimi K3 License permite uso comercial mas exige acordo para grandes negócios de modelo como serviço e impõe requisitos de marca resolvido em 06/09/2026; LICENSE lido por curl (lote6): cláusula 2 (MaaS acima de USD 20 mi em 12 meses exige acordo) e cláusula 3 (exibir Kimi K3 acima de 100 mi MAU ou USD 20 mi por mês) huggingface.co
  • A licença do GLM-5.3 exige revisão de segurança da Z.ai para grupos com receita acima de USD 10 bilhões resolvido em 06/09/2026; LICENSE lido por curl (lote6): cláusula 2 exige revisão de segurança da Z.AI para MaaS com receita agregada acima de USD 10 bilhões em 12 meses huggingface.co
  • Licença dos pesos do MiniMax M3 (entrada no Hugging Face em 2026-06-07) resolvido em 06/09/2026; MiniMax Community License lida por curl (lote6): exibir 'Built with MiniMax M3' e autorização prévia acima de USD 20 milhões de receita anual; domínio huggingface.co/MiniMaxAI fora da allowlist (fonte_url da Medida segue o anúncio, URL na nota) huggingface.co
  • DeepSeek V4 Pro e Flash são MIT resolvido em 06/09/2026; LICENSE MIT (Copyright 2023 DeepSeek) lido por curl (lote6) e README raw com license: mit; domínio huggingface.co/deepseek-ai fora da allowlist (fonte_url da Medida segue o anúncio, URL na nota) huggingface.co
  • Placares do DeepSeek V4 (v4-benchmark.png) resolvido em 06/09/2026; imagens v4-benchmark.png (sha256 71d8cb001f027a19afb8faa13af59354524efe83eec2d31e9364880fc3b84011) e v4-benchmark-2.png (sha256 9226203de8e24b331652417ceccb6d3b9a0328cbbebf7d2c24cde1b1ef2fb67e) baixadas por curl e transcritas (lote4); grupo deepseek-anuncio-v4-preview-2026-04-24 com captura api-docs.deepseek.com
  • Modelos Claude tem janela padrão de 200k (500k em Enterprise) resolvido em 06/09/2026; overview de modelos da Claude API lido no Browser pane (lote5) declara 1M para Fable 5.1, Opus 5 e Sonnet 5 e 200K para Haiku 4.5; claude.com/pricing descreve planos de assinatura platform.claude.com
  • Qwen3.8-Max tem saída máxima de 131K tokens (afirmada como fato oficial por terceiros) resolvido em 06/09/2026; Decisão registrada: a Alibaba não publica saída máxima em página oficial, e o dataset publica os 131.072 tokens do catálogo models.dev com classe 'fato confirmado', evidência 'agregador' e nota dizendo que não há leitura oficial. O catálogo traz valor próprio para este modelo (131.072 contra contexto de 1.000.000), diferente dos registros em que repete o contexto. A data de preview de 2026-07-19 continua sem fonte e virou o item qwen3-8-max-preview-19-07. models.dev
  • Mistral Medium 3.5 tem 256k de contexto e 128B de parâmetros (afirmados como fato oficial por terceiros) resolvido em 06/09/2026; Decisão registrada: docs.mistral.ai e mistral.ai/pricing/api não publicam contexto nem número de parâmetros (reconferido por curl em 2026-09-06). O contexto de 262.144 tokens entra pelo catálogo models.dev com classe 'fato confirmado', evidência 'agregador' e nota dizendo que não há leitura oficial; vale o mesmo para mistral-large-3 e mistral-small-4. Os 128B de parâmetros continuam fora do dataset: nenhuma fonte publica o número e o dataset não tem campo de parâmetros. models.dev
  • Preço de Claude e Gemini no Vertex AI resolvido em 06/09/2026; A página foi reaberta em navegador real na fase 0 (transcricoes-lote6.json, versão em pt-BR) e os números entraram em curadoria: Gemini 3.1 Pro Preview com entrada 2, cache 0,20 e saída 12 até 200K, e 4, 0,40 e 18 acima; Gemini 3.8 Flash com entrada 0,75, cache 0,075 e saída 3,75 no endpoint global até 2026-12-31, e endpoint não global 10% mais caro desde 2026-07-01. O que continua sem verificação é só a disponibilidade regional em southamerica-east1, que virou o item vertex-southamerica-east1 e já consta na observação dos dois registros de preço. cloud.google.com

Metodologia e fontes

Como cada número entra, o que reprova um número e quem é a fonte de cada valor. A metodologia é versionada: quando a regra muda, a versão muda junto.

Cotação usada: 4 set 2026, 13:03:59

Metodologia versão 1.0, atualizada em 06/09/2026

Versão 1.0 (rascunho da fase 1, 2026-09-06). Renderizada na seção Metodologia e fontes do hub. Toda mudança de regra ganha versão nova e uma linha em changelog.jsonl. Sem número solto: valores entram pelo dataset.

O que cada número carrega

Cada célula, cartão e barra desta página traz fonte (URL exata), data do dado na origem, data de coleta, classe, evidência e confiança. Quando falta um desses campos, o número não é publicado. Quando o fabricante não divulga, a célula diz "não divulgado". Nunca estimamos.

Classes de afirmação

Usamos o mesmo vocabulário do checador editorial do blog: fonte primária (página, documentação ou model card do fabricante), fato confirmado (medição de terceiro independente ou dado de agregador aberto), cálculo próprio (fórmula visível, recalculada pelo validador com tolerância de dois por cento) e inferência editorial (nossa leitura, sempre marcada). Reportagem secundária e alegação de entrevistado não entram na tabela; ficam na seção REPROVADO.

Rótulos de evidência
  • autorreportado: número do próprio fabricante dono da página. Entra só em grupo com scores da mesma página, nunca comparado com outro fabricante.
  • medido por concorrente: número de um fabricante que aparece na página de outro, medido ou citado por quem publica. Segue a mesma regra de grupo do autorreportado e nunca é apresentado como declaração do fabricante do modelo.
  • independente: medição de organização que não vende modelo (Epoch AI, ARC Prize) ou dado público (Banco Central).
  • preferência humana: votos em pares cegos do Arena, com intervalo de confiança. Sempre exibido com o intervalo: quando os intervalos de dois modelos se sobrepõem, a página diz empate técnico e nunca lista um acima do outro sem essa marca.
  • agregador: catálogo comunitário (models.dev), usado para enriquecer, nunca como única fonte de preço.
  • medido pela X-Apps: reservado para medições próprias (não há nenhuma nesta versão).
Hierarquia de fontes
  1. Páginas oficiais dos fabricantes para preço, contexto, lançamento e licença de pesos.
  2. Epoch AI e o Arena para qualidade comparável entre fabricantes: medição independente e preferência humana vencem número de fabricante quando existem para o mesmo modelo.
  3. models.dev para catálogo e conferência; OpenRouter e llm-prices.com apenas como conferência interna, sem nada publicado.

Divergência entre páginas do mesmo fabricante se resolve pela documentação de API, com nota. Divergência acima de cinco por cento entre página oficial e models.dev publica a oficial e registra no changelog. Duas fontes independentes em conflito não publicam até resolução.

Versão de benchmark

Benchmark de mesmo nome muda de versão e de regras. Terminal-Bench 2.1, 3.0 e 4.0 são três catálogos; OSWorld 2.0 partial, strict e OSWorld-Verified são três medidas; HLE completo, HLE-Verified e HLE com ferramentas são três recortes. O id de cada benchmark carrega a versão, o gráfico mostra a versão no rótulo e um aviso fixo lembra que não são comparáveis entre si. Score publicado sem versão fica em grupo próprio. Métrica diferente com o mesmo nome também: o Agents' Last Exam tem catálogo separado para a taxa de aprovação, para o score e para a variante ALE-CLI, porque o mesmo modelo aparece com números muito distantes conforme a coluna; o SWE-Marathon tem catálogo separado para a versão 1.1 e para o ramo anterior a ela calibrado para outra GPU. Em SWE-bench e Terminal-Bench, o harness aparece ao lado do score, porque o mesmo modelo em agentes diferentes resolve quantidades diferentes de tarefas.

Nas páginas por caso de uso o cabeçalho da coluna só cabe a versão curta. A versão completa do recorte, que é o que separa duas medidas com o mesmo nome de catálogo, aparece na ficha de fonte de cada célula, no campo Versão.

Níveis de esforço

O mesmo modelo em esforço máximo e em esforço baixo tem placar e custo diferentes. Cada score carrega a configuração usada; quando a fonte não declara, o rótulo diz "não informado" e o score não entra em comparação cruzada.

Quatro datas

Data do dado na origem, data de coleta, data do snapshot (no topo da página) e vigência do preço. A página nunca mostra a data do build. Passados quinze dias desde a data do snapshot, o hero exibe "Em revisão". O prazo é contado da data do snapshot até o dia da visita, não da data do build do site.

Preço em reais

Preços oficiais são em dólar por milhão de tokens, e é assim que a tabela publica entrada e saída. Ao lado do preço de saída em dólar, a tabela publica também o mesmo preço convertido em reais pela cotação PTAX de venda do Banco Central, com data e hora visíveis. Essa coluna é conversão de preço de tabela, não estimativa de conta mensal.

A conta mensal fica na seção de custo por caso de uso. Ela é cálculo próprio, derivado no momento em que a página é montada a partir de precos.json e do perfil de carga de cada caso: não existe Medida de custo no dataset, e nenhum valor em reais é digitado na copy. A página mostra três volumes em vez de um número único, com a fórmula, as premissas de carga e a cotação usada ao lado dos valores, e declara as quatro regras que a conta assume (fator de cache, escrita de cache fora do cálculo, tarifa de pico e provedor por modelo).

As premissas de perfil de carga são propostas da X-Apps e ainda não foram aprovadas. Por isso todo valor em reais sai marcado como premissa a aprovar, ao lado do próprio número, e não apenas nesta metodologia. Elas não descrevem nenhum cliente e não foram medidas: estão publicadas para o leitor conferir ou trocar pelos números dele.

IOF, spread bancário, marketplace de nuvem, tributação de pessoa jurídica e escrita de cache ficam fora do cálculo e são declarados como tal. Com a escrita de cache fora, o valor é um piso para carga com muito cache.

Tokenizador

Comparar preço por milhão de tokens entre fabricantes sem considerar o tokenizador distorce a conta: a Anthropic declara que seus modelos recentes geram mais tokens para o mesmo texto. A nota só aparece na página com a Medida correspondente.

Velocidade

Não há coluna de latência nem de throughput. Nenhuma fonte aberta entrega TTFT e tokens por segundo com licença de republicação; o OpenRouter devolve nulo e a Artificial Analysis não concede redistribuição. Medição própria a partir do Brasil está prevista para uma fase futura.

Placares em imagem

Anúncios que publicam resultados só em gráfico entram apenas após transcrição em navegador real, com captura de tela, hash e data gravados no dataset. O valor transcrito chega ao leitor com a marca de transcrito de imagem e a data da transcrição na ficha de fonte. Até a transcrição, o número fica na seção REPROVADO como "aguardando transcrição".

Atribuições
  • Epoch AI, 'AI Benchmarking Hub'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks/use-this-data' [online resource]. Accessed 6 Sep 2026. Dados sob Creative Commons Attribution 4.0; dados de Aider Polyglot e Terminal-Bench embutidos mantêm licença Apache 2.0.
  • models.dev: MIT License. Copyright (c) 2025 models.dev. The above copyright notice and this permission notice shall be included in all copies or substantial portions of the Software.
  • LMArena: LMArena, 'Arena Leaderboard Dataset' (lmarena-ai/leaderboard-dataset). Publicado no Hugging Face em https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Acesso em 6 set 2026. A model card não publica frase de citação própria, então a atribuição segue o formato da licença (título, autor, fonte e licença). Lemos o dataset publicado no Hugging Face; nunca raspamos o site do Arena.
  • Banco Central do Brasil, cotação PTAX de venda.
  • OpenRouter rankings (somente se a fase 7 for aprovada): Source: OpenRouter (openrouter.ai/rankings), as of {as_of}. Licensed under CC BY 4.0.
Correções e contato

Erro encontrado vira correção datada que não sai da página, com o valor anterior e o novo registrados no changelog. Correções podem ser enviadas pelo formulário de contato do site, com a URL da fonte.

Fontes e licenças

Cada fonte entra com o papel que cumpre, a licença que a governa e o texto de atribuição exigido por ela, copiado sem alteração.

Nível 1: páginas oficiais dos fabricantes

  • Páginas oficiais dos fabricantes (preço, documentação de API, anúncio, model card)

    Licença: página institucional do fabricante; fato de preço e especificacao citado com link

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Restrições de uso
    • citar valor com fonte e data; nunca copiar tabela inteira com layout
    • openai.com/index devolve HTTP 403 a curl e WebFetch: abrir no Chrome real com captura
    • alibabacloud.com/en/press-room renderiza por JavaScript: HTML baixado sem texto
    • placares em imagem (Opus 5, Gemini 3.8 Flash, Muse Spark 1.3, DeepSeek V4) so entram por transcricao com captura, sha256 e data
    • para benchmark, evidencia sempre 'autorreportado' e grupo_comparavel restrito a uma fonte_url
  • Meta Model API (dev.meta.ai): pricing-rate-limits e models

    Licença: página institucional do fabricante; fato de preço

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Restrições de uso
    • citar valor com fonte e data; nunca copiar tabela inteira com layout
  • Meta AI Research, PDFs de metodologia (research.meta.ai/static)

    Licença: página institucional do fabricante; fato de preço

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Restrições de uso
    • citar valor com fonte e data; nunca copiar tabela inteira com layout
  • Alibaba Cloud Model Studio, Model inference pricing

    Licença: página institucional do fabricante; fato de preço

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Restrições de uso
    • citar valor com fonte e data; nunca copiar tabela inteira com layout
  • Alibaba Cloud Press Room

    Licença: página institucional do fabricante; fato de preço

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Restrições de uso
    • citar valor com fonte e data; nunca copiar tabela inteira com layout
  • MiniMax API Docs, Pay as You Go

    Licença: página institucional do fabricante; fato de preço

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Restrições de uso
    • citar valor com fonte e data; nunca copiar tabela inteira com layout
  • Z.AI Developer Document, Pricing

    Licença: página institucional do fabricante; fato de preço

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Restrições de uso
    • citar valor com fonte e data; nunca copiar tabela inteira com layout
  • Mistral, Pricing (API, plano Standard)

    Licença: página institucional do fabricante; fato de preço

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Restrições de uso
    • citar valor com fonte e data; nunca copiar tabela inteira com layout
  • Hugging Face, model cards e LICENSE mantidos pelos fabricantes (raw/main)

    Licença: model card no Hugging Face mantida pelo fabricante; score citado com link; texto de licença citado por clausula

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Restrições de uso
    • citar valor com fonte e data; nunca copiar tabela inteira com layout
  • AWS, Amazon Bedrock, Regional availability by models

    Licença: página institucional do fabricante; fato de preço

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Restrições de uso
    • citar valor com fonte e data; nunca copiar tabela inteira com layout
  • DeepSeek API Docs, imagens de placar do anúncio do V4

    Licença: página institucional do fabricante; fato de preço

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Restrições de uso
    • citar valor com fonte e data; nunca copiar tabela inteira com layout

Nível 2: medição independente

  • Epoch AI, AI Benchmarking Hub (benchmark_data.zip)

    Licença: CC BY 4.0 Texto da licença

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Atribuição exigidaEpoch AI, 'AI Benchmarking Hub'. Published online at epoch.ai. Retrieved from 'https://epoch.ai/benchmarks/use-this-data' [online resource]. Accessed 6 Sep 2026.
    Restrições de uso
    • dados de Aider Polyglot e Terminal-Bench embutidos mantem licença Apache 2.0 original
    • questoes e respostas dos benchmarks pertencem aos criadores; publicar so scores
    • sem header CORS: consumir somente no build
    • nomes de modelo carregam o nível de esforco como sufixo (_max, _xhigh, _high, _low, _none, _unknown); nunca misturar esforcos
  • GPQA, model card do dataset Idavidrein/gpqa no Hugging Face

    Licença: CC BY 4.0; condição de acesso: não revelar exemplos do dataset em texto ou imagem Texto da licença

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Restrições de uso
    • publicar so o baseline humano e scores; nunca republicar questoes
    • sem frase de citacao publicada na página: texto_atribuicao null até aprovacao

Nível 2: preferência humana

  • LMArena, dataset lmarena-ai/leaderboard-dataset via datasets-server do Hugging Face

    Licença: CC BY 4.0 (cardData.license: cc-by-4.0) Texto da licença

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Atribuição exigidaLMArena, 'Arena Leaderboard Dataset' (lmarena-ai/leaderboard-dataset). Publicado no Hugging Face em https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Acesso em 6 set 2026.
    Restrições de uso
    • NUNCA raspar arena.ai: os Termos de Uso proibem scrapers e reproducao do servico; a via legal e o dataset
    • lmarena.ai/leaderboard redireciona 301 para arena.ai/leaderboard
    • exibir sempre rating_lower e rating_upper; diferenca menor que o intervalo vira empate técnico
    • fonte_data = leaderboard_publish_date da linha, não a data da consulta
    • atribuicao montada no formato exigido pela CC BY 4.0 (titulo, autor, fonte e licença) porque a model card não publica frase de citacao própria; licença cc-by-4.0 reconferida na API do Hugging Face em 2026-09-07

Nível 3: catálogo e conferência

  • models.dev (api.json e models.json)

    Licença: MIT Texto da licença

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Atribuição exigidaMIT License. Copyright (c) 2025 models.dev. The above copyright notice and this permission notice shall be included in all copies or substantial portions of the Software.
    Restrições de uso
    • manter aviso de copyright e licença em metodologia.md
    • preço comunitario pode atrasar horas ou dias após mudanca do fabricante: camada de enriquecimento, nunca única fonte de preço
    • a home do models.dev mostra $0.00 para modelos com preço; usar so o api.json
    • chaves de provedor oficiais: openai, anthropic, google, google-vertex, xai, moonshotai, alibaba, deepseek, meta, zai, minimax, mistral, amazon-bedrock, azure (não existem vertex, dashscope, moonshot, z-ai, zhipu)

Cotação oficial

  • Banco Central do Brasil, PTAX (Olinda OData)

    Licença: dado publico do Banco Central

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Atribuição exigidaBanco Central do Brasil, cotacao PTAX de venda
    Restrições de uso
    • usar cotacaoVenda e gravar dataHoraCotacao no escopo da Medida
    • parâmetros de data em MM-DD-AAAA
    • cotacao com mais de 8 dias gera WARN

Conferência interna, nada publicado

  • OpenRouter, catalogo /api/v1/models

    Licença: Texto da licença

    Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026

    Restrições de uso
    • Termos proibem crawlers e copia de informação do Site; a API documentada não e scraping, mas não ha licença de republicacao: nada vai para a página
    • ids ficam so em identidade.json
    • campo benchmarks embute indices da Artificial Analysis: ignorar por licença
  • OpenRouter, /api/v1/models/{author}/{slug}/endpoints

    Licença: Texto da licença

    Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026

    Restrições de uso
    • mesma restrição do catalogo
    • não serve como fonte de velocidade
  • llm-prices.com (Simon Willison), current-v1.json

    Licença:

    Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026

    Restrições de uso
    • repositorio sem licença declarada: usar so como conferencia citada, nunca espelhar

Prevista para fase futura, ainda sem nada publicado

  • OpenRouter Data API, rankings de uso

    Licença: CC BY 4.0 Texto da licença

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Atribuição exigidaSource: OpenRouter (openrouter.ai/rankings), as of {as_of}. Para os demais endpoints: Source: OpenRouter Data API (openrouter.ai/docs/cookbook/administration/data-api), as of {as_of}. Ao republicar o dado: Licensed under CC BY 4.0.
    Restrições de uso
    • exige Authorization Bearer; 30 requisicoes por minuto e 500 por dia
    • mede so trafego do OpenRouter, não o mercado
  • LLM Stats (llm-stats.com), API em api.zeroeval.com/stats/v1

    Licença: Termos de Servico (2026-09-06) permitem copiar, modificar, compartilhar e republicar, inclusive comercialmente, com credito visivel a llm-stats.com e link Texto da licença

    Republicação: permitida com atribuição; conferida em 06/09/2026

    Restrições de uso
    • base URL em conflito entre api.zeroeval.com/stats/v1 e api.llm-stats.com/stats/v1
    • chave emitida em huggle.ai
    • agregador: GPQA mostra Verified 0 e Self-reported 244; sempre cruzar com fonte primaria

Fora do dataset

  • Artificial Analysis

    Licença: atribuicao obrigatoria em todos os tiers; tier gratuito 'Internal use only with attribution', sem redistribuicao Texto da licença

    Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026

    Restrições de uso
    • nunca entra no dataset, nem via campo benchmarks do OpenRouter
    • citacao em prosa com link e byline, no máximo um número por afirmacao
    • PDF de Terms of Use não lido (fonte com CMap); abrir em leitor grafico na fase 0

Descartada

  • Hugging Face Open LLM Leaderboard

    Licença:

    Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026

    Restrições de uso
    • arquivado (v1 em junho de 2024, v2 depois); inutil para 2026
  • Aider polyglot leaderboard

    Licença: Apache 2.0 (via Epoch)

    Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026

    Restrições de uso
    • página parada em 2025-11-20; se usar, so via aider_polyglot_external.csv da Epoch
  • openai/simple-evals

    Licença: MIT

    Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026

    Restrições de uso
    • congelado desde julho de 2025; vale so como definicao metodologica
  • pricepertoken.com

    Licença:

    Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026

    Restrições de uso
    • HTTP 403 para bots, sem endpoint, sem termos, deriva do OpenRouter
  • Vellum LLM Leaderboard

    Licença:

    Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026

    Restrições de uso
    • mistura autorreportado e verificado sem separar; página de metodologia 404
  • HateBR

    Licença: uso comercial proibido

    Republicação: não permitida; usada apenas em conferência interna; conferida em 06/09/2026

    Restrições de uso
    • licença proibe uso comercial

Conflito de interesse

A X-Apps presta consultoria e desenvolve software com vários dos fornecedores desta tabela e mantém páginas comerciais por tecnologia. Não recebe pagamento de nenhum fabricante por esta página. Os números vêm das fontes citadas, não de acordos comerciais.

Perguntas frequentes

Depende do eixo. A tabela desta página separa raciocínio, código, agentes e preferência humana, sempre com a fonte e a data de cada número, e marca quando o placar foi publicado pelo próprio fabricante ou medido por um concorrente dele. O líder de cada eixo aparece nos cartões do topo com o benchmark e a versão usados. No eixo de preferência humana, que vem do Arena, o cartão mostra o intervalo publicado: quando a diferença cabe dentro do intervalo, a página diz empate técnico em vez de escolher um vencedor.

'As pessoas tambem perguntam' observado na busca em 2026-09-06 (plano, secao 7.15)

Leia também

Três artigos que explicam como ler um placar, como escolher para prototipar e o que muda entre níveis de esforço do mesmo modelo.

Quer escolher o modelo certo para o seu caso?

A X-Apps desenha, opera e governa soluções com estes modelos. Fale com a equipe.

Solicitar orçamento
LLMOps: colocar e manter estes modelos em produçãoGovernança e segurança em IA generativa

Aviso quando um preço ou um modelo mudar

Um e-mail por atualização do comparativo, com o que mudou e a data. Sem spam.

Acelere a sua empresa com a X-Apps

Alocar profissionaisSolicitar Orçamento
A X-Apps é um provedor de TI parceiro e aconselhada pelo
Gartner
Receba nossos e-mails
Siga nossas redes sociais
O seu time de tecnologia e IA. Software sob medida, soluções de IA e alocação de profissionais.
Vamos conversar?
comercial@x-apps.com.br11 5083-0122

Rua Rodrigo Vieira, 126

Jardim Vila Mariana. São Paulo, SP.

CEP: 04115-060

Mapa do site
Termos de serviçoTermos de privacidade
Available in English