Montar SquadSolicitar Orçamento

Blog

Nossas últimas novidades
Tempo de Leitura
17
min

Créditos do Codex: quanto custa cada modelo e esforço em 2026

Guia 2026 dos créditos do Codex: tarifas de Sol, Terra e Luna, fórmula de consumo, cota do Spark e quando Max e Ultra compensam. Com tabelas.
30 de julho de 2026

A regra de bolso: o modelo define a tarifa por token (Sol custa 25x o Luna; Terra, 10x). O esforço de raciocínio define quantos tokens a tarefa vai gastar, e o Max leva um único agente ao raciocínio mais profundo. O Ultra multiplica tudo, porque pode delegar o trabalho a vários agentes e os tokens de todos entram na conta. Quem entende essas alavancas tende a gastar muito menos crédito para entregar o mesmo resultado.

Desde abril de 2026, o Codex cobra o uso da assinatura do ChatGPT do mesmo jeito que a API cobra desenvolvedores: por token, convertido em créditos. Isso acabou com a conta simples de "mensagens por janela" e criou uma dúvida nova sobre o consumo de créditos do Codex para quem usa Sol, Terra, Luna e Spark todos os dias: qual combinação de modelo e esforço entrega o resultado gastando menos?

Este guia responde com números oficiais: as tarifas de cada modelo, a fórmula que explica o consumo, o que o Ultra faz de verdade com seus créditos e as comparações que importam na prática. Ele complementa o nosso guia de qual modelo escolher entre Sol, Terra e Luna: lá, o critério é capacidade; aqui, o critério é custo.

Este artigo foi revisado em 30 de julho de 2026, dia em que a OpenAI anunciou um corte de preços justamente nesses modelos. Tarifas mudam com frequência: trate o rate card oficial do Codex como fonte de verdade e o painel Configurações do Codex → Uso (Codex Settings → Usage) como o medidor da sua conta.

Como o Codex cobra em 2026

O Codex cobra por token convertido em créditos: cada tarefa consome tokens de entrada, entrada cacheada e saída (incluindo o raciocínio), e o total é multiplicado pela tarifa do modelo escolhido. Plus e Pro incluem uma franquia de uso; o que passar dela desconta do saldo de créditos comprados.

Quatro regras explicam o sistema inteiro:

  1. Tudo é token. Cada tarefa consome tokens de entrada (o contexto que o modelo lê), tokens de entrada cacheada (contexto repetido, muito mais barato) e tokens de saída. A cobrança por mensagem acabou em abril de 2026.
  2. Raciocínio é saída. Os tokens que o modelo gasta "pensando" são cobrados como tokens de saída, mesmo que você nunca os veja. É por isso que subir o esforço de raciocínio aumenta o consumo sem mudar a tarifa.
  3. A franquia do plano vem primeiro. Plus e Pro incluem uma franquia de uso que renova em janela móvel. Quando ela acaba, o uso passa a debitar do saldo de créditos comprados, se houver. Créditos valem 12 meses e o mesmo pool é compartilhado com outros recursos agênticos da conta, como o ChatGPT Work.
  4. Uma mensagem típica com GPT-5.6 consome entre 5 e 40 créditos, segundo a própria OpenAI. Uma tarefa completa pode somar várias mensagens, e execuções com Ultra ou contexto muito grande passam disso com folga.

O rate card do Codex: tarifas oficiais por modelo

Valores do rate card oficial em 30 de julho de 2026, em créditos por 1 milhão de tokens:

ModeloEntradaEntrada cacheadaSaída (inclui raciocínio)Custo relativo
GPT-5.6 Sol12512,575025x Luna
GPT-5.6 Terra50530010x Luna
GPT-5.6 Luna50,5301x
GPT-5.3 Codex SparkNão definidaNão definidaNão definidaCota separada no preview

Três proporções valem para toda a família e simplificam qualquer conta:

  • Saída custa 6x a entrada. Uma tarefa que escreve ou raciocina muito pesa mais do que uma tarefa que só lê muito.
  • Ler do cache custa 1/10 da entrada. Reaproveitar contexto em uma mesma sessão reduz muito o consumo. Na API, os modelos GPT-5.6 cobram a gravação do cache a 1,25x a entrada; o rate card do Codex não publica essa tarifa, então a economia garantida está na leitura.
  • Sol = 2,5x Terra = 25x Luna, por token, em qualquer mistura de entrada e saída.

Infográfico das tarifas de créditos do Codex por modelo: Sol, Terra e Luna

A notícia de 30 de julho: a OpenAI reduziu os preços da família GPT-5.6: Terra ficou 20% mais barato e Luna, 80% mais barato na API, com o corte refletido também na forma como o uso desconta das assinaturas. Sol não mudou. Na prática, os modelos econômicos ficaram ainda mais econômicos; confira o rate card na data em que você estiver lendo.

A fórmula que explica o consumo de créditos do Codex

Como cache custa 1/10 da entrada e saída custa 6x, dá para resumir qualquer execução em uma unidade ponderada:

W = E + 0,1 × C + 6 × S

E = tokens de entrada não cacheados
C = tokens de entrada cacheados
S = tokens de saída, incluindo raciocínio

Os créditos são a tarifa do modelo aplicada sobre W. Exemplo real: uma tarefa que lê 100 mil tokens novos e produz 20 mil tokens de saída e raciocínio tem W = 220.000. O custo nos três modelos:

ModeloCréditos na mesma execução
Luna1,1
Terra11
Sol27,5

Essa tabela carrega a lição mais importante do guia: com o mesmo volume de tokens, a mesma tarefa custa 25x mais em Sol do que em Luna. O esforço de raciocínio não muda a tarifa; muda o S da fórmula. Subir o esforço em um modelo barato costuma custar menos do que descer o esforço em um modelo caro.

Esforço de raciocínio: a segunda alavanca

O esforço de raciocínio do Codex define quantos tokens o modelo dedica a pensar antes de responder. Ele não muda a tarifa por token: muda o volume de tokens de saída, então o mesmo nível custa valores muito diferentes em Luna, Terra e Sol.

No aplicativo em português, os níveis aparecem como Leve, Médio, Alto, Extra alto, Máximo e Ultra; no CLI e na API, a família GPT-5.6 aceita valores como none, low, medium, high, xhigh e max, e cada modelo suporta um subconjunto próprio. Nos guias da X-Apps chamamos o primeiro nível de Baixo (o low da API) e o Máximo de Max, por consistência com os demais artigos da série.

O ponto central: não existe tabela oficial de "quanto custa cada esforço". Extra alto não custa "2x o Médio"; ele apenas tende a gastar mais tokens de raciocínio, e cada token segue a tarifa do modelo. O mapa realista das interseções:

Modelo \ esforçoBaixoMédioAltoExtra altoMaxUltra
Sparkcota própria, tokens baixoscota própriacota própria, mais tokenscota própria, muitos tokensnão hánão há
Luna1x, tokens baixos1x1x, mais tokens1x, muitos tokens1x, máximo de um agenteconforme disponibilidade
Terra10x, tokens baixos10x10x, mais tokens10x, muitos tokens10x, máximo de um agente10x, multiagente
Sol25x, tokens baixos25x25x, mais tokens25x, muitos tokens25x, máximo de um agente25x, multiagente

Os níveis disponíveis para o Spark podem variar durante o research preview.

Duas consequências práticas que surpreendem quem está começando:

  • Luna Extra alto pode ser muito mais barato que Terra Baixo. Para empatar em créditos, o Luna precisaria gastar 10x mais tokens ponderados na mesma tarefa, o que raramente acontece.
  • Terra Ultra pode ficar mais caro que Sol Extra alto. A tarifa do Sol é 2,5x a do Terra; se os agentes do Ultra gerarem juntos mais de 2,5x os tokens, a conta vira.

Codex Ultra: o que a delegação automática faz com seus créditos

O modo Ultra do Codex não é "um esforço acima do Max". A documentação oficial o descreve como raciocínio máximo com delegação automática de tarefas: o agente principal pode dividir o trabalho entre subagentes que executam em paralelo. Nas avaliações publicadas do GPT-5.6, o Ultra roda com 4 agentes por padrão (há configurações divulgadas com até 16), e a OpenAI é explícita na contabilização: os tokens de todos os agentes entram no consumo.

O ganho existe e é mensurável: no anúncio oficial, o Sol em modo Ultra subiu o Terminal-Bench 2.1 de 88,8 para 91,9 e o BrowseComp de 90,4 para 92,2. Mas é um ganho de poucos pontos que pode multiplicar o gasto da tarefa, então a decisão certa depende do formato do trabalho, não da dificuldade em si.

Use Ultra quando as quatro condições estiverem presentes:

  1. Você consegue nomear pelo menos três frentes independentes do trabalho.
  2. Cada frente produz resultado útil sem esperar pelas outras.
  3. A maior parte é leitura, exploração, teste ou comparação, não edição dos mesmos arquivos.
  4. Terminar mais rápido e cobrir tudo vale mais do que economizar créditos.

Prefira um agente único (Extra alto ou Max) quando:

SinalPor quê
Cada etapa depende da anteriorNão há paralelismo real para explorar
Todos os agentes mexeriam nos mesmos arquivosRisco de soluções concorrentes e conflito
Há uma única sessão autenticada no navegadorEstado compartilhado pede um responsável só
A causa precisa ser rastreada ponta a pontaDividir quebra a cadeia de evidência
O resultado precisa de uma única vozUm agente central preserva coerência
Já existe diagnóstico e falta implementarUltra só adicionaria overhead

Comparativo entre Extra alto, Max e Ultra no Codex e o impacto de cada um nos créditos

Codex Max: a profundidade máxima de um agente só

Entre o Extra alto e o Ultra existe um nível que muita gente ainda não viu no seletor: o Max. A escala completa de profundidade funciona assim:

  • Extra alto: raciocínio muito profundo de um agente.
  • Max: a profundidade máxima que um único agente alcança.
  • Ultra: raciocínio máximo com delegação automática para vários agentes.

Para a conta de créditos, a distinção importa: Max não tem tarifa própria. Ele custa mais porque gera muito mais tokens de raciocínio e verificação, mas o consumo continua limitado a um agente, o que o torna bem mais previsível que o Ultra. A orientação oficial é reservá-lo para os trabalhos mais difíceis em que qualidade vem antes de custo; a própria documentação lembra que a maioria das tarefas não precisa de Max nem de Ultra.

Se o problema é indivisível e muito difícil, a escalada natural é Alto, Extra alto e só então Max. Se o problema é divisível em frentes, o caminho é o Ultra. Errar essa classificação custa caro nos dois sentidos: Max em tarefa paralelizável desperdiça tempo; Ultra em tarefa linear desperdiça agentes.

A margem do Max: quando um modelo menor vence um maior

O Max cria as interseções mais interessantes da tabela de tarifas: um modelo barato raciocinando no máximo contra um modelo caro raciocinando pouco. A aritmética do rate card define a margem de cada duelo:

DueloMargem do modelo menor
Terra Max contra Sol BaixoPode gastar até 2,5x os tokens e ainda empatar
Luna Max contra Terra BaixoPode gastar até 10x os tokens
Luna Max contra Sol BaixoPode gastar até 25x os tokens

E não é só teoria. Nos resultados que a OpenAI publicou para o GeneBench-Pro, um benchmark difícil de análise quantitativa em biologia, o cruzamento apareceu na prática: Terra Max marcou 23,3% contra 14,4% do Sol em esforço baixo, e Luna Max marcou 16,5%, também acima do Sol em esforço baixo, gastando cerca de 21 vezes mais tokens de raciocínio. Aplicando a tarifa de saída sobre os tokens médios publicados, o Luna Max entregou resultado melhor custando aproximadamente 16% menos créditos que o Sol em esforço baixo; já o Terra Max ficou quase 4 vezes mais caro que o Sol em esforço baixo, porque sua margem é de apenas 2,5x.

Infográfico da margem do Max no Codex: quanto cada modelo menor pode raciocinar a mais e ainda custar menos

A leitura correta dessas interseções:

  • Luna Max brilha em tarefa fechada, textual e verificável: implementação com testes objetivos, transformação de dados com regras claras, auditoria contra checklist. A margem de 25x dá espaço enorme para raciocinar barato.
  • Terra Max é o especialista em investigação profunda: um bug causal difícil, uma migração sequencial delicada, uma análise lógica extensa. Mas cuidado ao usá-lo como "Sol barato": a margem de 2,5x se esgota rápido.
  • Esforço não substitui modelo onde a capacidade manda. Em navegação visual, contexto muito longo e acabamento, a distância entre os modelos é estrutural: nos números publicados pela OpenAI, o Terra mantém 89,6% em contexto de 256 a 512 mil tokens, enquanto o Luna fica em 41,3%. Nenhum Max compensa isso. Para Chrome e Computer Use, escolha o modelo antes do esforço.

Onde o Max aparece (e o que fazer quando some)

O Max tem uma particularidade operacional que gera dúvida frequente: ele pode não aparecer no seletor, dependendo do aplicativo, da versão e da configuração. A documentação orienta habilitá-lo nas configurações quando estiver ausente. O que resolve na prática:

  1. Habilite nas configurações do app: no aplicativo em português, o caminho é Configuração → Recursos do modelo → Esforços de raciocínio disponíveis (em inglês, Settings → Model features → Available reasoning efforts). Abra a lista e marque Máximo e Ultra; com tudo ativo, o seletor mostra "6 selecionados", como na tela abaixo. Há ainda um ajuste separado, "Ultra no slider do seletor de modelos", que exibe o Ultra como a opção mais alta do controle deslizante. Depois, encerre o aplicativo e crie uma tarefa nova, porque modelo e esforço ficam associados à tarefa atual.

Tela de configuração do Codex mostrando os esforços de raciocínio disponíveis, com Máximo e Ultra marcados 2. Use o seletor avançado, não o controle resumido de potência: há relatos no repositório oficial do Codex de que o controle deslizante simplificado pula do Extra alto direto para o Ultra mesmo com o Max habilitado. O caminho confiável é Avançado → Esforço. 3. No CLI, o Max é oficial: a partir da versão 0.144.0, o comando /model exibe a sequência completa, incluindo Max entre Extra alto e Ultra. 4. Clientes diferentes, catálogos diferentes: o Codex faz parte do aplicativo desktop do ChatGPT desde julho de 2026, e as interfaces de iPhone, desktop e CLI têm ciclos de atualização próprios. É possível ver o Max no celular antes de ele aparecer no computador; a conta é a mesma, o rótulo é que varia por cliente.

Uma alternativa intermediária pouco conhecida: subagentes sob controle fora do Ultra. Em qualquer esforço, você pode pedir explicitamente "use dois subagentes, um para os logs e outro para o banco, sem alterar nada, e consolide". Nos clientes locais, dá para ir além e configurar subagentes com modelo e esforço próprios em arquivos TOML (~/.codex/agents/ ou .codex/agents/ no projeto). A recomendação oficial é usar Terra nos subagentes de exploração e leitura pesada, deixando o modelo forte só no orquestrador. Essa composição costuma sair mais barata que um Sol Ultra, porque Sol não é gasto em investigação de rotina.

Codex Spark: a cota separada (que não é Fast mode)

O GPT-5.3 Codex Spark é um caso à parte na conta de créditos. Em research preview para assinantes Pro, ele tem limites próprios que não descontam da franquia normal nem do saldo de créditos, e o rate card ainda não define tarifas ("not final"). É um modelo somente texto, com contexto de 128 mil tokens, otimizado para latência: responde a mais de 1.000 tokens por segundo.

Na prática, isso significa que alterações pequenas e interativas de código feitas no Spark são as mais baratas da sua assinatura hoje, porque saem de uma cota separada durante o preview. Só não confunda os papéis: o Spark é rápido, não é o mais capaz; para arquitetura, tarefas amplas, imagens ou navegação visual, os modelos GPT-5.6 seguem melhores.

Fast mode no Codex: o mesmo modelo com sobretaxa de 2,5x

Não confunda Spark com Fast mode: o Fast mode é o mesmo GPT-5.6, servido mais rápido, consumindo créditos a 2,5x a tarifa padrão (2x no GPT-5.4). Spark é outro modelo com outra cota; Fast mode é o mesmo modelo com sobretaxa de velocidade.

As comparações que importam

Luna Extra alto vs Terra Baixo vs Terra Médio

A condição de empate é objetiva: Luna Extra alto só custa o mesmo que Terra se gastar 10x mais tokens ponderados. Por isso:

PrioridadeEscolha
Menor custo por tarefaLuna Extra alto
Melhor equilíbrio geralTerra Médio
Menor latência no modelo TerraTerra Baixo

Terra Baixo é a configuração mais difícil de justificar: para economizar, Luna Extra alto ganha; para confiar, Terra Médio ganha. Use-o quando quiser especificamente o Terra com a menor espera possível.

Terra Ultra vs Sol Alto e Extra alto

Terra Ultra não é "um Sol mais barato". Ele compra cobertura e paralelismo (auditorias de muitos módulos, pesquisa em muitas fontes, testes em vários ambientes). Sol Alto e Extra alto compram julgamento e profundidade (o bug difícil, a decisão de arquitetura, o fluxo delicado no navegador). Para uma tarefa linear difícil, Sol Alto tende a vencer o Terra Ultra em qualidade e em custo, porque evita a multiplicação de agentes.

Sol Alto vs Sol Extra alto vs Sol Max vs Sol Ultra

Mesma tarifa, consumos muito diferentes:

ConfiguraçãoQuando usarEficiência
Sol AltoPadrão para trabalho difícil: bugs complexos, arquitetura, análise, navegadorMelhor da família Sol
Sol Extra altoQuando o Alto falhou ou o custo de errar supera o custo de raciocinar maisBoa em problemas críticos
Sol MaxO problema mais difícil da fila, indivisível, em que qualidade vem antes de custoCara, mas previsível: um agente só
Sol UltraSó para trabalho grande e divisível em frentes independentesBaixa em tarefas lineares

Para "melhorar um pouco" uma resposta única, Ultra é a pior escolha da tabela: paga vários agentes para um problema de um agente só. Entre Sol Max e Sol Ultra, a pergunta decisiva não é "quão difícil", e sim "quantas frentes independentes".

Matriz por tipo de trabalho

A matriz abaixo parte do custo: é o menor gasto de créditos que costuma resolver cada tipo de tarefa. Para escolher pela capacidade do modelo, use o guia de Sol, Terra e Luna.

TarefaConfiguração recomendada
Alterações rápidas enquanto programaSpark (cota separada durante o preview)
Bug pequeno e localizadoSpark ou Luna Alto
Implementação clara e delimitadaLuna Extra alto
Código bem especificado, com testes objetivosLuna Max
Desenvolvimento cotidiano em repositórioTerra Médio
Refatoração ou debugging complexoSol Alto
Investigação causal profunda com evidências fechadasTerra Max
Arquitetura e problemas críticosSol Extra alto ou Max
Auditoria de muitos módulosTerra Ultra
Reescrita e texto curtoLuna Baixo ou Médio
Documento executivo importanteSol Alto
Pesquisa em muitas fontes paralelasTerra Ultra
Automação repetitiva no navegadorLuna ou Terra Médio
Fluxo visual importante no ChromeSol Alto
Fluxo longo e frágil, com recuperação de errosSol Extra alto

No uso de computador e navegador, vale um alerta de custo indireto: os benchmarks oficiais mostram uma distância entre os modelos muito maior em OSWorld 2.0 (Sol 62,6 contra 45,6 do Luna) do que em programação (SWE-Bench Pro: 64,6 contra 62,7). Um modelo barato que erra a navegação gera novas capturas, novas tentativas e mais chamadas: a economia por token pode ser anulada pela repetição do fluxo.

Três fluxos que gastam menos que um Ultra contínuo

Os maiores desperdícios acontecem quando uma configuração cara fica ligada do início ao fim. Fluxos em etapas resolvem:

  1. Explorar amplo, decidir fundo: Terra Ultra para coletar evidências em paralelo (auditoria, pesquisa, comparação); depois Sol Extra alto para a decisão, o diagnóstico ou o documento final com uma única voz.
  2. Planejar, executar em paralelo, integrar: Sol Extra alto define arquitetura, contratos e critérios de aceite; Terra Ultra executa as frentes já especificadas; Sol Extra alto integra e valida no final.
  3. Investigar em paralelo, corrigir centralizado: em um incidente, agentes em modo leitura varrem logs, banco, API e deploy ao mesmo tempo; um único Sol Extra alto escolhe a hipótese, aplica o patch e roda a regressão.

A lógica dos três é a mesma: paralelize a leitura, centralize a escrita e reserve o modelo caro para as decisões.

Checklist de 30 segundos antes de rodar

  • A tarefa é interativa e pequena? Spark.
  • É simples e bem especificada? Luna, subindo o esforço se houver ambiguidade.
  • É trabalho normal de produção? Terra Médio.
  • É difícil, crítica ou ambígua? Sol Alto, e Extra alto se o erro custar caro.
  • É um problema único, fechado e verificável? Um modelo menor em Max pode vencer um maior em esforço baixo.
  • Tem três ou mais frentes independentes? Considere Ultra, no menor modelo que dá conta de cada frente.
  • Vai reusar muito contexto? Mantenha a mesma sessão para aproveitar o cache a 1/10 do preço.
  • Precisa só de velocidade? Lembre que Fast mode custa 2,5x; muitas vezes Terra comum resolve.

Perguntas frequentes sobre créditos do Codex

Quanto custa uma tarefa no Codex?

Segundo a OpenAI, uma mensagem típica com GPT-5.6 consome entre 5 e 40 créditos, variando com modelo, esforço de raciocínio e tamanho do contexto. Uma tarefa completa pode somar várias mensagens, e execuções com Ultra passam disso; o valor exato da sua conta aparece em Configurações do Codex, na aba Uso.

Onde vejo quanto estou gastando?

Em Configurações do Codex → Uso (chatgpt.com/codex/settings/usage), que mostra a franquia do plano, o consumo recente e o saldo de créditos comprados.

Subir o esforço de raciocínio dobra o custo?

Não existe multiplicador fixo. O esforço aumenta os tokens de raciocínio, cobrados como saída na tarifa do modelo. O aumento real varia por tarefa; em instruções claras e determinísticas, pode ser quase nulo o ganho e alto o custo extra.

O Ultra custa quantas vezes mais?

Não há multiplicador publicado. O Ultra roda raciocínio máximo e pode delegar a subagentes (4 por padrão nas avaliações oficiais), e todos os tokens contam. Em tarefa paralelizável, o custo extra compra tempo e cobertura; em tarefa linear, é desperdício.

Max e Ultra custam o mesmo?

Nenhum dos dois tem tarifa própria; os dois pagam a tarifa do modelo pelos tokens gerados. A diferença está no formato do consumo: o Max é o raciocínio mais profundo de um único agente, então o gasto cresce, mas de forma limitada e previsível. O Ultra soma os tokens de vários agentes, e o total varia muito com a tarefa.

O Max não aparece no meu seletor. E agora?

Habilite-o em Configuração → Recursos do modelo → Esforços de raciocínio disponíveis, marcando Máximo (e Ultra, se quiser) na lista, e crie uma tarefa nova. Se o controle resumido de potência continuar pulando do Extra alto para o Ultra, use o seletor avançado de esforço; no CLI, o /model mostra o Max a partir da versão 0.144.0. Interfaces de celular, desktop e CLI atualizam em ritmos diferentes, então o nível pode aparecer em um cliente antes do outro.

Luna com esforço alto sai mais caro que Terra com esforço baixo?

Quase nunca. A tarifa do Terra é 10x a do Luna, então o Luna precisaria gastar 10x mais tokens ponderados para empatar. Se a tarefa está bem especificada, Luna Extra alto costuma ser a opção mais econômica do seletor.

O Spark consome meus créditos?

Durante o research preview, não: ele tem limites próprios, separados da franquia e do saldo, e o rate card ainda não define tarifa. Isso pode mudar quando sair do preview; confira o rate card.

Fast mode e Spark são a mesma coisa?

Não. Fast mode é o GPT-5.6 servido mais rápido a 2,5x a tarifa. Spark é outro modelo (GPT-5.3 Codex Spark), somente texto e de baixa latência, com cota separada no preview.

Créditos comprados expiram?

Sim, em 12 meses, e não são reembolsáveis nem transferíveis. O mesmo pool de créditos é compartilhado com outros recursos agênticos da conta, como o ChatGPT Work.

Os preços de 30 de julho de 2026 mudaram as proporções?

O corte anunciado reduziu Terra em 20% e Luna em 80% na API, com reflexo no consumo das assinaturas, e manteve o Sol. As proporções do rate card vigente na revisão deste artigo eram 25x, 10x e 1x; confirme os valores atuais no rate card oficial antes de fazer contas finas.

Cache realmente economiza?

Sim: ler entrada cacheada custa 1/10 da entrada normal. Na API, os modelos GPT-5.6 cobram a gravação do cache a 1,25x a entrada, então o ganho líquido vem do reaproveitamento: trabalhar na mesma sessão, em vez de abrir conversas novas com o mesmo contexto, é uma das economias mais fáceis de capturar.

Conclusão

Créditos do Codex não se economizam escolhendo "o modelo mais fraco", e sim alinhando as três alavancas ao formato da tarefa: tarifa (modelo), tokens (esforço) e arquitetura de execução (agente único ou Ultra). O padrão que emerge das tabelas é simples: Spark para o interativo, Luna para o delimitado, Terra Médio como base, Sol Alto para o que importa, Extra alto para o crítico, Max para o problema indivisível mais difícil da fila e Ultra apenas quando você consegue nomear as frentes que os subagentes vão executar. E vale lembrar a interseção mais lucrativa do rate card: um modelo menor em Max, com margem de 10x ou 25x para raciocinar, pode entregar mais barato o que um modelo maior faria em esforço baixo.

Para escolher o modelo pela capacidade, consulte o guia de Sol, Terra e Luna. Para organizar o processo inteiro da assinatura, veja como aproveitar melhor ChatGPT e Codex sem gastar mais. E se a sua empresa está estruturando agentes de IA em produção, essa mesma disciplina de custo por token vale para qualquer provedor.

Quer colocar IA para trabalhar com custo sob controle?

A X-Apps desenha fluxos de IA para empresas com governança de custo desde o primeiro dia: escolha de modelos, roteamento por tarefa, caching, observabilidade de consumo e agentes em produção.

Quer usar IA com custo previsível?

Solicite um orçamento para estruturar seus fluxos de IA com governança de consumo, roteamento de modelos e resultados mensuráveis.


Fontes oficiais e documentação

Post anterior
SendGrid: crie a conta e passe o acesso do jeito certo
Próximo post
Da planilha à plataforma: o produto escondido no briefing
    Compartilhar

Inscreva-se em nossa newsletter

Posts semelhantes

Tempo de Leitura
10
min
O que é web app e quais são seus benefícios?

Acelere a sua empresa com a X-Apps

Alocar profissionaisSolicitar Orçamento
A X-Apps é um provedor de TI parceiro e aconselhada pelo
Gartner
Receba nossos e-mails
Siga nossas redes sociais
O seu time de tecnologia e IA. Software sob medida, soluções de IA e alocação de profissionais.
Vamos conversar?
comercial@x-apps.com.br11 5083-0122

Rua Rodrigo Vieira, 126

Jardim Vila Mariana. São Paulo, SP.

CEP: 04115-060

Mapa do site
Termos de serviçoTermos de privacidade
Available in English