Blog
Nossas últimas novidadesVelocidade é a nova inteligência: o que a Cerebras muda no custo da sua IA em 2026
Recomendação direta: para atendimento em tempo real, pare de escolher o modelo mais inteligente do ranking e escolha o mais rápido que ainda resolve o seu problema. Em 2026, a diferença entre 0,1 segundo e 7 segundos de resposta vale mais dinheiro do que dez pontos em qualquer benchmark.
Durante três anos, o mercado comprou inteligência artificial como quem compra carro por cilindrada: quanto maior o número, melhor. Setenta bilhões de parâmetros era bom, quatrocentos bilhões era excelente, um trilhão era o futuro.
Em 2026 esse número virou nota de rodapé. As duas empresas que lideram os rankings de raciocínio, OpenAI e Anthropic, simplesmente pararam de publicar o tamanho dos seus modelos. O que elas publicam hoje é preço por milhão de tokens, janela de contexto, níveis de esforço de raciocínio e resultados de benchmark. O número de parâmetros saiu da ficha técnica porque deixou de significar alguma coisa.
Enquanto isso, um fabricante de chips que quase ninguém no Brasil conhecia abriu capital em maio de 2026 avaliado em US$ 95 bilhões, o maior IPO de tecnologia do ano, vendendo uma coisa só: tokens por segundo.
Este artigo explica o que mudou, por que a velocidade virou o novo eixo de competição e, principalmente, quanto custa na prática colocar isso para atender os seus clientes.
Resumo rápido para quem tem pressa
| Se o seu problema é... | Escolha | Por quê |
|---|---|---|
| Atender cliente no WhatsApp com resposta instantânea | GPT-OSS-120B na Cerebras | Cerca de 3.000 tokens/s, US$ 0,35 por milhão de entrada, qualidade de modelo grande |
| Ler print, foto de boleto ou documento enviado pelo cliente | Gemma 4 31B na Cerebras | Único multimodal do catálogo, 1.851 tokens/s, contexto de 256K |
| Validar a ideia sem gastar nada | Camada gratuita da Cerebras | 1 milhão de tokens por dia, sem cartão, atende cerca de 110 conversas diárias |
| Raciocínio profundo, análise jurídica ou financeira | Claude Opus 5 ou GPT-5.6 Sol | Topo absoluto de raciocínio, mas lentos e caros demais para chat |
| Codificação agêntica em repositório grande | Kimi K2.6 ou Qwen 3 Coder na Cerebras | Contexto gigante com latência que não trava o agente |
| Volume gigantesco com orçamento apertado | GPT-5.6 Luna | Após o corte de julho, é o mais barato do mercado, porém sem a velocidade da Cerebras |
Se você já está convencido e quer pular direto para os números, vá para a conta do WhatsApp.
O fim da corrida dos parâmetros
A contagem de parâmetros morreu por três motivos bem concretos.
Primeiro: o número virou marketing. O Kimi K2.6, da Moonshot AI, tem 1 trilhão de parâmetros no papel. Só que ele usa uma arquitetura chamada Mixture-of-Experts, ou mistura de especialistas. Em vez de acionar o modelo inteiro a cada palavra gerada, existe um roteador que escolhe apenas algumas sub-redes especializadas por token. Na prática, o Kimi K2.6 ativa cerca de 32 bilhões de parâmetros por token, não 1 trilhão. O Qwen 3.8-Max, da Alibaba, tem 2,4 trilhões no total e ativa 95 bilhões. Dizer "modelo trilionário" descreve o tamanho do arquivo no disco, não a capacidade que roda a cada palavra.
Segundo: os líderes não contam mais. Ninguém fora da Anthropic sabe quantos parâmetros tem o Claude Opus 5. Ninguém fora da OpenAI sabe o tamanho do GPT-5.6 Sol. Circulam estimativas em fóruns técnicos, algumas bastante específicas, mas nenhuma é confirmada e nenhuma deveria entrar numa decisão de arquitetura. O que dá para verificar é o preço, a latência e o resultado nos testes públicos.
Terceiro, e mais importante: modelos pequenos alcançaram os grandes. O Gemma 4 31B, do Google DeepMind, é um modelo denso de 30,7 bilhões de parâmetros com licença Apache 2.0. No índice de inteligência da Artificial Analysis, ele pontua 29. O Claude Haiku 4.5, proprietário e pago, pontua 30. Um modelo aberto que você pode baixar empata com um modelo comercial de uma das três maiores empresas de IA do mundo.
A conclusão prática é desconfortável para quem vende IA por tamanho: parâmetro deixou de ser especificação e virou taxa de compressão. A pergunta certa não é mais "quantos bilhões?", e sim "quantos tokens por segundo, a que custo, com que qualidade?".
Velocidade é a nova inteligência
Existe um erro de avaliação que se repete em quase todo projeto de IA para atendimento. A equipe testa cinco modelos no playground, escolhe o que dá a melhor resposta e só descobre o problema em produção: o cliente não espera.
Faça a conta você mesmo. Uma resposta típica de atendimento no WhatsApp tem cerca de 150 tokens, algo em torno de três parágrafos curtos.
| Onde o modelo roda | Velocidade | Tempo para gerar 150 tokens |
|---|---|---|
| GPT-OSS-120B na Cerebras | ~3.000 tokens/s | 0,05 s |
| Gemma 4 31B na Cerebras | 1.851 tokens/s | 0,08 s |
| Kimi K2.6 (1T) na Cerebras | 981 tokens/s | 0,15 s |
| Nuvem de GPU comum | 50 a 150 tokens/s | 1,0 a 3,0 s |
| Modelo de fronteira com raciocínio alto | Variável, pensa antes de responder | 5 a 15 s |
Some a isso o tempo até o primeiro token, o tempo da sua automação e, se houver consulta a sistema externo, mais uma ida e volta. Uma arquitetura que parecia aceitável no teste vira sete segundos de silêncio na tela do cliente.
Sete segundos no WhatsApp não é lentidão. É abandono. O cliente sai do app, abre o Instagram, esquece de você.
E o efeito é multiplicativo, não aditivo. Um agente moderno raramente responde em um passo: ele interpreta a mensagem, decide consultar o estoque, recebe o resultado, avalia e só então redige. São três ou quatro chamadas ao modelo para uma única resposta. A 100 tokens/s isso vira dez segundos. A 3.000 tokens/s vira menos de meio segundo. A velocidade não deixa a resposta mais rápida, ela deixa a arquitetura mais inteligente, porque libera você a fazer o modelo pensar mais vezes antes de falar.
A própria Cerebras publicou o número que fecha o argumento. Numa carga de trabalho agêntica de codificação com 10 mil tokens de entrada e 500 de saída, a resposta completa saiu em 5,6 segundos na infraestrutura dela, contra 163,7 segundos no endpoint oficial do mesmo modelo. Não é 6 vezes mais rápido. É 29 vezes.
A revolução da infraestrutura: o fenômeno Cerebras
Para entender por que a diferença é tão grande, é preciso entender por que uma GPU é lenta gerando texto. E a resposta surpreende: não é falta de poder de cálculo, é falta de banda de memória.
Para gerar cada palavra, o chip precisa ler os pesos do modelo inteiro na memória. Numa GPU, esses pesos moram em memória externa (HBM) e precisam atravessar um barramento até os núcleos de processamento. Os núcleos passam a maior parte do tempo parados, esperando dados chegarem. Quando o modelo não cabe em uma placa, ele é fatiado entre várias GPUs, e agora os dados também precisam atravessar cabos entre placas. Cada fatia adiciona espera.
A Cerebras atacou exatamente esse gargalo, com uma decisão de engenharia que soa absurda quando você ouve pela primeira vez.
Um chip comum é fabricado em uma bolacha de silício de 300 mm, que depois é cortada em centenas de pastilhas individuais de uns 800 mm² cada. A Cerebras simplesmente não corta. O Wafer-Scale Engine 3 (WSE-3) usa a bolacha inteira como um único processador:
- cerca de 46.000 mm² de silício, aproximadamente 57 vezes a área de uma GPU de topo;
- 4 trilhões de transistores;
- 900 mil núcleos dedicados a IA;
- 44 GB de memória SRAM dentro do próprio chip.
Esse último item é o que muda o jogo. Os pesos do modelo ficam na memória ultrarrápida dentro do silício, a poucos milímetros dos núcleos que vão usá-los. Não há barramento externo para atravessar, não há cabo entre placas, não há fatiamento. O gargalo de memória que limita a geração de tokens em GPU simplesmente não existe nessa topologia.
O resultado medido por terceiros, e este é um ponto importante, porque os números vêm da Artificial Analysis e não do material de vendas da Cerebras:
- Gemma 4 31B a 1.851 tokens por segundo, cerca de 35 vezes a velocidade de um endpoint de GPU típico rodando o mesmo modelo;
- Kimi K2.6, de 1 trilhão de parâmetros, a 981 tokens por segundo, 6,7 vezes mais rápido que a melhor nuvem de GPU concorrente;
- GPT-OSS-120B a cerca de 3.000 tokens por segundo.
Repare no segundo item. Rodar um modelo de 1 trilhão de parâmetros perto de mil tokens por segundo é o tipo de número que reorganiza o que é possível construir. Revisão de repositório inteiro em tempo real, agentes que conversam entre si sem pausa perceptível, atendimento que consulta três sistemas antes de responder e ainda assim parece instantâneo.
O catálogo real da Cerebras hoje
Aqui vai um alerta que economiza tempo: muita coisa que se lê sobre a Cerebras já está desatualizada. O catálogo muda rápido, modelos entram em prévia, saem de linha e migram para endpoints dedicados. Este é o retrato de agosto de 2026.
| Modelo | Tamanho | Velocidade | Preço por 1M tokens (entrada / saída) | Situação |
|---|---|---|---|---|
| GPT-OSS-120B | 120 bilhões | ~3.000 tokens/s | US$ 0,35 / US$ 0,75 | Produção |
| Gemma 4 31B | 30,7 bilhões, denso, multimodal | 1.851 tokens/s | US$ 0,99 / US$ 1,49 | Prévia |
| Z.ai GLM-4.7 | 355 bilhões | ~1.000 tokens/s | US$ 2,25 / US$ 2,75 | Prévia, descontinuado em 17/08/2026 |
| Qwen 3 235B / Qwen 3 Coder | 235B e 480B | 1.400 a 1.500 tokens/s | US$ 0,60 / US$ 1,20 na tabela histórica | Endpoints dedicados, capacidade reservada |
| Kimi K2.6 | 1 trilhão, 32B ativos | 981 tokens/s | Sob consulta | Corporativo |
Três observações que valem mais do que a tabela:
O GPT-OSS-120B é a barganha do catálogo. Ele é maior que o Gemma 4, mais rápido que o Gemma 4 e custa menos de um terço do preço dele por token de entrada. Se o seu caso não exige leitura de imagens, é quase sempre a escolha certa, e isso contraria a intuição de quem assume que modelo maior custa mais.
O Gemma 4 31B se justifica pela multimodalidade. Ele é o único do catálogo que aceita imagem na entrada, com janela de 256K tokens e licença Apache 2.0. Se o seu cliente manda print de erro, foto de nota fiscal ou captura de tela do carrinho, o Gemma resolve e os outros não. Você paga um pouco mais pela visão computacional, não pela inteligência.
Qwen e Kimi migraram para o caminho corporativo. Muitos guias ainda apresentam o Qwen 3 235B como se estivesse na tabela pública de pagamento por uso. Hoje ele e o Qwen 3 Coder 480B são servidos por endpoints dedicados com capacidade reservada e preço negociado. Continuam excelentes, continuam rápidos, mas envolvem falar com o time comercial e não apenas gerar uma chave de API. Planeje o piloto com o que está na tabela pública e negocie depois, com volume real na mão.
Modelos abertos contra os gigantes proprietários
Agora o retrato completo do mercado. Preços em dólares por milhão de tokens, agosto de 2026.
| Modelo | Origem | Pesos | Entrada | Saída | Onde ele brilha |
|---|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | Fechado | US$ 0,20 | US$ 1,20 | Volume alto e barato |
| GPT-OSS-120B | OpenAI | Aberto | US$ 0,35 | US$ 0,75 | Atendimento rápido de alta qualidade |
| Qwen 3 235B | Alibaba | Aberto | US$ 0,60 | US$ 1,20 | Postura comercial e contexto de 131K |
| Gemma 4 31B | Google DeepMind | Aberto | US$ 0,99 | US$ 1,49 | Multimodal em tempo real |
| Qwen 3.8-Max | Alibaba | Aberto (previsto) | US$ 2,00 | US$ 6,00 | Codificação avançada e tarefas autônomas |
| GPT-5.6 Terra | OpenAI | Fechado | US$ 2,00 | US$ 12,00 | Tarefas corporativas multi-etapas |
| Claude Sonnet 5 | Anthropic | Fechado | US$ 3,00 | US$ 15,00 | Equilíbrio entre custo e raciocínio |
| Claude Opus 5 | Anthropic | Fechado | US$ 5,00 | US$ 25,00 | Raciocínio profundo e trabalho agêntico longo |
| GPT-5.6 Sol | OpenAI | Fechado | US$ 5,00 | US$ 30,00 | Codificação agêntica de ponta |
| Claude Fable 5 | Anthropic | Fechado | US$ 10,00 | US$ 50,00 | Autonomia de longuíssimo prazo |
Gemma 4 31B: o especialista em visão
Modelo denso de 30,7 bilhões de parâmetros, multimodal, 256K de contexto, licença Apache 2.0. Na Cerebras roda a 1.851 tokens/s, cerca de 35 vezes um endpoint de GPU comum, e é o primeiro modelo capaz de "olhar" uma imagem, pensar e agir nessa faixa de velocidade. O ciclo de ver, decidir e responder acontece dentro de um piscar de olhos.
Ponto de atenção: em inteligência bruta ele empata com o Claude Haiku 4.5, o modelo de entrada da Anthropic. É muito para um modelo aberto de 31B, mas não é nível de gerente sênior. Ele segue roteiro bem, e improvisa mal.
GPT-OSS-120B: o melhor custo-benefício real
Cento e vinte bilhões de parâmetros, pesos abertos, otimizado para raciocínio, uso de ferramentas e escala. É o único modelo em status de produção plena no catálogo da Cerebras, com a maior velocidade medida da plataforma e o menor preço. Para atendimento comercial em texto, é a resposta certa na maioria dos casos brasileiros.
Qwen 3 235B: o vendedor sênior
Duzentos e trinta e cinco bilhões de parâmetros, 131K de contexto, entre 1.400 e 1.500 tokens/s na Cerebras. A família Qwen é pragmática: aceita bem instruções do tipo "aja como um consultor direto", entende gírias, erros de digitação e o contexto implícito da conversa. Em português, o desempenho é notavelmente bom. Hoje exige endpoint dedicado.
Qwen 3.8-Max: o próximo marco, com uma ressalva
Lançado em 3 de agosto de 2026 com 2,4 trilhões de parâmetros totais, 95 bilhões ativos por token, contexto de 1 milhão e capacidade multimodal. A Alibaba anunciou que abriria os pesos na semana de 10 de agosto de 2026, quebrando o histórico de manter a linha Max fechada. Até o fechamento deste artigo os pesos ainda não apareceram no Hugging Face. Se o cronograma for cumprido, provedores como a Cerebras precisam ainda baixar, adaptar e compilar o modelo para a arquitetura deles, o que não acontece da noite para o dia. Planeje com o que existe hoje e trate o Qwen 3.8-Max como uma melhoria futura, não como base do projeto.
Os gigantes de fronteira: caros e lentos por design
O Claude Opus 5, o Claude Fable 5 e a linha GPT-5.6 Sol chegaram ao topo do raciocínio lógico por dois caminhos combinados: arquiteturas Mixture-of-Experts hiper-otimizadas, que ativam só uma fração do modelo por token, e sistemas multiagentes, em que o modelo cria subagentes para dividir um problema difícil e resolver as partes em paralelo.
Esses modelos são extraordinários no que foram feitos para fazer: refatorações grandes, análise de documentos densos, trabalho autônomo que roda por horas. O Claude Opus 5 traz janela de 1 milhão de tokens e níveis de esforço de raciocínio configuráveis, do baixo ao máximo. O Fable 5 vai além em autonomia de longuíssimo prazo.
E é justamente isso que os torna a ferramenta errada para o varejo de mensagens rápidas. Eles pensam antes de responder, e pensar custa tempo e tokens. Colocar o Fable 5 para marcar reunião no WhatsApp é contratar um pesquisador sênior para atender a recepção: ele faria muito bem, e você pagaria 15 vezes mais para o cliente esperar mais.
Um detalhe que reforça a tese central deste artigo: a métrica que a OpenAI e a Anthropic expõem hoje é esforço de raciocínio, não tamanho. Você não escolhe um modelo maior, você escolhe quanto ele pode pensar. O parâmetro saiu da conversa até para quem tem os maiores modelos do mundo.
Caso prático: quanto custa atender no WhatsApp
Chega de tabela. Vamos à conta que interessa.
A base de cálculo
Uma conversa de qualificação e agendamento no WhatsApp tem, na média, oito trocas de mensagem. A cada nova mensagem, sua automação precisa reenviar o prompt de sistema e o histórico da conversa, porque a API não guarda estado. Isso significa que o consumo de entrada cresce a cada turno.
Com prompt de sistema de 400 tokens, mensagens do cliente de 35 tokens e respostas de 100 tokens, uma conversa completa consome:
- cerca de 8.000 tokens de entrada
- cerca de 800 tokens de saída
Guarde esses dois números. Toda a conta sai deles. Uma conversa de suporte técnico, mais longa, consome entre duas e três vezes isso.
Cenário 1: 100 clientes por dia
Cem conversas diárias somam 8,8 milhões de tokens por dia. E aqui está a boa notícia: a Cerebras oferece 1 milhão de tokens gratuitos por dia, sem cartão de crédito.
Não cobre as cem conversas, mas cobre cerca de 110 conversas por dia se você contar apenas o que passa pela camada gratuita. Ou seja, o volume de 100 clientes por dia fica praticamente todo dentro do gratuito, desde que a operação seja enxuta.
Se você optar por pagar e ter previsibilidade, o custo mensal (3.000 conversas, 24 milhões de tokens de entrada e 2,4 milhões de saída) fica assim:
| Modelo | Custo mensal | Custo por conversa |
|---|---|---|
| GPT-5.6 Luna | US$ 7,68 | US$ 0,0026 |
| GPT-OSS-120B (Cerebras) | US$ 10,20 | US$ 0,0034 |
| Qwen 3 235B (Cerebras) | US$ 17,28 | US$ 0,0058 |
| Gemma 4 31B (Cerebras) | US$ 27,34 | US$ 0,0091 |
| GPT-5.6 Terra | US$ 76,80 | US$ 0,0256 |
| Claude Opus 5 | US$ 180,00 | US$ 0,0600 |
| GPT-5.6 Sol | US$ 192,00 | US$ 0,0640 |
| Claude Fable 5 | US$ 360,00 | US$ 0,1200 |
Leia essa tabela devagar, porque ela contém a decisão inteira do projeto. Atender cem clientes por dia com um modelo de altíssima qualidade e resposta instantânea custa dez dólares por mês. É menos do que a conta de energia do computador que roda a automação. E o modelo de fronteira, dezessete vezes mais caro, entrega uma qualidade que o cliente não consegue perceber numa mensagem de três parágrafos.
Cenário 2: 1.000 clientes por dia
Trinta mil conversas por mês, 240 milhões de tokens de entrada e 24 milhões de saída. Agora o gratuito acabou e a escolha pesa de verdade:
| Modelo | Custo mensal | Diferença para o GPT-OSS-120B |
|---|---|---|
| GPT-5.6 Luna | US$ 76,80 | 0,75x |
| GPT-OSS-120B (Cerebras) | US$ 102,00 | referência |
| Qwen 3 235B (Cerebras) | US$ 172,80 | 1,7x |
| Gemma 4 31B (Cerebras) | US$ 273,36 | 2,7x |
| GPT-5.6 Terra | US$ 768,00 | 7,5x |
| Claude Opus 5 | US$ 1.800,00 | 17,6x |
| Claude Fable 5 | US$ 3.600,00 | 35,3x |
Mil atendimentos por dia, com IA de alto nível respondendo em menos de um décimo de segundo, por cerca de cem dólares por mês. Um único atendente humano custa múltiplos disso, e atende uma conversa por vez.
O veredito honesto sobre preço
Aqui é onde muito conteúdo sobre Cerebras exagera, e vale ser direto: a Cerebras não é a mais barata do mercado. O GPT-5.6 Luna, depois do corte de preço de 30 de julho de 2026, custa menos por token do que qualquer coisa no catálogo da Cerebras.
O que a Cerebras entrega é a melhor relação entre velocidade e preço, e por uma margem que não tem concorrente. Você paga cerca de 30% a mais que o modelo mais barato do mercado e recebe uma resposta entre 20 e 35 vezes mais rápida. Para atendimento em tempo real, essa é a troca mais vantajosa disponível hoje.
Se o seu volume for astronômico e o orçamento for o único critério, o Luna ganha. Se o critério for a experiência do cliente, a Cerebras ganha sem discussão.
Como montar isso na prática
Três peças, e nenhuma delas é o modelo.
1. Conexão oficial com o WhatsApp. Não automatize o aplicativo comum sob risco de banimento. Use a WhatsApp Business Cloud API da Meta, ou um provedor que a intermedie. O acesso à API é gratuito, você paga as taxas de conversa da Meta.
2. Orquestração. É a camada que recebe a mensagem, monta o contexto, chama a Cerebras e devolve a resposta. Ferramentas como n8n e Make resolvem em minutos, e código próprio resolve melhor quando as regras de negócio crescem. Vale ler antes o guia sobre agentes de IA ou sistemas tradicionais, porque boa parte dos projetos de atendimento nem precisa de agente.
3. Ferramentas conectadas. É onde a velocidade da Cerebras vira dinheiro. Com tool calling bem implementado, o modelo identifica que o cliente quer o status do pedido, consulta o seu ERP, recebe o código de rastreio e responde, tudo em menos de um segundo. Numa nuvem de GPU comum, esse mesmo ciclo levaria de oito a doze segundos.
Se o atendimento precisa responder sobre catálogo, políticas ou base de conhecimento, monte um RAG bem estruturado em vez de enfiar tudo no prompt de sistema. Sai mais barato e alucina menos.
E antes de expor qualquer coisa ao público, leia sobre proteção contra prompt injection. Um agente rápido que aceita instruções vindas da mensagem do cliente é um agente rápido causando prejuízo.
Cinco armadilhas que ninguém conta
Estas são as pedras no caminho que aparecem depois que o projeto começa.
1. A camada gratuita tem teto de contexto de 8K tokens. É a armadilha mais comum. Um milhão de tokens por dia parece infinito, mas cada requisição individual é limitada a cerca de 8 mil tokens de contexto no plano gratuito. Uma conversa longa com histórico acumulado estoura esse teto e passa a falhar. Resolva com uma janela deslizante, mantendo as últimas cinco ou seis mensagens mais um resumo, ou migre para o plano pago.
2. Existe limite de requisições por minuto. Se vários clientes escreverem no mesmo minuto, o gratuito pode devolver erro de limite excedido e travar o atendimento. Trate erro 429 com fila e nova tentativa desde o primeiro dia, não depois do primeiro incidente.
3. Os planos Code Pro e Code Max estão esgotados. As assinaturas de US$ 50 e US$ 200 por mês, muito citadas em conteúdos recentes, aparecem como esgotadas. Elas também são voltadas a desenvolvimento com agentes de código, não a atendimento. Para WhatsApp, o caminho é a API por consumo.
4. Modelo em prévia pode sair de linha. O GLM-4.7 tem descontinuação marcada para 17 de agosto de 2026. Isole a chamada do modelo atrás de uma camada própria no seu código, para que trocar de modelo seja mudar uma linha de configuração e não reescrever a integração.
5. Velocidade não conserta prompt ruim. Responder em 0,05 segundo com a informação errada é pior do que responder em três segundos com a informação certa. Monte testes de regressão dos seus prompts e acompanhe métricas e logs em produção. A infraestrutura resolve latência, e só o seu processo resolve qualidade.
Conclusão e veredito
A tese central de 2026 é simples de enunciar e difícil de aceitar para quem passou três anos comprando IA por tamanho: o futuro pertence a modelos abertos otimizados rodando em silício dedicado à inferência.
Os três movimentos que sustentam isso já aconteceram. Modelos abertos alcançaram a qualidade que importa para a maioria dos casos comerciais. O chip especializado quebrou o gargalo de memória que limitava a velocidade. E o preço da inteligência de nível corporativo caiu para a casa dos centavos por conversa.
Os modelos de fronteira continuam sendo os melhores do mundo, e continuarão. Eles simplesmente não são o produto certo para responder "vocês entregam em Belo Horizonte?".
O veredito, então:
- Está validando a ideia? Camada gratuita da Cerebras com GPT-OSS-120B. Custo zero, resposta instantânea, sem cartão.
- Está em operação com até 100 clientes por dia? GPT-OSS-120B por consumo, cerca de US$ 10 por mês. Suba para Gemma 4 31B se precisar ler imagens.
- Passou de 1.000 clientes por dia? Continue no GPT-OSS-120B e negocie um endpoint dedicado com Qwen 3 235B quando a qualificação ficar realmente complexa.
- Precisa de raciocínio profundo? Use Claude Opus 5 ou GPT-5.6 Sol, mas fora do fluxo de chat: em processamento assíncrono, análise noturna ou escalonamento de casos difíceis.
A arquitetura que vence não é uma escolha entre rápido e inteligente. É rápido na conversa, inteligente no bastidor.
E você, de que lado está?
Aqui vai a pergunta que divide as equipes que atendemos:
Você prefere economizar com modelos menores e rápidos, aceitando que a IA vai errar em uma pergunta a cada cinquenta e transferir para um humano, ou prefere investir em qualidade máxima para que nenhum cliente perceba que está falando com uma máquina, mesmo pagando dezessete vezes mais?
Não existe resposta universal. Depende do seu ticket médio, da complexidade das dúvidas e do custo real de perder um cliente por uma resposta boba. Conte nos comentários qual caminho você escolheu e por quê, porque essa decisão é bem mais interessante do que qualquer benchmark.
E se você quer discutir isso aplicado ao seu negócio, com números do seu volume real, fale com o nosso time sobre agentes de IA para empresas.
Leia também:
- GPT-5.6 Sol, Terra ou Luna: qual modelo escolher
- Assinatura de IA ou API sob demanda: o que sai mais barato
- Projeto com IA sem arquitetura: por que tantos pilotos morrem
- Checklist de desenvolvimento assistido por IA
Preços, velocidades e disponibilidade verificados em agosto de 2026. O catálogo de modelos de inferência muda rápido, então confirme os valores na documentação oficial antes de fechar um orçamento.