Índice do artigofaltam 6 min de leitura
A automação entrou, o piloto funcionou, e alguém fez a pergunta que sempre aparece: quem confere? A resposta que quase todo mundo dá na primeira semana é a mesma, e ela é razoável. Confere tudo. É novo, ninguém confia ainda, então cada documento que a máquina processa passa por uma pessoa antes de virar lançamento.
Seis meses depois o time percebe que trabalha quase tanto quanto antes.
Não é impressão. A regra de conferir tudo é uma decisão de custo disfarçada de decisão de qualidade, e ela costuma ser tomada sem que ninguém tenha medido o que custa. O problema é que ela também não entrega a qualidade que promete.
A revisão de 100% não entrega 100%
Um estudo publicado em maio de 2026 por Diego Gosmar, da Tesisquare, e Giovanni Zenezini, do Politécnico de Turim, mediu um pipeline de processamento de notas fiscais em produção e comparou três desenhos. O que chama atenção não é o número da IA. É o número da operação manual.
| Desenho | Revisão humana | Acurácia | Notas por pessoa por ano |
|---|---|---|---|
| Manual | 100% | 95% | 4.500 |
| Só IA | 0% | 85% | 25.000 |
| IA com revisão seletiva | 15% | 98,5% | 15.000 |
Fonte: Gosmar e Zenezini, MADP: A Multi-Agent Pipeline for Sustainable Document Processing with Human-in-the-Loop, arXiv:2605.17159v1, 16 de maio de 2026. Projeção para 100 mil notas por ano, a partir de 955 documentos processados em produção até 21 de janeiro de 2026 e de uma ablação com 100 documentos.
A linha de cima é a que muda a conversa. A operação que revisa cada documento, uma por uma, com gente treinada, acerta 95%. Revisar tudo e acertar tudo são coisas diferentes, e nesse caso a diferença é de cinco pontos.
Vale dizer o que esses números são e o que não são: um fornecedor de software, um tipo de documento, uma amostra de produção de 955 peças. Não é a sua operação. O que interessa aqui é que a taxa de revisão e a acurácia aparecem na mesma tabela, medidas juntas.
Onde o ganho vai parar, em 100 mil notas
A terceira linha processa 15 mil notas por pessoa por ano. A primeira processa 4,5 mil. É mais de três vezes, e a diferença entre elas não está no modelo de IA: está em revisar 15% em vez de 100%.
Na projeção de 100 mil notas por ano, isso aparece como 23 pessoas contra 7. Dessas 7, cinco fazem a validação dos documentos que o sistema sinalizou e duas cuidam da supervisão e do ajuste dos prompts. O trabalho não sumiu, ele mudou de lugar: saiu de digitar e conferir tudo, e foi para decidir o que merece ser olhado.
A segunda linha merece uma palavra, porque ela é a tentação oposta. Sem nenhuma revisão, a mesma equipe processaria 25 mil notas por pessoa, e a acurácia cairia para 85%. Esses 15% de erro não desaparecem: eles viram divergência de pagamento, retrabalho na conciliação e ligação de fornecedor. O estudo é explícito em dizer que o custo dessa correção a jusante não está contado na tabela.
Quanto tempo custa revisar um documento
Aqui vale fazer a conta em público, porque ela é simples e porque raramente aparece escrita.
O estudo publica o tempo médio por documento em cada desenho: 120 segundos no manual, 6 segundos só com IA, 18 segundos com revisão seletiva de 15%. Esses 18 segundos são uma média entre o documento que passa direto e o documento que para na mesa de alguém. Se 85% dos documentos custam 6 segundos, o tempo que sobra está concentrado nos outros 15%:
18 = 0,15 × (6 + R) + 0,85 × 6, o que dá R de cerca de 80 segundos de revisão humana por documento revisado.
Com esse mesmo custo de revisão, mantendo a IA fazendo a extração e uma pessoa conferindo todos os documentos, o tempo por documento seria de aproximadamente 86 segundos, contra 120 do processo manual inteiro.
Isto é uma derivação nossa da tabela publicada, com a premissa declarada acima, e não uma medição dos autores. Mas o tamanho do efeito é difícil de ignorar: revisando 15%, a economia de tempo é de cerca de 85%; revisando tudo, ela cai para algo perto de 28%. Mesmo pipeline, mesmo modelo, mesmas pessoas. A única coisa que mudou foi a regra de conferência, e ela levou embora dois terços do ganho.
Essa é a conta que decide se o projeto se paga.
O que decide a faixa de revisão
Revisar menos só funciona se o sistema souber escolher o que mandar para a pessoa. No pipeline do estudo, três mecanismos fazem essa triagem, e vale separá-los porque têm custos bem diferentes.
O primeiro é determinístico e é o mais barato: uma camada de validação confere se a data tem formato de data, se o identificador fiscal tem formato de identificador fiscal, se subtotal mais imposto fecha com o total dentro de uma tolerância, e se os valores caem numa faixa plausível. Nada disso precisa de modelo nem de gente. É regra de negócio escrita uma vez, e ela pega a classe de erro que não exige julgamento: o campo malformado, a soma que não fecha, o valor fora da faixa.
O segundo é o grau de confiança da extração. Documento cuja confiança fica abaixo de um limiar vai para revisão. No estudo, esses limiares ficam tipicamente entre 80% e 90%, e são definidos por quatro coisas: tipo de documento, confiabilidade histórica de quem enviou, criticidade do campo e tolerância a risco da organização. Os quatro são decisões de negócio, não de engenharia. Um campo de observação errado custa pouco; um valor total errado custa o que ele vale.
O terceiro é o desacordo. Quando dois modelos processam o mesmo documento em paralelo e discordam de um campo, a divergência marca o documento para revisão sozinha. Concordância vira confiança alta, discordância vira fila.
A conclusão prática é a que menos agrada a quem quer uma resposta única: a taxa de revisão não é um número a ser copiado de fora. É uma faixa por tipo de documento e por origem, escolhida por quem responde pelo prejuízo.
Amostrar por atributo não é improviso
A objeção previsível é que isso tudo soa como aceitar erro de propósito. Soa, e é o que o controle de qualidade industrial faz há décadas, com método publicado e norma internacional.
A ISO 2859-1 está na terceira edição, publicada em janeiro de 2026 pelo comitê ISO/TC 69/SC 5, com 82 páginas, e substitui a edição de 1999. Ela define planos de amostragem para inspeção por atributos, indexados por um limite de qualidade aceitável, o AQL, que é o percentual máximo de itens defeituosos tolerado no lote. A própria norma diz que serve para avaliar componentes fabricados, registros de manutenção e procedimentos administrativos.
Dois mecanismos dela interessam diretamente a quem está desenhando revisão de saída de IA. O primeiro é a inspeção reduzida, e o salto de lote que a terceira edição acrescentou: origem com bom histórico é inspecionada menos, como incentivo e como economia. O segundo é a troca para inspeção severa quando os defeitos aparecem: a taxa de conferência sobe sozinha, por regra, quando a qualidade cai.
É esse segundo mecanismo que separa amostragem de chute com aparência de método. Escolher 15% uma vez e nunca mais olhar deixa a regra sem realimentação: se a qualidade da origem piorar, nada na operação reage. O que transforma uma coisa na outra é a regra de troca: o que faz a taxa subir, com qual gatilho, e o que faz ela voltar a cair.
O que medir antes de mexer na taxa
O que vemos nos projetos é que a etapa de conferência quase nunca está medida. O tempo de extração aparece no relatório, porque veio do sistema. O tempo de revisão some dentro do expediente de quem revisa, e por isso a conta da seção anterior costuma ser impossível de fazer com dados próprios.
Antes de mudar qualquer regra, três coisas valem a medição, e nenhuma delas exige projeto:
- Quanto tempo leva revisar um documento de verdade. Cronometrado, por tipo de documento, numa semana normal. Sem esse número, qualquer discussão sobre taxa de revisão é opinião.
- Com que frequência a revisão muda alguma coisa. Revisor que abre cem documentos e corrige dois está gastando noventa e oito aberturas para achar dois. Isso é uma medida direta de onde a revisão está sobrando.
- Onde as correções se concentram. Por campo e por origem. Quando o erro se concentra em poucas origens ou em poucos campos, essa distribuição define sozinha a primeira faixa a afrouxar e a primeira a apertar.
Uma última observação, de experiência própria e sem número: mais uma passada nem sempre soma. Num trabalho nosso de revisão de documento longo neste ano, mandar o texto de volta para outro modelo, para enxugar, devolveu uma versão mais curta que tinha perdido pontos que importavam, e a versão anterior era melhor no mérito. A conclusão interna foi ajustar trecho, em vez de reprocessar o documento inteiro. Vale para gente também: revisão não é um bem puro que se acumula sem custo.
A pergunta que fecha a decisão não é quanto você confia na IA. É outra, e ela é respondível com dados que a sua operação pode levantar em uma semana: quanto custa a conferência que você faz hoje, e quanto dela está sendo gasta em documentos que estavam certos?