Índice do artigofaltam 7 min de leitura
O recurso deixa o modelo escolher o que assistir. Isso muda o custo, muda a latência e não muda o fato de que uma busca seletiva não é uma inspeção completa.
Em 1º de setembro de 2026 o Google anunciou o que chamou de agentic video understanding, um modo em que o modelo navega o vídeo em vez de recebê-lo inteiro amostrado. Esta página existe para quem procura pelo nome do recurso e quer saber o que ele é, o que está documentado e o que não está, sem passar por uma matéria de lançamento.
Se a sua pergunta é o que isso resolve na empresa, o artigo é outro. Se é como integrar, também.
Resumo do artigo
- O modo padrão continua sendo o estático, com amostragem a um quadro por segundo; o novo modo é opcional e precisa ser ligado.
- A lista de modelos suportados mudou entre o anúncio e a documentação, num intervalo de nove dias.
- Os percentuais do anúncio são máximos reportados pelo fornecedor, e nada indica que os três aconteceram no mesmo caso.
- Três superfícies oficiais citam três benchmarks diferentes, e a metodologia do gráfico que circula não foi localizada em nenhuma delas.
O que o recurso é, na definição do próprio fornecedor
A documentação descreve o modo com navegação assim: o modelo explora dinamicamente a linha do tempo do vídeo, inspeciona transcrições de forma seletiva e ajusta taxa de quadros e resolução conforme o prompt. O anúncio acrescenta o mecanismo: ferramentas nativas de vídeo que buscam, varrem e inspecionam trechos específicos através de quadros visuais, áudio e transcrições, e menciona o modelo invocando uma ferramenta interna para carregar a parte relevante do arquivo.
O anúncio também situa o recurso numa família: ele é descrito como análogo à visão com agente, que combina execução de código com o entendimento de imagem do modelo.
Anúncio de 1º de setembro de 2026 e documentação de entendimento de vídeo do Gemini Developer API, lidos em 10 de setembro de 2026. Capacidade documentada pelo fornecedor.
Vale separar o que a palavra "agente" carrega aqui. O ciclo é escolher uma ferramenta, observar o resultado e decidir o próximo passo, dentro da análise da mídia. Não é permissão para agir em sistema nenhum da sua empresa, e a documentação não descreve nada parecido com isso.
Quais modelos suportam, e como a lista mudou em nove dias
O anúncio cita Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite. A documentação lida nove dias depois lista Gemini 3.8 Flash, 3.7 Flash, 3.6 Flash e 3.5 Flash Lite, e a página abre com um aviso de que o 3.8 Flash já está disponível.
Isso não é contradição, é o ritmo do produto. Mas tem consequência para qualquer texto sobre o assunto, inclusive este: a lista só significa alguma coisa com a data ao lado. E tem consequência para quem opera: uma resposta guardada sem registrar a versão do modelo que a produziu não é reproduzível seis meses depois.
O que ele substitui: o modo estático a um quadro por segundo
O modo com navegação não é o padrão. O padrão é o estático, e ele continua existindo e continua sendo recomendado em parte dos casos.
| Item | Modo estático | Modo com navegação |
|---|---|---|
| Como o vídeo entra | Amostrado a 1 quadro por segundo, tudo de uma vez | Carregado sob demanda, conforme o prompt |
| Modelos | Todos os modelos Gemini | Quatro modelos Flash, na lista de 10/09/2026 |
| Tokenização publicada | Sim, com fórmula por quadro e por segundo de áudio | Não, declarada como variável |
| Recomendado para | Clipe curto, consulta sensível a latência, precisão quadro a quadro | Vídeo longo, pergunta que mira momento específico |
Comparação montada a partir da tabela de modos e das recomendações de uso da documentação oficial, lida em 10 de setembro de 2026.
A tokenização do estático está publicada e permite ancorar ordem de grandeza: 66 tokens por quadro na resolução de mídia baixa, 258 na alta, 32 tokens por segundo de áudio, com a própria documentação arredondando para cerca de 100 tokens por segundo de vídeo na baixa e cerca de 300 na alta. Para o modo com navegação, a documentação diz que o consumo varia com a complexidade do conteúdo e com a estratégia de navegação, e não publica fórmula equivalente.
O que o fornecedor diz que ele destrava
O anúncio nomeia quatro capacidades, e elas são úteis porque descrevem o formato do problema, não o benefício genérico:
- Recuperação de momento com precisão abaixo de um segundo, para mudanças de estado e cortes que passam despercebidos a um quadro por segundo.
- Busca de agulha no palheiro em vídeo de várias horas, sem consumir milhões de tokens.
- Detecção de anomalia, com reamostragem em taxa maior onde interessa.
- Contagem precisa de eventos repetidos, que é o caso em que a amostragem fixa mais erra.
A faixa de material em que o anúncio diz que os ganhos são mais pronunciados também está escrita: de guias de dez minutos a aulas de noventa minutos e gravações de várias horas.
Uma observação sobre a primeira capacidade, porque ela gera confusão: precisão abaixo de um segundo diz respeito à granularidade da resposta, não ao tempo que ela leva para chegar. São coisas diferentes, e a próxima seção mostra que a segunda anda no sentido oposto.
O que ele não faz, segundo a própria documentação
Esta é a seção que matéria de lançamento não escreve, e ela é toda feita de frases do fornecedor.