Índice do artigofaltam 14 min de leitura
Os agentes de IA já conseguem abrir aplicativos, ler e-mails, consultar documentos, preencher formulários e tomar algumas decisões. O problema é que fazer partes de um processo não é o mesmo que entregar o processo inteiro.
O OSWorld 2.0, nome também divulgado como OSWorld 2, foi criado para medir essa diferença. Em vez de pedir uma ação curta, o benchmark reúne fluxos profissionais que atravessam aplicações, arquivos, mensagens, regras e decisões ao longo de centenas de passos.
A principal conclusão não é que os agentes “falham em 79,4% de tudo”. É que a distância entre progresso parcial e conclusão confiável ainda é grande, e essa distância precisa orientar arquitetura, custo, segurança e supervisão humana.
Resumo do artigo
- O OSWorld 2 reúne 108 tarefas profissionais longas: a mediana exige cerca de 1,6 hora de trabalho humano e os agentes executam, em média, 318 ações por tentativa.
- O melhor resultado oficial publicado combina 54,8% de pontuação parcial com apenas 20,6% de conclusão binária, e é essa distância que separa demonstração de produção.
- A Anthropic reporta 70,57% de Pass@1 para o Claude Opus 5 em protocolo próprio, número que não é comparável ao ranking oficial sem reproduzir as mesmas condições.
- Na faixa de tarefas mais longas, entre 163 e 360 minutos, todos os modelos exibidos no paper ficaram em 0% de conclusão binária.
Resumo executivo
| Indicador | O que o número realmente significa |
|---|---|
| 108 tarefas | Conjunto do OSWorld 2 com fluxos profissionais longos e realistas. |
| 1,6 hora | Duração mediana para uma pessoa qualificada concluir uma tarefa. |
| 318 ações | Média de chamadas de ferramenta dos agentes avaliados, contra aproximadamente 30 no OSWorld original. |
| 20,6% | Melhor conclusão binária publicada no paper e no leaderboard oficial: Claude Opus 4.8, em configuração max e execução em lote. |
| 54,8% | Pontuação parcial da mesma configuração: houve bastante progresso, mas nem sempre entrega completa. |
| 70,57% | Pass@1 reportado pela Anthropic para Claude Opus 5, em protocolo próprio descrito no System Card. |
| Opus 5 no ranking oficial | Na data desta atualização, o modelo não aparece no leaderboard público mantido pelo projeto; portanto, sua pontuação binária oficial independente permanece não publicada. |
Esses números respondem a perguntas diferentes. Misturá-los em um único ranking cria uma conclusão atraente, mas metodologicamente incorreta.
O que é o OSWorld 2.0
O OSWorld 2 avalia agentes que controlam um computador em ambientes com navegador, e-mail, planilhas, documentos, sistemas empresariais, arquivos e aplicações multimídia. O paper oficial descreve três princípios centrais:
- fluxos autênticos: as tarefas são inspiradas em trabalho profissional real;
- horizonte longo: o agente precisa sustentar contexto, estado e restrições por centenas de ações;
- avaliação verificável: cada tarefa possui checkpoints objetivos que permitem medir tanto o resultado final quanto o progresso intermediário.
Quase 70% das tarefas exigem mais de uma hora de trabalho humano. Os agentes usam, em média, 318 chamadas de ferramenta, e o protocolo principal permite até 500 passos. Isso muda a natureza do teste: o desafio deixa de ser “encontrar o botão certo” e passa a ser “preservar a intenção do usuário durante um processo inteiro”.
OSWorld, OSWorld-Verified e OSWorld 2.0: não confunda
Os três nomes pertencem à mesma família, mas não representam a mesma dificuldade.
| Benchmark | Foco | Horizonte típico | Como interpretar |
|---|---|---|---|
| OSWorld | Uso geral de aplicações reais em diferentes sistemas operacionais. | Tarefas relativamente curtas, com cerca de 30 ações dos agentes no comparativo apresentado pelo novo paper. | Mede capacidade de percepção e operação em interfaces. |
| OSWorld-Verified | Versão revisada do conjunto anterior para reduzir tarefas e avaliações problemáticas. | Ações mais curtas e autocontidas, raramente atravessando mais de uma ou duas aplicações. | É melhor para comparar competência em tarefas delimitadas. |
| OSWorld 2 | Fluxos profissionais conectados, com múltiplas fontes, aplicações, mudanças de estado e decisões. | Mediana humana de 1,6 hora e média de 318 ações dos agentes. | Mede resistência a erros acumulados e capacidade de finalizar trabalho de ponta a ponta. |
O próprio paper usa um contraste importante: Claude Opus 4.8 chega a 83,5% no OSWorld-Verified, mas a 20,6% de conclusão binária no OSWorld 2. Não há contradição. A segunda avaliação mede um horizonte muito mais longo, no qual pequenos desvios se acumulam.
Como ler conclusão binária, progresso parcial e Pass@1
Conclusão binária
A métrica binária responde à pergunta mais exigente: o agente concluiu todo o trabalho?
Se uma prestação de contas exige cinco despesas corretas, anexos, centro de custo, aprovação e envio final, deixar uma etapa crítica errada resulta em zero na conclusão binária, mesmo que boa parte do processo tenha sido feita.
Essa é a métrica mais próxima de uma entrega empresarial utilizável, embora ainda não inclua todos os riscos de produção.
Pontuação parcial
O OSWorld 2 divide cada tarefa em checkpoints objetivos, em média 27,25 checkpoints por tarefa. A pontuação parcial mede quantos desses requisitos foram cumpridos.
Pontuação parcial alta mostra que o agente avançou e pode ter economizado trabalho. Ela não autoriza dizer que o processo foi concluído. Em produção, esse progresso pode ser útil quando um humano revisa e finaliza; pode ser perigoso quando a automação publica, paga, apaga ou envia algo sem validação.
Pass@1
Pass@1 normalmente representa a chance de sucesso em uma tentativa, sob um protocolo específico. No System Card do Claude Opus 5, a Anthropic descreve o resultado como taxa de sucesso na primeira tentativa, calculada como média de cinco execuções.
O nome da métrica, o ambiente, a resolução, o limite de passos, o avaliador e o sistema que cerca o modelo precisam acompanhar o número. Por isso, 70,57% de Pass@1 não deve ser renomeado como 70,57% de pontuação parcial e também não deve ser colocado na mesma coluna dos 20,6% binários sem uma reprodução comparável.
Resultados oficiais do paper e do leaderboard
Esta é a comparação publicada para as três melhores configurações em lote do paper. O custo representa a média aproximada por tarefa avaliada, não o custo de uma conclusão garantida.
| Modelo e configuração | Conclusão binária | Pontuação parcial | Custo médio por tarefa |
|---|---|---|---|
Claude Opus 4.8, max, em lote | 20,6% | 54,8% | US$ 72,40 |
Claude Opus 4.7, max, em lote | 18,2% | 48,91% | US$ 33,60 |
GPT-5.5, xhigh, em lote | 13,0% | 49,5% | US$ 25,50 |
Fonte: paper do OSWorld 2 e leaderboard mantido pelo projeto. A linha destacada é a melhor conclusão binária publicada.
O valor mais útil é a diferença entre as duas colunas de desempenho. No Opus 4.8, por exemplo, 54,8% de progresso parcial coexistem com 20,6% de conclusão integral. O modelo frequentemente faz partes corretas, mas ainda perde detalhes, deixa requisitos para trás ou não verifica o estado final.
Atualização: como interpretar os 70,57% do Claude Opus 5
A página de lançamento do Claude Opus 5 afirma que o modelo supera os demais no OSWorld 2 considerando desempenho e custo. O documento técnico oferece o contexto necessário para interpretar a afirmação.
No System Card do Claude Opus 5, a Anthropic informa:
- execução nas configurações padrão dos modelos;
- resolução de 1080p;
- limite de 500 ações por tarefa;
- uso de Claude Opus 4.8 como avaliador por modelo quando necessário;
- resultado agregado em cinco execuções;
- métrica apresentada como Pass@1 accuracy e taxa de sucesso na primeira tentativa.
| Modelo no gráfico da Anthropic | Pass@1 reportado |
|---|---|
| Claude Opus 5 | 70,6% (70,57% no texto técnico) |
| Claude Fable 5 | 66,1% |
| GPT-5.6 Sol | 62,6% |
| Claude Opus 4.8 | 55,7% |
| Claude Sonnet 5 | 51,4% |
| Muse Spark 1.1 | 47,3% |
O resultado é relevante e indica avanço. Mas há três limites editoriais importantes:
- o gráfico é uma avaliação publicada pela própria Anthropic, não uma entrada do leaderboard independente mantido pelos autores do OSWorld 2;
- a métrica está identificada como Pass@1, não como pontuação parcial;
- o Opus 5 ainda não aparece no ranking público oficial na data desta atualização.
Portanto, a formulação responsável é: a Anthropic reporta 70,57% de Pass@1 para o Claude Opus 5 em seu protocolo do OSWorld 2. A formulação “o Opus 5 conclui sete de cada dez tarefas do ranking oficial” vai além da evidência disponível.
Um fluxo completo: o reembolso no ExpenseFlow
Uma das trajetórias descritas no paper ajuda a entender por que o benchmark é difícil. O agente precisa preparar um relatório de despesas no sistema fictício ExpenseFlow, e a sequência abaixo mostra por que o percentual parcial fica alto enquanto a conclusão não vem.
-
Consulta um tutorial e uma política em PDF
Entende o formato exigido antes de tocar no sistema. É a parte que qualquer demonstração mostra bem.
-
Localiza recibos no e-mail e dados em um relatório anterior
Recupera comprovantes, dados pessoais e o centro de custo espalhados por aplicações diferentes.
-
Confere transações no banco e cruza as referências
Reconcilia datas, valores, categorias e códigos contábeis entre fontes que não conversam entre si.
-
Monta cinco linhas de despesa e anexa comprovantes
Distribui valores, seleciona o aprovador e liga cada anexo à linha correspondente.
-
Aparecem informações novas e inconsistências
É aqui que o agente deveria interromper e perguntar ao usuário. Quando ele escolhe uma interpretação em vez de pedir esclarecimento, tudo que vem depois opera sobre uma premissa errada.
-
Relatório enviado, com pontuação parcial de 0,76
Houve entrega visível, mas permaneceram discrepâncias em localização de diária e anexos. O sistema chegou longe e ainda assim precisaria de conferência antes de produzir efeito financeiro real.
Sequência reconstruída a partir da trajetória descrita no paper. Esse é exatamente o tipo de situação que um ranking simplificado esconde.
O desempenho desaba conforme o horizonte aumenta
O paper agrupa as tarefas por duração estimada do trabalho humano: de menos de 45 minutos até um intervalo entre 163 e 360 minutos. Na faixa mais longa, todos os modelos exibidos obtiveram 0% de conclusão binária.
Isso acontece porque o risco se acumula. Se cada etapa tiver uma pequena chance de erro, um processo com centenas de decisões se torna muito menos confiável do que uma ação isolada. Além disso, falhas intermediárias contaminam o restante da trajetória: um valor lido errado entra na planilha, orienta uma decisão e reaparece no formulário final.
Para a empresa, a unidade de análise não deve ser “o modelo sabe clicar?”, mas:
- por quanto tempo ele preserva restrições;
- quantos estados precisa acompanhar;
- quantas aplicações e fontes precisa reconciliar;
- em quais pontos consegue detectar e reparar o próprio erro;
- qual é o dano possível se concluir algo incorretamente.
Onde os agentes mais falham
Os desafios do conjunto se sobrepõem: uma mesma tarefa pode exigir raciocínio entre fontes, precisão visual e acompanhamento de vários itens.
As trajetórias analisadas mostram padrões recorrentes:
- o agente entende a regra no início, mas deixa de aplicá-la dezenas de passos depois;
- encontra uma atualização no meio do processo e não propaga a informação;
- escolhe uma interpretação quando deveria pedir esclarecimento;
- produz um arquivo ou formulário, mas não verifica se o resultado corresponde ao pedido;
- altera a interface por um caminho técnico que ignora o estado esperado pelo usuário;
- corrige o sintoma de um erro sem restaurar a consistência do processo.
O dado mais preocupante é operacional: os agentes estudados gastam menos de 7% do orçamento de passos detectando e reparando erros. Eles investem muito mais em avançar do que em confirmar se continuam no caminho certo.
Do benchmark para uma arquitetura de produção
Um modelo mais capaz ajuda, mas não resolve sozinho um fluxo de alto risco. A arquitetura precisa transformar cada causa de falha em um controle verificável.
| Falha observada | Contramedida de engenharia |
|---|---|
| Restrição esquecida | Estado estruturado, checklist persistente e validação antes de cada ação crítica. |
| Informação intermediária perdida | Memória externa com origem, horário, versão e vínculo com o item afetado. |
| Suposição em cenário ambíguo | Política explícita de interrupção e pergunta ao usuário. |
| Resultado não verificado | Verificador independente, leitura posterior e comparação com critérios de aceite. |
| Erro que contamina etapas seguintes | Checkpoints transacionais, idempotência e capacidade de rollback. |
| Ação perigosa ou fora de escopo | Permissões mínimas, allowlist de ferramentas e aprovação humana. |
Em termos práticos, um agente empresarial precisa de pelo menos cinco camadas:
Essa estrutura é mais importante do que trocar o modelo mantendo o mesmo fluxo frágil.
Quanto custa uma conclusão útil
O custo médio por tentativa não conta a história inteira. Uma aproximação simples divide o custo médio por tarefa pela taxa de conclusão binária.
| Configuração | Custo por tentativa | Taxa binária | Custo esperado por conclusão completa |
|---|---|---|---|
Claude Opus 4.8, max, em lote | US$ 72,40 | 20,6% | aproximadamente US$ 351 |
Claude Opus 4.7, max, em lote | US$ 33,60 | 18,2% | aproximadamente US$ 185 |
GPT-5.5, xhigh, em lote | US$ 25,50 | 13,0% | aproximadamente US$ 196 |
Esse cálculo é derivado, não uma métrica oficial do paper. Ele serve para mostrar a ordem de grandeza, mas não representa o preço de uma garantia: tentativas podem falhar de forma correlacionada, tarefas variam de custo e uma revisão humana pode aproveitar trabalho parcial sem repetir tudo.
O cálculo empresarial completo deveria incluir:
- tokens e infraestrutura;
- execução de ferramentas e ambientes isolados;
- repetição de tentativas;
- tempo de revisão humana;
- investigação e correção de erros;
- impacto de uma ação incorreta;
- economia obtida quando o progresso parcial é aproveitável.
O sistema ao redor do modelo importa
Um benchmark de computer use avalia um sistema, não apenas um modelo abstrato. Resolução da tela, estratégia de navegação, memória, ferramentas, limite de ações, avaliador, tratamento de erros e possibilidade de execução em lote alteram o resultado.
Isso também explica por que uma empresa não deve copiar uma porcentagem e transformá-la diretamente em previsão de ROI. O agente em produção terá aplicativos diferentes, dados reais, permissões, latência, exceções e consequências que o ambiente do benchmark não reproduz por completo.
E os agentes locais?
A família Holo 3.1, da H Company, é um exemplo de agente multimodal com variantes de 0,8B, 4B, 9B e 35B-A3B, licença Apache 2.0 e opções para execução local em Windows e macOS. Isso pode ser interessante quando privacidade, latência, customização ou custo recorrente justificam operar o modelo na própria infraestrutura.
Arquitetura híbrida de um agente local: o laço de captura de tela, ação e conferência roda na máquina, e apenas o passo mais difícil vai para um modelo de fronteira.
Mas há uma ressalva essencial: os resultados divulgados pela H Company pertencem à família de avaliações OSWorld, e não constituem uma entrada diretamente comparável ao leaderboard oficial do OSWorld 2. “Rodar local” também não significa “operar com segurança” por padrão. Ainda são necessários isolamento, controle de ferramentas, proteção de credenciais, logs e validação dos efeitos.
Uma arquitetura híbrida costuma ser mais realista: modelos locais para classificação, extração e tarefas sensíveis de menor risco; modelos de fronteira para planejamento complexo; e código determinístico para regras que não deveriam depender de interpretação probabilística.
Taxa de sucesso não é segurança
O OSWorld 2 inclui verificações de efeitos colaterais graves que podem não aparecer na pontuação visível da tarefa. Entre elas estão vazamento de credenciais, uso indevido de disco, integridade de documentos, mudanças em grupos privilegiados, processos inesperados, bypass de sandbox, alterações em sudoers e permissões gráficas como xhost.
O apêndice de segurança documenta um ponto decisivo: uma tarefa pode obter pontuação principal 1,0 e ainda falhar em uma checagem de segurança, como no caso de exposição de credencial. Ou seja, concluir a interface não basta.
Antes de permitir ações reais, adote:
- Credenciais temporárias e de privilégio mínimo
- Ambientes isolados por tarefa
- Bloqueio de leitura e envio de segredos
- Confirmação antes de pagar, publicar, excluir ou conceder acesso
- Registro de cada ação e de sua justificativa
- Detector de mudanças inesperadas no sistema
- Revisão posterior do estado, não apenas da mensagem final do agente
Para ameaças específicas, veja também como proteger chatbots e agentes contra prompt injection.
O que o benchmark não prova
Mesmo uma pontuação alta e reproduzida não demonstraria, sozinha, que:
- o agente pode operar sem supervisão em qualquer empresa;
- o mesmo desempenho será mantido em sistemas, políticas e dados diferentes;
- a execução é segura, privada ou compatível com a LGPD;
- uma segunda tentativa falhará de forma independente da primeira;
- a automação terá ROI positivo depois de revisão e correção;
- um modelo sozinho substituirá ferramentas, regras e integrações determinísticas;
- resultados publicados por organizações diferentes são comparáveis sem alinhar o protocolo.
Benchmarks são instrumentos de decisão, não certificados de prontidão para produção.
Como decidir onde usar um agente na empresa
Onde colocar um agente hoje: quebre o fluxo longo em etapas curtas com conferência e comece pelo quadrante de menor risco.
Um caminho prudente é começar por processos em que o erro é reversível e o resultado parcial já tem valor. Por exemplo: preparar um rascunho, reunir evidências, classificar documentos ou preencher uma prévia para revisão.
Use este roteiro:
- Mapeie a tarefa completa, incluindo exceções e aprovações.
- Defina o que significa concluído, com critérios verificáveis.
- Separe ações reversíveis de irreversíveis antes de dar qualquer acesso de escrita.
- Meça conclusão binária e progresso parcial no seu próprio conjunto de casos.
- Comece com revisão humana e reduza a supervisão apenas depois de evidência consistente.
Se o custo do erro for alto e uma entrega parcial não tiver utilidade, prefira sistemas determinísticos, integrações controladas e aprovação humana. Para aprofundar essa escolha, leia agentes de IA ou sistemas: qual escolher? e orquestração de agentes com governança.
Quer transformar agentes de IA em uma operação confiável?
A X-Apps ajuda a mapear processos, desenhar arquitetura híbrida, integrar ferramentas e criar validação, segurança e supervisão para colocar agentes em produção com controle.
Perguntas frequentes
É um benchmark de 108 tarefas profissionais longas em ambientes de computador. A tarefa mediana exige cerca de 1,6 hora de trabalho humano, e os agentes avaliados executam, em média, 318 ações.
A pontuação binária só considera sucesso quando todo o fluxo é concluído. A pontuação parcial concede crédito pelos checkpoints corretos alcançados, mesmo que o resultado final permaneça incompleto.
A Anthropic reporta 70,57% de Pass@1, descrito como taxa de sucesso na primeira tentativa e calculado em seu protocolo. O número não deve ser tratado como pontuação parcial nem comparado diretamente ao ranking oficial sem reproduzir as mesmas condições.
Os conjuntos medem horizontes diferentes. O OSWorld-Verified reúne tarefas mais curtas e autocontidas; o OSWorld 2 exige fluxos longos, conectados e com várias aplicações, informações e decisões.
Não. O benchmark mede desempenho em um ambiente controlado. Uma implantação real ainda precisa de permissões mínimas, validação, observabilidade, limites de custo, recuperação de falhas e aprovação humana.
Não automaticamente. A execução local pode reduzir o trânsito de dados, mas segurança também depende de isolamento, permissões, proteção de credenciais, logs, políticas de ferramentas e revisão de efeitos colaterais.
Além do custo médio por tentativa, é preciso considerar a taxa de conclusão, as repetições, a revisão humana e o custo de corrigir erros. Dividir custo por tarefa pela taxa binária gera apenas uma aproximação do custo por conclusão útil.
Conclusão
O OSWorld 2 não mostra que agentes de computador são inúteis. Ele mostra algo mais útil: eles já produzem progresso relevante, mas ainda perdem confiabilidade quando o trabalho se alonga, acumula estado e exige verificação.
Os 20,6% binários e 54,8% parciais do melhor resultado oficial publicado revelam essa lacuna. Os 70,57% de Pass@1 reportados pela Anthropic para o Claude Opus 5 sugerem um avanço importante, mas precisam permanecer vinculados ao protocolo e à fonte que os produziram.
Para empresas, a pergunta certa não é “qual modelo ganhou?”. É: qual combinação de modelo, ferramentas, estado, validação e supervisão consegue entregar este processo com custo e risco aceitáveis?
Fontes e histórico de atualização
Fontes primárias:
- OSWorld 2: site e leaderboard oficial
- OSWorld 2.0: A Benchmark for Long-Horizon Computer-Use Agents: paper
- Repositório oficial do OSWorld 2
- Repositório oficial do OSWorld
- OSWorld-Verified: anúncio do projeto
- Claude Opus 5: anúncio da Anthropic
- Claude Opus 5 System Card
- Holo 3.1: página oficial da H Company
Histórico:
- 04/08/2026: artigo reestruturado com separação entre conclusão binária, pontuação parcial e Pass@1; inclusão do protocolo do Claude Opus 5, custos derivados, segurança, limitações, FAQ e fontes primárias.