Agente de IA Coasty Resolve Desafios CAPTCHA Até o Nível 6 Sem Treinamento

Agente de Uso de Computador da Coasty Lida com Desafios Reais de Desktop
O Agente de Uso de Computador (CUA) da Coasty demonstrou a capacidade de resolver desafios CAPTCHA até o Nível 6 sem ser especificamente treinado para testes "Não sou um robô". O agente alcançou 82% no benchmark OSWorld, o que representa um desempenho de ponta para agentes de uso de computador operando em ambientes reais de desktop.
O agente lida com vários desafios de interface da web que normalmente interrompem outros agentes, incluindo:
- Desafios CAPTCHA até o Nível 6
- Pop-ups do navegador
- Banners de cookies
De acordo com a fonte, os desenvolvedores não ensinaram o CUA a resolver desafios "Não sou um robô" especificamente, observando que "a ironia não nos escapa". O desempenho do agente sugere que ele desenvolveu capacidades generalizadas de interação com computadores, em vez de soluções especializadas para tipos individuais de desafios.
Um link de replay está disponível para quem estiver interessado em ver o agente em ação: https://coasty.ai/share/1cd404ae-3fcb-4d7f-b9d4-dac7aa26fc6d
📖 Leia a fonte completa: HN AI Agents
👀 See Also
Claude Code v2.1.285 adiciona transferência para desktop, CLI de configuração de plugins e restrições de provedores
O Claude Code v2.1.285 traz CLAUDE_CODE_DISABLE_WEB_FETCH, o comando claude --desktop para transferir uma sessão para o aplicativo desktop, claude plugin configure para ler e gravar opções de plugins, uma configuração gerenciada allowedProviders e uma longa lista de correções em subagentes e no MCP.

Anthropic remove o acesso ao corpo da mensagem do Gmail do Conector Claude
Anthropic removeu as ferramentas gmail_read_message e gmail_search_messages do conector do Gmail, substituindo-as por get_thread e search_threads, que não retornam mais o corpo das mensagens ou o conteúdo dos anexos.

O que está faltando na história "agentic": um papel de agente do usuário bem definido
Mark Nottingham argumenta que os agentes de IA atuais carecem de um papel claro de agente do usuário, criando uma lacuna de confiança entre o que os usuários esperam e o que os agentes realmente fazem.

Definindo Agentes de IA: O Teste de Fluxo de Trabalho
Uma discussão no Reddit questiona se muitos produtos de agentes de IA são essencialmente chatbots com uma lista de tarefas, propondo um teste baseado na capacidade de completar fluxos de trabalho em várias ferramentas sem intervenção manual.