Testes de Benchmark de Bobagens Avaliam a Resistência de LLMs a Prompts Sem Sentido

O que o Bullshit Benchmark Mede
O Bullshit Benchmark é uma ferramenta para testar se os grandes modelos de linguagem (LLMs) identificam e contestam prompts sem sentido, em vez de respondê-los com confiança. Ele mede o quanto um modelo está disposto a concordar com obviedades sem sentido, abordando preocupações de que os modelos possam induzir alucinações ao tentar ser úteis em vez de apontar prompts problemáticos.
Principais Resultados do Benchmark
De acordo com o material de origem, os modelos Claude apresentam um desempenho significativamente melhor do que os modelos Gemini na detecção de nonsense. Os resultados apoiam a intuição de que os modelos Claude são melhores nessa capacidade específica.
Um exemplo do benchmark mostra o Claude identificando com sucesso uma pergunta sem sentido, enquanto o Gemini falhou. Especificamente, o Gemini 3.1 Pro não conseguiu detectar uma pergunta obviamente sem sentido, mesmo com o esforço de pensamento alto ativado, gerando em vez disso uma resposta sem sentido.
A fonte sugere que a abordagem de pós-treinamento da Anthropic contribui para o melhor desempenho do Claude, observando que os LLMs naturalmente tendem a um pensamento associativo superficial que gera relações espúrias entre conceitos. A Anthropic parece ter abordado essa questão em seu pipeline de pós-treinamento.
Por que Isso Importa para Agentes de IA de Codificação
Para desenvolvedores que usam assistentes de codificação de IA, a capacidade de um modelo de reconhecer prompts sem sentido é crucial. Quando os modelos respondem com confiança a perguntas sem sentido em vez de contestá-las, eles podem enganar os usuários e gerar código ou explicações incorretos. Este benchmark fornece uma maneira concreta de avaliar esse comportamento de segurança específico em diferentes modelos.
Você pode visualizar os resultados completos do benchmark em https://petergpt.github.io/bullshit-benchmark/viewer/index.html.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Piloto: Uma Ferramenta de Automação de Navegador Construída Integralmente com Código Claude
Um não-desenvolvedor usou o Claude Code para criar o Pilot, uma ferramenta de automação do Chrome que permite que a IA controle navegadores por meio da navegação na árvore de acessibilidade. A ferramenta atribui números a elementos clicáveis para que o Claude possa emitir comandos como 'clique 5' em vez de adivinhar posições na tela.

PACT 0.4.0 adiciona inteligência composta para agentes de codificação de IA
O PACT (Programmatic Agent Constraint Toolkit) versão 0.4.0 introduz recursos de inteligência composta que ajudam os agentes de programação de IA a reter conhecimento entre sessões. A atualização inclui síntese de pesquisa, um diretório de conhecimento e sistemas de autoconsciência de capacidades.

Heartbeat-gateway: Substituição orientada a eventos para a sondagem cron no OpenClaw
Heartbeat-gateway é uma ferramenta Python de código aberto que substitui a verificação baseada em cron por eventos acionados por webhook para o OpenClaw, reduzindo os custos de API de aproximadamente US$ 86/mês para cerca de US$ 4,50/mês e melhorando a latência de até 30 minutos para menos de 2 segundos.

Comparação de Quatro Provedores de Hospedagem Gerenciada OpenClaw para 2026
Um desenvolvedor testou quatro provedores de hospedagem gerenciada do OpenClaw ao longo de dois meses, classificando-os com base no tempo de configuração, tempo de atividade, confiabilidade de integração, roteamento de modelos, custo e capacidade de lidar com tarefas de múltiplas etapas. O LobsterTank custa US$ 2/mês com hospedagem básica de contêineres, o KiwiClaw é US$ 39/mês com melhor suporte, o xCloud é US$ 24/mês com tempo de atividade sólido e o RunLobster é US$ 49/mês com integração extensiva de ferramentas e preço fixo.