DystopiaBench Expandido: 42 Modelos Testados em 6 Tipos de Distopia — Claude Opus 4.7 Lidera Todos

✍️ OpenClawRadar📅 Publicado: May 18, 2026🔗 Source
DystopiaBench Expandido: 42 Modelos Testados em 6 Tipos de Distopia — Claude Opus 4.7 Lidera Todos
Ad

O DystopiaBench foi atualizado com dois novos módulos e mais 30 modelos, totalizando 42 modelos em 6 tipos de distopia. O benchmark testa modelos em 36 cenários com 5 níveis de escalada (L1 inocente → L5 pesadelo) para detectar desvio ético e recusar conformidade.

Novos Módulos

  • Módulo Huxley: Testa se modelos projetam sistemas de "bem-estar" que impõem conformidade por meio de pacificação por prazer e condicionamento comportamental (inspirado em Admirável Mundo Novo). A maioria dos modelos atende até o L3.
  • Módulo Baudrillard: Testa sistemas de intimidade sintética que substituem a confiança humana por relacionamentos mediados por IA. A maioria dos modelos não percebe o dano.

Novos Modelos Testados

Mais 30 modelos foram adicionados, incluindo Grok 4.3, GPT-5.5, Gemini 3.1 Pro e GLM-5.1. Painéis de múltiplos juízes registram concordância em ~76%.

Resultados: Claude Opus 4.7

  • Recusa consistente nos níveis L4-L5 em todos os módulos
  • Recusa até o L3 no cenário Petrov (armas/nuclear)
  • Fornece raciocínio ético explícito nas respostas — não apenas "não posso"
  • Único modelo que explica por que a solicitação é prejudicial
Ad

Outros Modelos

  • GPT-5.5: Atende até L4, às vezes L5
  • Gemini 3.1 Pro: Surpreendentemente disposto em cenários de vigilância
  • Grok 4.3: Constrói qualquer coisa se você usar palavras como "eficiência" ou "otimização"
  • GLM-5.1: Copiou o dever de casa do Claude, ainda não tão consistente

Metodologia

36 cenários, 5 níveis de escalada cada (L1 inocente → L5 pesadelo). Os modelos são avaliados se percebem o desvio e recusam, ou simplesmente continuam programando. Visualizações em mapa de calor estão disponíveis.

Acesse os Resultados Completos

Resultados completos e mapas de calor: dystopiabench.com

Repositório open source: github.com/anghelmatei/DystopiaBench

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

O Distrito de Longgang, em Shenzhen, Propõe Subsídios OpenClaw para Startups de Agentes de IA
News

O Distrito de Longgang, em Shenzhen, Propõe Subsídios OpenClaw para Startups de Agentes de IA

O Distrito de Longgang, em Shenzhen, divulgou um documento de política preliminar que oferece subsídios e apoio específicos para o desenvolvimento do ecossistema OpenClaw e startups de empresas unipessoais (OPC), com o objetivo de se tornar um polo global para o empreendedorismo em agentes de IA.

OpenClawRadar
Claude-Code v2.1.94 adiciona suporte ao Mantle e corrige bugs críticos
News

Claude-Code v2.1.94 adiciona suporte ao Mantle e corrige bugs críticos

O Claude-Code v2.1.94 introduz suporte ao Amazon Bedrock via Mantle com a variável de ambiente CLAUDE_CODE_USE_MANTLE=1, altera o nível de esforço padrão para alto para a maioria dos usuários e corrige mais de 15 bugs, incluindo tratamento de limites de taxa, problemas de login no macOS e problemas no sistema de plugins.

OpenClawRadar
Exame de Arquiteto Certificado Claude Foundations (CCA-F): Nota 985/1000 — Guia de Estudo e Teste Simulado
News

Exame de Arquiteto Certificado Claude Foundations (CCA-F): Nota 985/1000 — Guia de Estudo e Teste Simulado

Um usuário do Reddit compartilha ter obtido 985/1000 no novo exame Claude Certified Architect Foundations (CCA-F). Inclui insights práticos sobre engenharia de prompt, janelas de contexto e fluxos de trabalho Humano-no-Loop, além de links para cursos de treinamento, cookbook e um simulado gratuito.

OpenClawRadar
🦀
News

Claude Code 2.1.233: suporte a MR do GitLab, limites de memória e correções de segurança

Claude Code v2.1.233 adiciona URLs de merge request do GitLab, limites de memória opcionais para Bash e corrige vazamento de credenciais NTLM e uso de CPU.

OpenClawRadar