EsoLang-Bench: Um Benchmark de Codificação Usando Linguagens Esotéricas para Testar o Raciocínio de LLM

O EsoLang-Bench é um novo benchmark de programação projetado para testar se os grandes modelos de linguagem podem realmente raciocinar sobre problemas ou estão apenas fazendo correspondência de padrões com os dados de treinamento. O benchmark usa linguagens de programação esotéricas com presença mínima de dados de treinamento.
Design do Benchmark
O benchmark usa cinco linguagens de programação esotéricas: Brainfuck, Befunge-98, Whitespace, Unlambda e Shakespeare. Essas linguagens foram escolhidas porque têm quase zero dados de treinamento nos pipelines típicos de pré-treinamento. O benchmark contém os mesmos problemas algorítmicos do HumanEval na mesma faixa de dificuldade, apenas traduzidos para essas linguagens esotéricas.
Metodologia de Teste
Os pesquisadores testaram cinco modelos: GPT-5.2, O4-mini, Gemini 3 Pro, Qwen3-235B e Kimi K2. Eles usaram cinco estratégias de prompt, incluindo:
- Auto-scaffolding (autoandaime)
- Pares codificador-crítico
- Pipeline ReAct
Resultados
O melhor resultado único foi de 11,2% no Befunge-98 com auto-scaffolding. Os problemas de dificuldade Média, Difícil e Extra-Difícil permaneceram em 0% em todos os modelos, linguagens e estratégias. O prompting few-shot deu apenas +0,8 pontos percentuais em média, o que os pesquisadores descrevem como estatisticamente indistinguível de ruído.
Sistemas agentes como Claude Code e Codex tiveram desempenho 2-3 vezes melhor do que abordagens não agentes, mas essa melhoria veio principalmente de loops de feedback mais precisos e gerenciamento de contexto, em vez de evidência de transferência real de raciocínio.
Análise de Erros
A análise de erros revela padrões interessantes:
- No Brainfuck (que tem alguma presença online), os modelos conseguiram produzir sintaxe válida, mas falharam na lógica
- No Whitespace (que tem quase nenhum dado de treinamento), os modelos não conseguiram nem produzir programas válidos
Isso mostra uma clara lacuna entre o desempenho dos modelos em linguagens com algum dado de pré-treinamento versus aquelas com basicamente nenhum.
Propósito e Disponibilidade
O benchmark visa criar avaliações onde pontuações altas são realmente difíceis de falsificar, indo além de apenas problemas mais difíceis em linguagens convencionais como Python. Os pesquisadores sugerem que essa abordagem cria avaliações onde o incentivo econômico para manipular o benchmark não existe, e a única rota para um bom desempenho é o aprendizado genuíno para generalizar.
O EsoLang-Bench está disponível como um modelo para outros construírem, seja através de novas linguagens, novos tipos de problemas ou domínios completamente diferentes fora da distribuição.
📖 Read the full source: r/LocalLLaMA
👀 See Also

obsidian-mcp: Servidor MCP com Consciência de Grafo para Claude com 25 Ferramentas para Grandes Cofres
obsidian-mcp é um servidor MCP que expõe 25 ferramentas (incluindo get_note, traverse_graph, query_dataview, move_note, create_notes) que dá ao Claude acesso ciente do grafo ao seu cofre Obsidian — evitando a morte da janela de contexto em cofres com 5 mil notas. MIT, funciona com Claude Desktop, Claude Code, Cursor, Cline, Continue, Zed.

Plugin de Memória Compartilhada OpenClaw: Coordenação Multi-Agente Baseada em SQLite
Um desenvolvedor criou um plugin para configurações de múltiplos agentes OpenClaw que permite que os agentes compartilhem memória usando SQLite, eliminando a necessidade de serviços externos. O plugin permite compartilhamento explícito de memória por meio de uma ferramenta, extração automática de contexto, controle de acesso, rastreamento de entidades e detecção de contradições.

Alternativa do OpenClaw Browser Relay Chrome Extension para Configurações Manuais
Um usuário do Reddit relata sucesso com uma extensão do Chrome para o relé de navegador OpenClaw após tentativas de configuração manual causarem travamentos do sistema e dores de cabeça na depuração.

Desenvolvimento Guiado por Manual: Um Método para Prevenir a Divergência Confiante do Código Claude
O Desenvolvimento Orientado por Manual (MDD) é um método que aborda a divergência confiante no Claude Code, onde a IA produz código errado que passa em seus próprios testes. Em uma auditoria de produção, o MDD encontrou 190 problemas, escreveu 876 novos testes em menos de 8 horas e eliminou violações de regras.