EsoLang-Bench: Um Benchmark de Codificação Usando Linguagens Esotéricas para Testar o Raciocínio de LLM

O EsoLang-Bench é um novo benchmark de programação projetado para testar se os grandes modelos de linguagem podem realmente raciocinar sobre problemas ou estão apenas fazendo correspondência de padrões com os dados de treinamento. O benchmark usa linguagens de programação esotéricas com presença mínima de dados de treinamento.
Design do Benchmark
O benchmark usa cinco linguagens de programação esotéricas: Brainfuck, Befunge-98, Whitespace, Unlambda e Shakespeare. Essas linguagens foram escolhidas porque têm quase zero dados de treinamento nos pipelines típicos de pré-treinamento. O benchmark contém os mesmos problemas algorítmicos do HumanEval na mesma faixa de dificuldade, apenas traduzidos para essas linguagens esotéricas.
Metodologia de Teste
Os pesquisadores testaram cinco modelos: GPT-5.2, O4-mini, Gemini 3 Pro, Qwen3-235B e Kimi K2. Eles usaram cinco estratégias de prompt, incluindo:
- Auto-scaffolding (autoandaime)
- Pares codificador-crítico
- Pipeline ReAct
Resultados
O melhor resultado único foi de 11,2% no Befunge-98 com auto-scaffolding. Os problemas de dificuldade Média, Difícil e Extra-Difícil permaneceram em 0% em todos os modelos, linguagens e estratégias. O prompting few-shot deu apenas +0,8 pontos percentuais em média, o que os pesquisadores descrevem como estatisticamente indistinguível de ruído.
Sistemas agentes como Claude Code e Codex tiveram desempenho 2-3 vezes melhor do que abordagens não agentes, mas essa melhoria veio principalmente de loops de feedback mais precisos e gerenciamento de contexto, em vez de evidência de transferência real de raciocínio.
Análise de Erros
A análise de erros revela padrões interessantes:
- No Brainfuck (que tem alguma presença online), os modelos conseguiram produzir sintaxe válida, mas falharam na lógica
- No Whitespace (que tem quase nenhum dado de treinamento), os modelos não conseguiram nem produzir programas válidos
Isso mostra uma clara lacuna entre o desempenho dos modelos em linguagens com algum dado de pré-treinamento versus aquelas com basicamente nenhum.
Propósito e Disponibilidade
O benchmark visa criar avaliações onde pontuações altas são realmente difíceis de falsificar, indo além de apenas problemas mais difíceis em linguagens convencionais como Python. Os pesquisadores sugerem que essa abordagem cria avaliações onde o incentivo econômico para manipular o benchmark não existe, e a única rota para um bom desempenho é o aprendizado genuíno para generalizar.
O EsoLang-Bench está disponível como um modelo para outros construírem, seja através de novas linguagens, novos tipos de problemas ou domínios completamente diferentes fora da distribuição.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Cloken: Uma Extensão do Chrome que Mostra o Uso de Contexto em Tempo Real do Claude como Porcentagem
Cloken é uma extensão gratuita do Chrome que exibe o uso do contexto do seu chat atual no Claude.ai como uma porcentagem — incluindo mensagens, arquivos, imagens e o prompt do sistema.

Voxray-AI: Backend de Produção em Go para Pipelines de Agentes de Voz em Tempo Real
Voxray-AI é um backend em Go que encadeia Whisper → qualquer LLM → TTS em um pipeline de agente de voz em tempo real com suporte a WebSocket e WebRTC. É construído para servidores de nível de produção e cargas de trabalho de voz de alta concorrência com provedores configuráveis para as camadas de STT, LLM e TTS.

TextForge: Uma ferramenta de aprovação de e-mail construída com Claude Code para fluxos de trabalho de LLM
Um desenvolvedor criou o TextForge usando Claude Code para automatizar fluxos de trabalho de e-mail com portas de aprovação obrigatórias, impedindo que LLMs enviem e-mails sem permissão explícita. A ferramenta integra-se ao CRM Pipedrive e exigiu conformidade com a auditoria de segurança Google CASA2.

Atlarix v5.1 adiciona camadas de nuvem mantendo o suporte local à codificação com IA
A Atlarix v5.1.0 introduz os níveis de nuvem Compass para uso imediato, mantendo o suporte completo ao Ollama e LM Studio. O IDE utiliza um gráfico SQLite persistente chamado Blueprint para fornecer contexto preciso aos modelos locais.