EsoLang-Bench: Un punto de referencia de codificación que utiliza lenguajes esotéricos para evaluar el razonamiento de los LLM.

EsoLang-Bench es un nuevo punto de referencia de programación diseñado para probar si los modelos de lenguaje grandes pueden razonar genuinamente a través de problemas o simplemente están coincidiendo patrones con los datos de entrenamiento. El punto de referencia utiliza lenguajes de programación esotéricos con presencia mínima en los datos de entrenamiento.
Diseño del Punto de Referencia
El punto de referencia utiliza cinco lenguajes de programación esotéricos: Brainfuck, Befunge-98, Whitespace, Unlambda y Shakespeare. Estos lenguajes fueron elegidos porque tienen casi cero datos de entrenamiento en las canalizaciones típicas de preentrenamiento. El punto de referencia contiene los mismos problemas algorítmicos que HumanEval en el mismo rango de dificultad, solo traducidos a estos lenguajes esotéricos.
Metodología de Prueba
Los investigadores probaron cinco modelos: GPT-5.2, O4-mini, Gemini 3 Pro, Qwen3-235B y Kimi K2. Utilizaron cinco estrategias de indicación, incluyendo:
- Auto-andamiaje
- Pares codificador-crítico
- Canalización ReAct
Resultados
El mejor resultado individual fue del 11.2% en Befunge-98 con auto-andamiaje. Los problemas de dificultad Media, Difícil y Extra-Difícil se mantuvieron en 0% en todos los modelos, lenguajes y estrategias. La indicación de pocos ejemplos dio solo +0.8 puntos porcentuales en promedio, lo que los investigadores describen como estadísticamente indistinguible del ruido.
Sistemas agentes como Claude Code y Codex tuvieron un rendimiento 2-3 veces mejor que los enfoques no agentes, pero esta mejora provino principalmente de bucles de retroalimentación más agudos y gestión de contexto, en lugar de evidencia de transferencia real de razonamiento.
Análisis de Errores
El desglose de errores revela patrones interesantes:
- En Brainfuck (que tiene cierta presencia en línea), los modelos podían producir sintaxis válida pero fallaban en la lógica
- En Whitespace (que tiene casi ningún dato de entrenamiento), los modelos ni siquiera podían producir programas válidos
Esto muestra una brecha clara entre el rendimiento de los modelos en lenguajes con algo de datos de preentrenamiento versus aquellos con básicamente ninguno.
Propósito y Disponibilidad
El punto de referencia tiene como objetivo crear evaluaciones donde las puntuaciones altas sean realmente difíciles de falsificar, yendo más allá de solo problemas más difíciles en lenguajes convencionales como Python. Los investigadores sugieren que este enfoque crea evaluaciones donde el incentivo económico para manipular el punto de referencia no existe, y la única ruta hacia un buen rendimiento es el aprendizaje genuino para generalizar.
EsoLang-Bench está disponible como una plantilla para que otros construyan sobre ella, ya sea a través de nuevos lenguajes, nuevos tipos de problemas o dominios completamente diferentes fuera de distribución.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Habilidad de Claude Code Convierte Diseños de Stitch a Next.js con Cero Desviación de Píxeles
Una habilidad de Claude Code convierte diseños de Google Stitch AI en componentes Next.js con puntos de verificación obligatorios para prevenir la desviación de píxeles, preservando valores exactos y manejando recursos.

Prism MCP v5.1 añade compresión de memoria 10x y aprendizaje del agente a partir de correcciones.
Prism MCP v5.1 presenta una compresión de memoria 10 veces mayor mediante TurboQuant portado a TypeScript, permitiendo millones de recuerdos en una computadora portátil sin bases de datos vectoriales. La actualización añade aprendizaje del agente a partir de correcciones del usuario y una interfaz visual de grafo de conocimiento.

git-courer: Un servidor MCP que obliga a los agentes de IA a escribir mensajes de commit de Git adecuados
git-courer es un servidor MCP local en Go que intercepta los diffs de los agentes de codificación de IA y los traduce en mensajes de commit estructurados y legibles para humanos con secciones POR QUÉ y QUÉ.

HostMyClaudeHTML: Compartir con un clic para artefactos HTML de Claude
Un desarrollador creó hostmyclaudehtml.com, una herramienta gratuita que te permite compartir artefactos HTML generados por Claude como URLs en vivo arrastrando y soltando el archivo .html. No se requiere cuenta para quienes suben o ven el contenido.