EsoLang-Bench: Un punto de referencia de codificación que utiliza lenguajes esotéricos para evaluar el razonamiento de los LLM.

✍️ OpenClawRadar📅 Publicado: 16 de marzo de 2026🔗 Source
EsoLang-Bench: Un punto de referencia de codificación que utiliza lenguajes esotéricos para evaluar el razonamiento de los LLM.
Ad

EsoLang-Bench es un nuevo punto de referencia de programación diseñado para probar si los modelos de lenguaje grandes pueden razonar genuinamente a través de problemas o simplemente están coincidiendo patrones con los datos de entrenamiento. El punto de referencia utiliza lenguajes de programación esotéricos con presencia mínima en los datos de entrenamiento.

Diseño del Punto de Referencia

El punto de referencia utiliza cinco lenguajes de programación esotéricos: Brainfuck, Befunge-98, Whitespace, Unlambda y Shakespeare. Estos lenguajes fueron elegidos porque tienen casi cero datos de entrenamiento en las canalizaciones típicas de preentrenamiento. El punto de referencia contiene los mismos problemas algorítmicos que HumanEval en el mismo rango de dificultad, solo traducidos a estos lenguajes esotéricos.

Metodología de Prueba

Los investigadores probaron cinco modelos: GPT-5.2, O4-mini, Gemini 3 Pro, Qwen3-235B y Kimi K2. Utilizaron cinco estrategias de indicación, incluyendo:

  • Auto-andamiaje
  • Pares codificador-crítico
  • Canalización ReAct

Resultados

El mejor resultado individual fue del 11.2% en Befunge-98 con auto-andamiaje. Los problemas de dificultad Media, Difícil y Extra-Difícil se mantuvieron en 0% en todos los modelos, lenguajes y estrategias. La indicación de pocos ejemplos dio solo +0.8 puntos porcentuales en promedio, lo que los investigadores describen como estadísticamente indistinguible del ruido.

Sistemas agentes como Claude Code y Codex tuvieron un rendimiento 2-3 veces mejor que los enfoques no agentes, pero esta mejora provino principalmente de bucles de retroalimentación más agudos y gestión de contexto, en lugar de evidencia de transferencia real de razonamiento.

Ad

Análisis de Errores

El desglose de errores revela patrones interesantes:

  • En Brainfuck (que tiene cierta presencia en línea), los modelos podían producir sintaxis válida pero fallaban en la lógica
  • En Whitespace (que tiene casi ningún dato de entrenamiento), los modelos ni siquiera podían producir programas válidos

Esto muestra una brecha clara entre el rendimiento de los modelos en lenguajes con algo de datos de preentrenamiento versus aquellos con básicamente ninguno.

Propósito y Disponibilidad

El punto de referencia tiene como objetivo crear evaluaciones donde las puntuaciones altas sean realmente difíciles de falsificar, yendo más allá de solo problemas más difíciles en lenguajes convencionales como Python. Los investigadores sugieren que este enfoque crea evaluaciones donde el incentivo económico para manipular el punto de referencia no existe, y la única ruta hacia un buen rendimiento es el aprendizaje genuino para generalizar.

EsoLang-Bench está disponible como una plantilla para que otros construyan sobre ella, ya sea a través de nuevos lenguajes, nuevos tipos de problemas o dominios completamente diferentes fuera de distribución.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Habilidad de Claude Code Convierte Diseños de Stitch a Next.js con Cero Desviación de Píxeles
Herramientas

Habilidad de Claude Code Convierte Diseños de Stitch a Next.js con Cero Desviación de Píxeles

Una habilidad de Claude Code convierte diseños de Google Stitch AI en componentes Next.js con puntos de verificación obligatorios para prevenir la desviación de píxeles, preservando valores exactos y manejando recursos.

OpenClawRadar
Prism MCP v5.1 añade compresión de memoria 10x y aprendizaje del agente a partir de correcciones.
Herramientas

Prism MCP v5.1 añade compresión de memoria 10x y aprendizaje del agente a partir de correcciones.

Prism MCP v5.1 presenta una compresión de memoria 10 veces mayor mediante TurboQuant portado a TypeScript, permitiendo millones de recuerdos en una computadora portátil sin bases de datos vectoriales. La actualización añade aprendizaje del agente a partir de correcciones del usuario y una interfaz visual de grafo de conocimiento.

OpenClawRadar
git-courer: Un servidor MCP que obliga a los agentes de IA a escribir mensajes de commit de Git adecuados
Herramientas

git-courer: Un servidor MCP que obliga a los agentes de IA a escribir mensajes de commit de Git adecuados

git-courer es un servidor MCP local en Go que intercepta los diffs de los agentes de codificación de IA y los traduce en mensajes de commit estructurados y legibles para humanos con secciones POR QUÉ y QUÉ.

OpenClawRadar
HostMyClaudeHTML: Compartir con un clic para artefactos HTML de Claude
Herramientas

HostMyClaudeHTML: Compartir con un clic para artefactos HTML de Claude

Un desarrollador creó hostmyclaudehtml.com, una herramienta gratuita que te permite compartir artefactos HTML generados por Claude como URLs en vivo arrastrando y soltando el archivo .html. No se requiere cuenta para quienes suben o ven el contenido.

OpenClawRadar