Lathoa: una app de matemáticas para niños donde la IA está diseñada para equivocarse
Lathoa es una app de práctica de matemáticas para niños de entre 10 y 14 años. Un robot llamado Errol resuelve un problema paso a paso, y uno de esos pasos es deliberadamente incorrecto. La tarea del niño consiste en detectar el paso erróneo y explicar qué falla en él. A veces no hay ningún error, así que pulsar siempre "hay un error" no funciona. En la página de inicio hay un caso jugable sin necesidad de registrarse.
Cómo funciona la puntuación
- Si el usuario encuentra un error real, debe escribir una explicación para ganar XP extra.
- La velocidad también influye en la puntuación: las respuestas más rápidas dan más puntos.
- No hay interacción directa ni chat con un LLM; el niño nunca le pide nada a un modelo.
Lo difícil: hacer que el modelo falle a propósito
El autor señala el hallazgo contraintuitivo: conseguir que un LLM se equivoque a propósito es difícil. Aproximadamente la mitad de las veces el modelo da la respuesta correcta y la etiqueta como errónea, o produce un "error" que en realidad es correcto. Eso obligó a crear un proceso de verificación antes de que cualquier caso llegue a un niño.
Proceso de evaluación
- Una comprobación aritmética básica rehace las operaciones con exactitud siempre que es posible.
- Un segundo modelo resuelve el mismo problema sin ver el trabajo de Errol. Si los dos modelos no coinciden, el caso se descarta.
- El sistema de Lathoa se describe como estable, con muchos pasos de evaluación para detectar incoherencias e inyecciones de prompt.
- Punto débil conocido: el segundo modelo puede cometer el mismo error que el primero. La comprobación aritmética existe para detectarlo.
- Esa comprobación aritmética actualmente solo funciona con casos en inglés. El alemán y el griego usan coma para los decimales, y el análisis todavía no es correcto.
La pregunta pedagógica abierta
Lo que realmente pregunta el autor es si encontrar el error de otra persona enseña algo que resolver el problema uno mismo no enseña. No está seguro y quiere saber la opinión de docentes. Si trabajas con este grupo de edad, ese es el hilo en el que conviene intervenir.
Merece la pena señalar, para quien construya herramientas similares, que el patrón de dos modelos más comprobación simbólica es una plantilla razonable para cualquier tarea en la que se necesite una salida verificablemente concreta, no solo plausible. El modo de fallo —un modelo verificador que comparte el mismo punto ciego que el generador— es la limitación clásica con la que hay que diseñar, y este proyecto la nombra abiertamente.
📖 Read the full source: HN LLM Tools
👀 Ver también

ClawCut Proxy Publicado en GitHub para Optimizar OpenClaw para Pequeños LLMs
ClawCut es un proxy experimental que manipula, inyecta llamadas JSON y extrae el desorden JSON de OpenClaw para reducir la sobrecarga cognitiva en modelos pequeños (7B-8B) que se ejecutan en hardware limitado.

Explorando las Interacciones de API a API: Una Mirada más Cercana a la Automatización
Una reciente discusión en Reddit profundiza en las complejidades de las llamadas telefónicas de API a API, centrándose en la implementación práctica y los posibles desafíos al usar herramientas como Postman y Twilio.

Adam: Una biblioteca de agente de IA multiplataforma integrable en C
Adam es una biblioteca en C que proporciona un bucle de agente completo con llamada a herramientas, memoria, voz y soporte tanto para LLM en la nube como local, diseñada para integrarse en cualquier aplicación.

Xmloxide: Una Reimplementación en Rust de libxml2 Creada con Asistencia de Agente de IA
Xmloxide es una reimplementación en Rust puro de la biblioteca libxml2 sin mantenimiento, creada usando Claude Code para pasar las suites de pruebas de compatibilidad. Proporciona análisis de XML/HTML seguro en memoria con una API C para reemplazo directo.