Lathoa: Um aplicativo de matemática para crianças onde a IA deve errar

✍️ OpenClawRadar📅 Publicado: October 1, 2026🔗 Source
Ad

Lathoa é um app de prática de matemática para crianças de aproximadamente 10 a 14 anos. Um robô chamado Errol resolve um problema de matemática passo a passo, e um desses passos está deliberadamente errado. A tarefa da criança é identificar o passo ruim e explicar o que há de errado com ele. Às vezes não há nada errado — então simplesmente apertar "tem um erro" toda vez não funciona. Há um caso jogável na página inicial, sem necessidade de cadastro.

Como funciona a pontuação

  • Se o usuário encontra um erro real, ela precisa inserir uma explicação para ganhar XP extra.
  • A velocidade também conta na pontuação — respostas mais rápidas rendem mais pontos.
  • Não há interação direta nem conversa com um LLM; a criança nunca faz um prompt para um modelo.

A parte difícil: fazer o modelo errar de propósito

O autor destaca a descoberta contraintuitiva: fazer um LLM errar de propósito é difícil. Cerca de metade das vezes o modelo dá a resposta correta e a rotula como errada, ou produz um "erro" que na verdade está correto. Isso forçou a criação de um pipeline de verificação antes que qualquer caso chegue a uma criança.

Ad

Pipeline de avaliação

  • Uma checagem aritmética simples refaz a conta exatamente onde possível.
  • Um segundo modelo resolve o mesmo problema sem ver o trabalho do Errol. Se os dois modelos discordam, o caso é descartado.
  • O harness do Lathoa é descrito como estável, com muitas etapas de avaliação para detectar inconsistências e injeções de prompt.
  • Ponto fraco conhecido: o segundo modelo pode cometer o mesmo erro que o primeiro. A checagem aritmética existe para pegar isso.
  • Essa checagem aritmética atualmente só funciona em casos em inglês. Alemão e grego usam vírgula para decimais, e o parsing ainda não está certo.

A questão pedagógica em aberto

O que o autor realmente quer saber é se encontrar o erro de outra pessoa ensina algo que resolver o problema por conta própria não ensina. Ele não tem certeza e quer ouvir professores. Se você trabalha com essa faixa etária, é nessa thread que vale opinar.

Vale notar para quem está construindo ferramentas semelhantes: o padrão de dois modelos + checagem simbólica aqui é um modelo razoável para qualquer tarefa em que você precisa de uma saída verificavelmente específica, não apenas plausível. O modo de falha — um modelo verificador compartilhando o mesmo ponto cego do gerador — é a limitação clássica em torno da qual você precisa projetar, e este projeto a nomeia abertamente.

📖 Leia a fonte completa: HN LLM Tools

Ad

👀 See Also

nervx: Ferramenta CLI reduz o uso de tokens do Claude Code analisando a estrutura do código-fonte
Tools

nervx: Ferramenta CLI reduz o uso de tokens do Claude Code analisando a estrutura do código-fonte

nervx é uma ferramenta CLI instalável via pip que analisa repositórios com tree-sitter, constrói um grafo SQLite de funções e imports, e gera um mapa estrutural NERVX.md. Ela adiciona automaticamente instruções ao CLAUDE.md que ensinam Claude a usar a navegação nervx, reduzindo buscas grep em 65% e tokens de saída em 48% nos testes.

OpenClawRadar
TeamHero v2.6.1: Plataforma de Código Aberto para Gerenciar Agentes de IA Claude
Tools

TeamHero v2.6.1: Plataforma de Código Aberto para Gerenciar Agentes de IA Claude

TeamHero v2.6.1 é uma plataforma local-first e de código aberto que cria uma equipe gerenciada de agentes Claude com recursos como modo piloto automático, aninhamento de subtarefas, visualizações de fluxo e memória persistente. A ferramenta roda em Node.js com um painel HTML/CSS/JS vanilla e não requer banco de dados.

OpenClawRadar
A habilidade de atoship do OpenClaw transforma o assistente de IA em um gerente de envios.
Tools

A habilidade de atoship do OpenClaw transforma o assistente de IA em um gerente de envios.

A habilidade atoship para o OpenClaw permite que os usuários descrevam suas necessidades de envio em inglês simples, depois cuida da seleção da transportadora, comparação de tarifas, compra de etiquetas e rastreamento. Exemplos de comandos incluem 'envie esta caixa de 1lb para Nova York, opção mais barata'.

OpenClawRadar
Desenvolvedor constrói servidor MCP conectando 18 ferramentas de e-commerce ao Claude
Tools

Desenvolvedor constrói servidor MCP conectando 18 ferramentas de e-commerce ao Claude

Um desenvolvedor criou um servidor MCP que integra 18 plataformas e ferramentas de e-commerce com o Claude, permitindo consultas que cruzam dados de múltiplas fontes. O projeto foi construído principalmente usando Claude Code (Opus) em dias, em vez de meses.

OpenClawRadar