Lathoa: AIがわざと間違える子供向け数学アプリ
Lathoaは、およそ10歳から14歳の子ども向けの算数練習アプリです。Errolという名前のロボットが算数の問題を1ステップずつ解いていき、そのうちの1ステップが意図的に間違っています。子どもの役割は、おかしなステップを見つけて、どこがどう間違っているのかを説明することです。ときには何も間違っていないこともあるので、毎回「間違いがあります」と押すだけでは通用しません。ホームページには登録不要で遊べるケースが1つ用意されています。
採点の仕組み
- ユーザーが本当の誤りを見つけた場合、追加XPを得るには説明を入力する必要があります。
- 速さもスコアに影響し、早く答えるほど多くのポイントがもらえます。
- LLMとの直接的なやり取りやチャットはありません。子どもがモデルにプロンプトを送ることはありません。
難しいところ:モデルをわざと間違えさせる
著者は直感に反する発見を指摘しています。LLMにわざと間違えさせるのは難しいのです。およそ半分の確率で、モデルは正しい答えを出してそれを誤りだとラベル付けしたり、実際には正しい「間違い」を生成したりします。そのため、どのケースも子どものもとに届く前に検証パイプラインを通す必要がありました。
評価パイプライン
- 可能な箇所では、単純な算術チェックによって計算を正確にやり直します。
- 2つ目のモデルが、Errolの解答を見ずに同じ問題を解きます。2つのモデルの答えが食い違えば、そのケースは破棄されます。
- Lathoaの検証基盤は安定していると説明されており、矛盾やプロンプトインジェクションを検出するための多くの評価ステップを備えています。
- 既知の弱点:2つ目のモデルが1つ目と同じ間違いをすることもあります。算術チェックはそれを見つけるために存在します。
- その算術チェックは現在、英語のケースでしか機能しません。ドイツ語とギリシャ語では小数点にカンマを使うため、解析がまだ正しく対応していません。
残された教育上の問い
著者が本当に知りたいのは、他人の間違いを見つけることが、自分で問題を解くことでは得られない何かを教えられるのかどうかです。彼自身も確信はなく、先生たちの意見を聞きたいと考えています。この年齢層の指導に携わっている方は、ぜひこのスレッドで意見を寄せてください。
同様のツールを作る人にとって注目に値するのは、ここでの「2モデル+記号チェック」というパターンが、もっともらしいだけではなく検証可能な具体的出力が必要なあらゆるタスクに使える、妥当なテンプレートだという点です。失敗モード、つまり検証モデルが生成モデルと同じ盲点を共有してしまうことは、設計上避けて通れない古典的な限界であり、このプロジェクトはそれを率直に名指ししています。
📖 Read the full source: HN LLM Tools
👀 See Also

Auto Router対Sonnet:コスト削減対応答品質
Open RouterのAuto Router機能は、コンテキストの複雑さに基づいてLLMを動的に選択し、大幅なコスト削減(1リクエストあたり0.8セント対0.00071セント)を実現しますが、ユーザーからはSonnet 4.6と比較して応答品質が低下しているとの報告があります。

VoidLLM:OllamaとvLLMのためのゼロ知識プロキシ、チームアクセス制御付き
VoidLLMは、OllamaやvLLMなどのローカルLLMサーバーとアプリケーションの間に位置するプロキシで、組織・チームのアクセス制御、APIキー管理、使用状況の追跡、レート制限を追加しますが、プロンプトを閲覧することはありません。プロキシのオーバーヘッドは2ミリ秒未満で、OpenAI互換のSDKで動作します。

A2P: AIコーディングエージェントのためのエンジニアリング規律を強化するMCPサーバー
A2P(Architect-to-Product)は、MCPサーバーとしてパッケージ化されたAIエンジニアリングフレームワークで、ゲート付きワークフローを強制します:アーキテクチャ → 計画 → 構築 → 監査 → セキュリティ → デプロイ。各機能スライスは、RED → GREEN → REFACTOR → SAST → DONEの進行を必要とします。

OpenClaw iOSアプリは、最大18ヶ月分の過去のApple Healthデータ同期機能を追加しました。
OpenClaw iOSアプリの最新バージョンでは、Apple Healthの過去データのエクスポートが可能になり、ユーザーは最大18か月分の健康データをエージェントと同期して、パーソナライズされた分析やAIトレーニングに活用できます。