AutoBe : Comment des LLM locaux faibles ont corrigé l'architecture d'un générateur de backend IA

Ce qui s'est passé
AutoBe est un agent IA open-source qui génère des applications backend complètes en utilisant TypeScript, NestJS et Prisma. Initialement, il a atteint un succès de compilation de 100 %, mais le code était non maintenable - il n'y avait pas de réutilisation de code, donc chaque petit changement nécessitait de tout régénérer. L'équipe a reconstruit le système autour d'une génération de code modulaire, ce qui a immédiatement fait chuter le taux de succès à 40 %.
La percée du débogage
Lorsque la nouvelle architecture a introduit des dépendances entre modules, l'équipe a utilisé intentionnellement des LLM locaux faibles pour trouver des bogues dont ils ignoraient l'existence. Le modèle qwen3-30b-a3b-thinking avait un taux de succès d'environ 10 % et a exposé des ambiguïtés de schéma AST et des structures mal formées. Le modèle qwen3-next-80b-a3b-instruct avait un taux de succès d'environ 20 % et a révélé des incohérences de types et des cas limites dans les relations imbriquées.
Ce faible taux de succès était précieux : chaque correction renforçait l'ensemble du système. Lorsqu'un schéma est suffisamment précis pour qu'un modèle 30B ne puisse pas le mal interpréter, les modèles plus puissants ne se tromperont pas non plus. Cette approche met également en lumière l'avantage économique des LLM locaux - découvrir des cas limites nécessite des centaines de cycles génération-compilation-diagnostic, ce qui serait prohibitivement coûteux aux prix des API cloud.
Changement architectural
L'équipe est passée de l'ingénierie de prompts à la conception de schémas avec retour de validation. Ils ont réduit les prompts système à presque rien et ont déplacé toutes les contraintes dans les schémas d'appel de fonction, laissant le retour de validation faire l'enseignement. AutoBe utilise trois types AST particulièrement difficiles à générer pour les LLM : AutoBeDatabase (modèles Prisma, relations, index), AutoBeOpenApi (schémas OpenAPI, endpoints, DTO) et AutoBeTest (30+ types d'expressions).
Ces structures sont difficiles car elles impliquent des types union illimités, une profondeur illimitée et des références récursives. Par exemple, l'AST du compilateur inclut des types comme IArrayLiteralExpression et IObjectLiteralExpression qui contiennent des références récursives à IExpression[].
Résultats
Grâce au seul retour de validation, l'équipe est passée de 6,75 % de succès brut d'appel de fonction à 100 %. Ils sont maintenant de retour à 100 % de succès avec GLM v5, et d'autres modèles locaux progressent en performance.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Conception du Harnais Multi-Agent d'Anthropic pour Améliorer la Qualité du Code de Claude
L'article de blog d'Anthropic détaille une conception de harnais utilisant plusieurs agents pour résoudre l'anxiété contextuelle et le biais d'auto-évaluation de Claude, avec des rôles d'agents spécifiques et des critères de notation pour le développement frontend et full-stack.

ClawClone : Outil de Sauvegarde Cloud pour les Espaces de Travail OpenClaw
ClawClone est un outil qui sauvegarde les espaces de travail OpenClaw dans le cloud avec une seule commande et les restaure avec une autre. Il a été créé après qu'un développeur ait perdu un mois de données d'entraînement.

Exécuter Google Gemma 4 26B-A4B en local avec LM Studio 0.4.0 en mode CLI sans interface
LM Studio 0.4.0 introduit llmster et le CLI lms pour l'inférence locale sans interface graphique. L'article détaille la configuration du modèle Gemma 4 26B-A4B MoE de Google sur un MacBook Pro M4 Pro, atteignant 51 tokens/seconde avec 48 Go de mémoire unifiée.

WAYD : Une pause sociale de 60 secondes dans Claude Code, Cursor, et Copilot CLI
WAYD est un plugin pour Claude Code, Cursor et Copilot CLI qui permet de poster une ligne d'humeur sur votre journée de code sous des mood-tags et de défiler un fil de réactions d'autres développeurs — le tout depuis votre terminal, propulsé par GitHub Issues.