Mise à l'échelle du codage agentique à plus de 150 PR/semaine : leçons tirées de 85 000 $ de jetons chez Lovable

Alexander Lebedev a rejoint Lovable en janvier 2026, peu après l'essor des agents de codage IA. En juin, il est passé d'un développeur solo avec quelques agents effectuant 20 à 30 PR fusionnées par semaine à un humain supervisant 6 à 7 agents (chacun avec son propre essaim de sous-agents) poussant plus de 150 PR fusionnées par semaine. Le coût : environ 25 000 $/mois en mai, soit un total d'environ 85 000 $ en tokens depuis janvier. Voici comment il a fait — et ce qui a cassé en chemin.
De 30 à 150+ PR/semaine : L'Architecture
En janvier, le processus était traditionnel : mode planification, demandes d'autorisation, revue de code humaine classique. En juin, Lebedev avait construit un agent dédié qui écrit des tâches pour d'autres agents, avec plusieurs niveaux d'agents d'implémentation et de revue. Les gros changements sont désormais livrés sous forme d'un stack de 10 PR au lieu d'une seule PR. La revue humaine ne touche que les décisions importantes, rarement le code lui-même.
Où vont les tokens : 75% d'implémentation, 25% d'automatisation
La majeure partie des 85 000 $ dépensés — environ 75% — va directement à l'implémentation (création de code). Les 25% restants (et en croissance) financent l'automatisation : revues IA en dehors de l'environnement de développement, revues IA post-fusion, et tâches automatisées de routine. Lebedev prédit que la part de l'automatisation continuera d'augmenter à mesure que davantage de travail sort de la boucle de PR de création de code.
Revue humaine : Exception, pas règle
Lebedev soutient que la revue ligne par ligne du code écrit par l'IA est aussi impraticable que la revue du code compilé après le passage de l'assembleur aux langages de haut niveau. Au lieu de cela, la revue humaine est réservée aux changements les plus impactants — généralement pas sur les PR du tout, mais au niveau RFC/ADR : discussions de conception système, séances de tableau blanc, choix d'infrastructure. Une seule décision de conception peut avoir plus d'impact que 50 PR d'implémentation.
L'inconvénient : la revue de code était un outil d'apprentissage et un mécanisme de diffusion des connaissances. L'ingénierie a maintenant besoin de nouvelles façons de préserver ces effets secondaires. Lebedev admet : "Je ne vois pas encore de bonnes solutions, seulement de l'espace pour de nouvelles expériences."
Classification des risques de changement : Le filet de sécurité
Contourner la revue humaine ne fonctionne pas naïvement à grande échelle — surtout pour les nouveaux arrivants qui ne savent pas ce qu'ils ignorent. Lebedev a construit un workflow IA qui classifie chaque PR par niveau de risque et impose strictement une revue humaine sur les PR à haut risque. Le classifieur utilise :
- Un seul fichier de politique markdown lu par l'agent, qui inspecte le diff de la PR et les métadonnées.
- Dimensions de classification : taille, niveau de risque, propriété du code (l'équipe de l'auteur possède-t-elle la majorité du code modifié ?).
- Catégories à haut risque : infrastructure, authentification, gros diffs, fonctionnalités de production.
- Exemple à faible risque : publier un article de blog.
La sortie de la classification alimente un outil déterministe qui applique la politique via les actions GitHub et les règles de branche pour autoriser ou refuser la fusion.
Point clé
Passer à l'échelle du codage agentique nécessite non seulement plus d'agents, mais des changements structurels : agents générateurs de tâches, empilage de PR, classification automatisée des risques, et un transfert conscient de l'attention humaine de la revue ligne par ligne aux décisions architecturales. La facture de 85 000 $ en tokens est un investissement pour prouver que le modèle fonctionne — mais les problèmes difficiles (partage des connaissances, intégration) restent non résolus.
📖 Lire la source complète : HN AI Agents
👀 See Also

Exploiter les Compétences des Agents pour Écrire des Noyaux CUDA avec Upskill
Hugging Face présente une approche pratique pour améliorer les modèles dans l'écriture de noyaux CUDA grâce au nouvel outil Upskill, optimisant l'efficacité des modèles via les compétences d'agent.

Quatre méthodes pour transférer l'historique de ChatGPT vers la mémoire de Claude
Claude propose désormais l'importation de mémoire pour les données ChatGPT, mais il existe quatre approches avec des compromis différents : l'importation intégrée pour la vitesse, l'abstraction organisée pour le contrôle, l'exportation complète pour la préservation, ou une méthode hybride combinant les trois.

Claude Code Skills vs. Custom Agents : Un modèle mental basé sur la cohérence des tâches
Un utilisateur de Reddit clarifie la distinction entre les compétences de Claude Code et les agents personnalisés : les compétences exécutent les mêmes étapes à chaque fois, tandis que les agents personnalisés nécessitent un raisonnement et une adaptation. Le post couvre également les sous-agents parallèles, la délégation, les crochets et les blocs de construction.

Qwen3.5-397B MoE fonctionne avec 14 Go de RAM via un chargement d'expert paginé sur M1 Ultra
Le moteur Paged MoE ne conserve que 20 experts en mémoire et charge paresseusement le reste depuis le SSD, faisant tourner un modèle de 397B (209 Go) sur un Mac Studio de 64 Go avec 1,59 tok/s et 14 Go de RAM de pointe. Comprend des benchmarks de modèles plus petits.