Arrêtez de laisser les agents IA concevoir votre architecture

Trois organisations le mois dernier. Même schéma : quelqu'un ouvre Claude, ChatGPT ou Copilot, demande une architecture, et obtient une proposition confiante et bien articulée qui semble venir d'un ingénieur très senior. Mais elle n'a pas réfléchi au problème — elle fait du pattern-matching sur les données d'entraînement.
Le problème central : l'IA est pathologiquement complaisante
- Demandez à Claude si les microservices conviennent à une équipe de 3 personnes — il expliquera avec enthousiasme pourquoi ils sont excellents.
- Demandez si un pipeline ML personnalisé est préférable à un service managé — il conçoit une solution.
- Les vrais architectes disent « non » et résistent à la complexité. Claude ne le peut pas.
Ce n'est pas un mensonge ou une erreur. C'est l'incapacité à maîtriser la compétence critique : savoir ce qu'il ne faut pas construire, poser cinq fois « pourquoi », et dire au CTO que son idée inspirée d'une conférence est terrible pour l'équipe réelle.
L'architecture en château de cartes
Le résultat conçu par l'IA passe le test du premier coup d'œil : event-driven par-ci, CQRS par-là, service mesh. Mais il est conçu pour la médiane de tout ce que Claude a vu — une meilleure pratique générique pour une entreprise générique. Une architecture réelle nécessite du contexte :
- Choisir Postgres plutôt que DynamoDB parce que votre équipe connaît Postgres et qu'il vaut mieux livrer en deux semaines que d'apprendre un nouveau modèle de données.
- Zapper le service mesh parce que vous avez quatre services, pas quarante.
- Utiliser un monolithe parce que le problème est simple et que les microservices seraient du développement motivé par la carrière.
Un agent IA n'a aucun de ces contextes — et pire, il ne sait pas qu'il ne les a pas.
Le pipeline de tickets Jira
Une fois l'architecture acceptée, les mêmes personnes demandent à l'IA de la décomposer. Elle produit des epics, des stories, des critères d'acceptation — prêts à être déversés dans Jira. Les ingénieurs qui ont passé des années à perfectionner leur métier implémentent désormais la conception de Claude, un ticket à la fois. Les personnes ayant le plus de contexte deviennent des exécutants de tickets ; l'entité ayant le moins de contexte prend les décisions architecturales.
« Mais un senior a relu »
Un lead technique débordé reçoit une proposition cohérente avec une terminologie et des diagrammes appropriés. Quelle résistance peut-il opposer quand la réponse à « Je ne pense pas que ce soit juste » est « Claude a passé vingt minutes là-dessus et tu veux tout jeter ? »
📖 Lire la source complète : HN AI Agents
👀 See Also

Benchmark Apple Silicon : Performance de Qwen3-VL sur les M3, M4 et M5 Max pour la classification Vision LLM
Les résultats de référence montrent que les performances de classification du modèle de langage visionnaire Qwen3-VL sur le silicium Apple sont quasi identiques entre les M3 Max et M4 Studio pour les modèles 8B, tandis que le M5 Max est 75 à 83 % plus rapide. La bande passante mémoire importe davantage pour la génération de tokens que pour le préremplissage dans les tâches de vision.

Claude Code Bug Remplace les Umlauts Allemands par des Substituts ASCII
Depuis décembre 2025, Claude Code et l'application Claude.ai remplacent aléatoirement les trémas allemands (ä, ö, ü, ß) par des substituts ASCII (ae, oe, ue, ss). Le bogue persiste malgré des instructions explicites et reste non corrigé depuis plus de 3 mois sans réponse du support Anthropic.

Chute des prix des abonnements IA : pourquoi votre facture d'entreprise va être multipliée par 10
Des laboratoires d'IA comme OpenAI, Anthropic et Microsoft perdent de l'argent sur chaque abonnement. Les charges de travail agentiques ont brisé le modèle d'abonnement forfaitaire — GitHub Copilot passe à la facturation à l'usage le 1er juin 2026. Les entreprises qui ont bâti sur des prix subventionnés font face à une correction.

Qwen3.5-27B : Comparaison des performances en 8 bits et 16 bits
Un utilisateur de Reddit a testé Qwen3.5-27B avec vLLM en comparant les poids bf16 et le cache KV 16 bits contre la quantification fp8 de Qwen avec un cache KV 8 bits, constatant des résultats pratiquement identiques sur le benchmark Aider en utilisant une RTX 6000 Pro.