Évaluation des LLM locaux : génération backend par appel de fonctions – comparaison entre GLM, Qwen et DeepSeek

✍️ OpenClawRadar📅 Publié: May 3, 2026🔗 Source
Évaluation des LLM locaux : génération backend par appel de fonctions – comparaison entre GLM, Qwen et DeepSeek
Ad

Cinq mois après une première mesure non contrôlée, AutoBe.dev a publié un benchmark propre des LLM locaux et frontaliers pour la génération de code backend via l'appel de fonctions. Le benchmark utilise une configuration à variable contrôlée avec une grille d'évaluation réelle, testant les modèles sur la génération de schémas AST à union récursive via un harnais d'appel de fonctions.

Principaux résultats

  • Le harnais d'appel de fonctions a effectivement comblé l'écart entre les modèles frontaliers et locaux en génération backend. Plus précisément, les scores de conception DB/API de gpt-5.4 sont approximativement égaux à ceux de qwen3.5-35b-a3b, et les scores de logique de claude-sonnet-4.6 correspondent à ceux de qwen3.5-27b.
  • Ceci est le dernier tour incluant les modèles frontaliers. Les exécuter mensuellement coûte environ 200–300 millions de tokens (~1 000–1 500 $ par modèle sur la tarification GPT 5.5). À partir du mois prochain, seuls les endpoints OpenRouter à moins de 0,25 $/M tokens ou les modèles tenant sur un ordinateur portable à mémoire unifiée de 64 Go seront inclus.
  • L'automatisation frontend sera ajoutée au benchmark dans le tour de juin/juillet, en utilisant le SDK qu'AutoBe émet déjà pour piloter des frontends entièrement construits par IA (visuels bruts, mais toutes les fonctions fonctionnent).
Ad

Inversions inattendues

Plusieurs résultats sont encore en cours d'investigation :

  • openai/gpt-5.4 obtient des scores inférieurs à ceux de son propre mini.
  • deepseek-v4-pro se place un cran en dessous de qwen3.5-35b-a3b et se démarque à peine de son propre Flash.
  • Dans la famille Qwen, le dense 27B bat toutes les variantes MoE, y compris 397B-A17B.

Les explications possibles en cours d'investigation incluent le phénomène de conformité au CoT (les modèles plus grands/frontaliers ont tendance à ignorer les instructions procédurales imposées par le harnais) et des défauts du benchmark (n=4 projets de référence, bande de score étroite, harnais évaluant son propre pipeline).

Modèles recommandés

Trois candidats verrouillés pour le mois prochain :

  • openai/gpt-5.4-nano — 0,25 $/M tokens
  • qwen/qwen3.6-27b — 0,195 $/M tokens
  • deepseek/deepseek-v4-flash — 0,14 $/M tokens

Tous sont à moins de 0,25 $/M sur OpenRouter ou exécutables sur un ordinateur portable à mémoire unifiée de 64 Go, et gèrent proprement l'appel de fonctions.

Références

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Claude ajoute des graphiques et diagrammes interactifs en ligne dans les conversations.
News

Claude ajoute des graphiques et diagrammes interactifs en ligne dans les conversations.

Claude crée désormais des graphiques, diagrammes et visualisations personnalisés directement dans les conversations de chat, permettant aux utilisateurs d'ajuster et de modifier les visualisations au fil des discussions. Cette fonctionnalité est disponible en version bêta sur tous les types de forfaits et apparaît en ligne plutôt que dans des panneaux latéraux.

OpenClawRadar
Apple utilise l'accès à Google Gemini pour la distillation de modèles d'IA sur l'appareil
News

Apple utilise l'accès à Google Gemini pour la distillation de modèles d'IA sur l'appareil

Apple a un accès complet au modèle Gemini de Google pour la distillation, créant ainsi des modèles d'IA plus petits et embarqués pour Siri et d'autres fonctionnalités dans iOS 27 sans nécessiter de connexion internet.

OpenClawRadar
Dépôt de compétences Bird supprimé — Sauvegardez votre accès X/Twitter dès maintenant
News

Dépôt de compétences Bird supprimé — Sauvegardez votre accès X/Twitter dès maintenant

La compétence populaire d'oiseau par @steipete a été retirée de GitHub. Les utilisateurs doivent sauvegarder leurs installations immédiatement.

🦀
News

Les SRE basés sur l'IA résolvent les incidents courants, mais les ingénieurs perdent le contact avec leurs systèmes

Sylvain Kalache soutient que les répondeurs d'incidents basés sur l'IA réduisent la pratique des ingénieurs, aggravant la réponse aux incidents complexes, citant les Ironies of Automation et les parallèles avec la formation aéronautique.

OpenClawRadar