RTX 5060 Ti 16GB : Benchmarks des LLM locaux : Les modèles 30B restent en tête pour le codage

Résultats de performance des LLM locaux sur RTX 5060 Ti 16GB
Les tests effectués sur une RTX 5060 Ti 16GB avec 32GB de RAM DDR4 en utilisant llama-server b8373 (46dba9fce) révèlent les caractéristiques de performance pratiques pour les flux de travail de codage avec LLM locaux. La configuration utilisait llama.cpp avec des paramètres de lancement spécifiques : chemin rapide avec fa=on, ngl=auto, threads=8, et les paramètres KV -ctk q8_0 -ctv q8_0.
Résultats de performance des modèles
Le benchmark a comparé plusieurs modèles quantifiés avec ces conclusions clés :
- Meilleur modèle de codage par défaut : Unsloth Qwen3-Coder-30B UD-Q3_K_XL
- Meilleure option de codage à contexte étendu : Le même modèle Unsloth 30B avec un contexte de 96k
- Meilleure option de codage rapide 35B : Unsloth Qwen3.5-35B UD-Q2_K_XL
Métriques de performance
Vitesses de génération de tokens issues des tests locaux :
- Jackrong Qwen 3.5 4B Q5_K_M : 88 tok/s
- LuffyTheFox Qwen 3.5 9B Q4_K_M : 64 tok/s
- Jackrong Qwen 3.5 27B Q3_K_S : ~20 tok/s
- Unsloth Qwen 3.0 30B UD-Q3_K_XL : 76,3 tok/s
- Unsloth Qwen 3.5 35B UD-Q2_K_XL : 80,1 tok/s
Comparaison multiplateforme
Des tests comparables avec 20 questions, un contexte de 32k et max_tokens=800 ont montré :
- Unsloth Qwen3-Coder-30B UD-Q3_K_XL : Windows : 79,5 tok/s, qualité 7,94 | Ubuntu : 76,3 tok/s, qualité 8,14
- Unsloth Qwen3.5-35B UD-Q2_K_XL : Windows : 72,3 tok/s, qualité 7,40 | Ubuntu : 80,1 tok/s, qualité 7,39
- Jackrong Qwen3.5-27B Claude-Opus Distilled Q3_K_S : Windows : 19,9 tok/s, qualité 8,85 | Ubuntu : ~20,0 tok/s, qualité 8,21
Notes de configuration
Le chemin du codeur 30B utilisait : jinja, reasoning-budget 0, reasoning-format none. Le chemin UD 35B utilisait : c=262144, n-cpu-moe=8. Pour l'accord stable du 35B Q4_K_M, les paramètres étaient : -ngl 26 -c 131072 --fit on --fit-ctx 131072 --fit-target 512M.
Notamment, le modèle 35B Q4_K_M nécessitait un accord spécifique pour fonctionner de manière stable sur cette carte, mais il ne surpassait toujours pas l'ancien chemin UD-Q2_K_XL dans un usage pratique. L'auteur a constaté que les modèles plus petits (route 9B) et les expériences plus lourdes (35B Q4_K_M) n'étaient pas les choix les plus solides dans le monde réel, malgré les attentes.
Tests de performance sur Ubuntu
Des tests supplémentaires ciblés sur Ubuntu avec le modèle Jackrong 27B ont montré une variation minimale :
-fa on, parallélisme automatique : 19,95 tok/s-fa auto, parallélisme automatique : 19,56 tok/s-fa on,--parallel 1: 19,26 tok/s
Les paramètres d'attention flash et de traitement parallèle avaient un impact négligeable sur la performance de ce modèle particulier.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Compétences en marketing de Corey Haines pour les agents IA
Un ensemble de 25 compétences marketing pour agents IA a été ajouté à OpenClaw, couvrant l'optimisation des conversions, la rédaction publicitaire, l'analyse et l'ingénierie de croissance. La compétence d'optimisation des conversions est notée comme particulièrement efficace dans les configurations multi-agents.

L'outil de surveillance Open Source résout le problème d'identité des agents dans l'écosystème OpenClaw
Un utilisateur d'OpenClaw développant un service web a découvert un trafic d'agents indifférenciable de celui des utilisateurs humains, ce qui a motivé le développement de Vigil - une couche d'identité open source basée sur le W3C DID qui fournit des justificatifs cryptographiques et un historique comportemental pour les agents.

ClawCall obtient des numéros de téléphone dédiés : les agents peuvent désormais réserver un numéro pour les appels sortants
ClawCall, la compétence d'appel téléphonique IA pour les agents OpenClaw, permet désormais de réserver un numéro de téléphone par indicatif régional. Votre agent l'utilise par défaut pour passer des appels. 10 000 téléchargements, 300 appels/jour.

L'approche de débat multi-agents améliore la qualité du raisonnement des LLM.
Un développeur a expérimenté une approche de débat multi-agents avec CyrcloAI, où différents agents IA endossent des rôles comme analyste, critique et synthétiseur pour critiquer les réponses des autres avant de produire une réponse finale, ce qui a donné des résultats plus structurés et réfléchis.