Développeur Teste Qwen3.5 27B face à des Modèles Plus Grands pour des Tâches de Codage Locales

Un développeur a testé plusieurs grands modèles de langage pour des tâches de codage locales, comparant les performances et les exigences matérielles. Les tests se sont concentrés sur les variantes de Qwen3.5 et les modèles Nemotron, avec des comparaisons à GPT-5.4 High.
Résultats et constatations des tests
Le développeur a testé ces modèles spécifiques :
- unsloth/Qwen3.5-27B-GGUF:UD-Q4_K_XL
- unsloth/Qwen3.5-35B-A3B-GGUF:UD-Q4_K_XL
- unsloth/Qwen3.5-122B-A10B-GGUF
- unsloth/Qwen3.5-27B-GGUF:UD-Q6_K_XL
- unsloth/Qwen3.5-27B-GGUF:UD-Q8_K_XL
- unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF:UD-IQ4_XS
- unsloth/gpt-oss-120b-GGUF:F16
Principales constatations des tests :
- Nemotron-3-Super-120B a performé "très, très bien", au même niveau que GPT-5.4 High
- Qwen3.5-27B a bien performé pour les tâches de développement
- GPT-OSS-120B et Qwen3.5-122B ont moins bien performé que les deux autres modèles
- Nemotron-3-Super-120B a systématiquement répondu en espagnol (la langue maternelle du testeur) tandis que les autres ont répondu en anglais
Métriques de performance
Le développeur a fourni des chiffres de performance spécifiques :
- Nemotron-3-Super-120B : 80 tokens par seconde (tg/s), ~2000 traitement de prompt (pp), contexte de 100k sur vast.ai avec 4x RTX 3090
- Qwen3.5-27B Q6 : 803 pp, 25 tg/s, contexte de 256k sur vast.ai
Exigences matérielles
Le développeur a noté des contraintes matérielles :
- Qwen3.5-122B nécessiterait une nouvelle carte mère et 1-2 cartes RTX 3090 supplémentaires, le rendant trop coûteux
- Qwen3.5-27B fonctionne sur du matériel existant 2x RTX 3090 sans investissement supplémentaire
- S'ils avaient le matériel pour Nemotron-3-Super-120B, ils l'utiliseraient à la place
Détails d'implémentation
Le développeur prévoit d'utiliser Qwen3.5-27B-GGUF:UD-Q6_K_XL pour de vraies tâches de développement localement et a fourni la commande llama.cpp utilisée pour les tests :
./llama.cpp/llama-server -hf unsloth/Qwen3.5-27B-GGUF:UD-Q6_K_XL --ctx-size 262144 --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.00 -ngl 999
Le développeur a mentionné qu'ils continueront à utiliser CODEX pour les tâches complexes mais pourront remplacer les abonnements API pour les tâches quotidiennes par la configuration locale.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Utilisateur de Reddit teste la fonction d'auto-apprentissage de l'agent IA Hermes, découvre des failles critiques
Un utilisateur de Reddit a testé la fonction d'auto-apprentissage de l'agent IA Hermes, qui crée automatiquement des compétences à partir de fichiers markdown. L'utilisateur a constaté qu'il évalue toujours ses propres résultats comme réussis, même lorsque la sortie est incorrecte, et qu'il écrase les modifications manuelles.

hiresTI : Lecteur TIDAL natif pour Linux avec support OpenClaw/MCP
hiresTI est un client de bureau Linux natif pour TIDAL, axé sur une lecture stable, une sortie audio de haute qualité, une interface utilisateur GTK4/Libadwaita et une intégration OpenClaw via MCP pour le contrôle à distance. L'application combine une couche d'interface utilisateur en Python avec un noyau audio en Rust.

MiniMax Music 2.5 Générateur de Musique IA Lancé avec un Contrôle Audio de Qualité Studio
MiniMax Music 2.5 est un modèle de génération musicale par IA qui crée des chansons de qualité studio avec une sortie Hi-Fi 44,1 kHz, plus de 100 instruments et un contrôle de précision au niveau des paragraphes utilisant plus de 14 balises structurelles pour diriger la structure des chansons.

Académie Claude : Un Bootcamp de Codage Gratuit Qui Fonctionne dans Claude Desktop
Un développeur a créé Claude Academy, un bootcamp de codage gratuit qui fonctionne entièrement dans l'onglet Code de Claude Desktop. Le système utilise trois commandes pour dispenser 64 leçons structurées couvrant les fondamentaux du développement web, avec suivi de progression et construction de projets réels.