Examen des performances d'Omnicoder-9B : Vitesse contre problèmes d'appel d'outils

Vue d'ensemble technique
Omnicoder-9B est un modèle spécifique au codage développé par Tesslate, basé sur l'architecture Qwen 3.5. Il est affiné sur Qwen3.5 9B en utilisant des sorties de plusieurs modèles incluant Opus 4.6, GPT 5.4, GPT 5.3 Codex et Gemini 3.1 Pro.
Caractéristiques de performance
Le modèle démontre de solides performances sur du matériel de milieu de gamme. Avec 12 Go de VRAM, les utilisateurs rapportent une génération de tokens constante à 15 tokens/seconde même avec une taille de contexte fixée à 100k. Le traitement des prompts est remarquablement rapide à environ 265 tokens/seconde. Le modèle fonctionne sans planter les systèmes ou causer de dégradation des performances.
Limitations et problèmes
Malgré les avantages en vitesse, Omnicoder-9B montre plusieurs limitations dans des scénarios de codage pratiques :
- N'a pas réussi à générer un clone complet de Super Mario dans un fichier HTML autonome avec un prompt en une seule fois
- A rencontré des échecs d'appel d'outils avec les serveurs MCP, générant des erreurs MCP pendant la récupération de données
- Problèmes d'exécution des appels d'outils d'écriture depuis Claude Code, bien que cela puisse impliquer des facteurs de compatibilité
Tests d'intégration IDE
Les tests dans les environnements de développement ont révélé des résultats mitigés :
- Dans LM Studio avec Roo Code : Des déconnexions se sont produites lorsque la taille des tokens augmentait à 4k, bien que cela semble être un problème d'intégration plutôt que spécifique au modèle
- Le modèle a réussi à mettre à jour ou écrire de petits scripts avec des tailles de tokens entre 2-3k
- Les requêtes API ont échoué pour les tokens au-dessus de 4k sans messages d'erreur
- Dans Claude Code : La génération de tokens semblait plus lente comparée à Roo Code, et le modèle a échoué à exécuter les appels d'outils d'écriture après avoir généré une sortie
L'utilisateur note que Roo Code a été l'extension la plus efficace pour les LLM locaux parmi Continue et les autres options testées.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Mouser : Alternative open-source à Logitech Options+ pour la MX Master 3S
Mouser est un outil léger et open source qui permet de remapper les boutons de la souris Logitech MX Master 3S sans nécessiter le logiciel propriétaire de Logitech. Il fonctionne entièrement en local sans télémétrie, prend en charge les profils par application et inclut le contrôle du DPI ainsi que la surveillance de la batterie.

Octopoda : Couche de mémoire open source pour agents d'IA locaux
Octopoda est une couche mémoire open source qui donne aux agents d'IA locaux une mémoire persistante entre les sessions, une recherche sémantique, une détection de boucles et une récupération après incident. Il fonctionne entièrement hors ligne avec un modèle d'embedding de 33 Mo et s'intègre avec LangChain, CrewAI, AutoGen et OpenAI Agents SDK.

PixelCheck : Un paquet npm permettant aux agents IA de vérifier visuellement les pages web
PixelCheck est un package npm qui permet aux agents IA d'ouvrir, d'interagir et d'évaluer visuellement des pages web — fini les boucles manuelles de capture d'écran et de feedback.

Diffusé : Une Compétence Claude Code pour une Publication HTML Instantanée vers des URL en Direct
Aired est un outil open-source qui publie du HTML sur une URL en direct en 2 secondes via les compétences Claude Code ou les serveurs MCP. Il ne nécessite aucune inscription, configuration de déploiement ou installation pour les outils d'IA basés sur le web, et fonctionne avec Claude Code, Cursor, VS Code, Codex et Windsurf.