OmniCoder-9B affiné démontre de solides performances pour le codage agentique sur des systèmes dotés de 8 Go de VRAM.

Résultats de performance du test d'OmniCoder-9B avec OpenCode
Un utilisateur sur r/LocalLLaMA a rapporté avoir testé OmniCoder-9B, une version affinée de Qwen3.5-9B entraînée sur des traces Opus, et a constaté qu'il performait bien pour des tâches de codage agentique sur des systèmes avec une VRAM limitée. Le modèle est disponible sur Hugging Face à l'adresse Tesslate/OmniCoder-9B.
Configuration technique et paramètres
L'utilisateur a exécuté la quantification GGUF Q4_K_M en utilisant ik_llama avec la commande suivante :
ik_llama.cpp\build\bin\Release\llama-server.exe -m models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf -ngl 999 -fa 1 -b 2048 -ub 512 -t 8 -c 100000 -ctk f16 -ctv q4_0 --temp 0.4 --top-p 0.95 --top-k 20 --presence-penalty 0.0 --jinja --ctx-checkpoints 0
Ils ont atteint environ 40 tokens par seconde avec cette configuration. L'utilisateur a noté que la quantification Q5_KS avec une longueur de contexte de 64 000 offre des vitesses similaires.
Configuration d'OpenCode
La configuration d'OpenCode utilisée pour le test :
"local": { "models": { "/models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf": { "interleaved": { "field": "reasoning_content" }, "limit": { "context": 100000, "output": 32000 }, "name": "omnicoder-9b-q4_k_m", "reasoning": true, "temperature": true, "tool_call": true } }, "npm": "@ai-sdk/openai-compatible", "options": { "baseURL": "http://localhost:8080/v1" } }L'utilisateur a mentionné un bug potentiel causant un retraitement complet des prompts qu'il est en train d'étudier.
Contexte et comparaison
Le test a été motivé par des préoccupations concernant les restrictions de quotas et les changements de tarification dans les outils commerciaux d'IA pour le codage. L'utilisateur a spécifiquement mentionné disposer de 8 Go de VRAM, ce qui limite généralement la capacité à exécuter des modèles open-source performants à de bonnes vitesses pour le codage agentique. Ils ont noté que bien que les modèles MOE puissent offrir de meilleures performances, leurs vitesses sont nettement plus lentes.
📖 Read the full source: r/LocalLLaMA
👀 See Also

CodeLedger : Le plugin open-source Claude Code suit l'utilisation des jetons et les agents en arrière-plan.
CodeLedger est un plugin serveur MCP open-source pour Claude Code qui suit automatiquement l'utilisation des tokens à travers les projets, identifie les agents en arrière-plan et fournit des recommandations d'optimisation des coûts basées sur l'analyse des fichiers de session JSONL locaux.

Claude Code v2.1.90 ajoute la prise en charge de la souris avec le drapeau CLAUDE_CODE_NO_FLICKER
Anthropic a publié Claude Code v2.1.90 avec une nouvelle fonctionnalité qui permet la prise en charge de la souris dans l'interface de chat. Les utilisateurs peuvent l'activer en définissant la variable d'environnement CLAUDE_CODE_NO_FLICKER=1 avant d'exécuter claude.

OpenTidy : Assistant d'arrière-plan Open Source utilisant Claude Code pour les tâches administratives
OpenTidy est un service open-source pour macOS qui lance des sessions persistantes de Claude Code pour gérer des tâches administratives telles que les factures, les formulaires et le tri des communications. Il exécute jusqu'à 10 tâches parallèles avec des notifications Telegram pour les actions sensibles.

Brainstorm MCP Server Permet à Claude de Consulter D'autres LLM pour de Meilleures Réponses
Un développeur a créé un serveur MCP qui permet à Claude Code de consulter d'autres modèles d'IA comme GPT-5.2 et DeepSeek avant de fournir des réponses. Les modèles s'engagent dans des débats en plusieurs tours où ils lisent les réponses des autres, expriment leurs désaccords et affinent leurs positions pour converger vers de meilleures solutions.