OmniCoder-9B-Fine-Tuning zeigt eine starke Leistung für agentenbasiertes Codieren auf Systemen mit 8 GB VRAM.

Leistungsergebnisse aus dem Test von OmniCoder-9B mit OpenCode
Ein Nutzer auf r/LocalLLaMA berichtete über Tests mit OmniCoder-9B, einer Feinabstimmung von Qwen3.5-9B, die auf Opus-Traces trainiert wurde, und stellte fest, dass es sich für agentenbasiertes Codieren auf Systemen mit begrenztem VRAM gut eignet. Das Modell ist auf Hugging Face unter Tesslate/OmniCoder-9B verfügbar.
Technisches Setup und Konfiguration
Der Nutzer führte die Q4_K_M GGUF-Quantisierung mit ik_llama mit folgendem Befehl aus:
ik_llama.cpp\build\bin\Release\llama-server.exe -m models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf -ngl 999 -fa 1 -b 2048 -ub 512 -t 8 -c 100000 -ctk f16 -ctv q4_0 --temp 0.4 --top-p 0.95 --top-k 20 --presence-penalty 0.0 --jinja --ctx-checkpoints 0
Mit dieser Konfiguration erreichten sie etwa 40 Tokens pro Sekunde. Der Nutzer merkte an, dass die Q5_KS-Quantisierung mit einer Kontextlänge von 64.000 ähnliche Geschwindigkeiten bietet.
OpenCode-Konfiguration
Die für den Test verwendete OpenCode-Konfiguration:
"local": { "models": { "/models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf": { "interleaved": { "field": "reasoning_content" }, "limit": { "context": 100000, "output": 32000 }, "name": "omnicoder-9b-q4_k_m", "reasoning": true, "temperature": true, "tool_call": true } }, "npm": "@ai-sdk/openai-compatible", "options": { "baseURL": "http://localhost:8080/v1" } }Der Nutzer erwähnte einen potenziellen Fehler, der eine vollständige Neuverarbeitung des Prompts verursacht, den er untersucht.
Kontext und Vergleich
Die Tests wurden durch Bedenken hinsichtlich Kontingentbeschränkungen und Preisänderungen bei kommerziellen KI-Codierungstools motiviert. Der Nutzer erwähnte speziell, dass er über 8GB VRAM verfügt, was typischerweise die Fähigkeit einschränkt, leistungsfähige Open-Source-Modelle für agentenbasiertes Codieren mit guten Geschwindigkeiten auszuführen. Sie stellten fest, dass MOE-Modelle zwar eine bessere Leistung bieten könnten, ihre Geschwindigkeiten jedoch deutlich langsamer sind.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Lokale KI-Entwicklung mit Qwen3.6-27B und Opencode auf einer 5090
Ein Reddit-Nutzer berichtet über seinen Wechsel von cloudbasierten KI-Coding-Tools (Claude Code, Cursor) zu einem lokalen Setup mit Opencode + llama-server + Qwen3.6-27B bei 128K Kontext auf einer einzelnen RTX 5090 und hebt die Freiheit von Nutzungslimits und Account-Risiken hervor.

Selbstgehosteter kontextueller Bandit in Rust: Syntra & Lycan für adaptive Entscheidungssysteme
Zwei Open-Source-Projekte: Lycan (Graph-Ausführungssprache mit Strategieknoten und gelernten Gewichten) und Syntra (Docker/API-Appliance, die kompilierte Lycan-Kapseln bereitstellt). Fehler in der Datenpipeline vor Laufzeitfehlern entdeckt, als sie in einem KI-Aktien-Debattenprodukt eingesetzt wurden.

Temporal-MCP: Wanduhr-Bewusstsein für LLMs mit OAuth-Unterstützung
Temporal-MCP ist ein minimaler MCP-Server, der LLMs Wanduhr-Bewusstsein verleiht und zeitbedingte Fehlermodi wie falsche Begrüßungen und veralteten Kontext adressiert. Er bietet zwei Werkzeuge (temporal_tick und temporal_peek), die verstrichene Zeit, Tageswechselerkennung und Fresh-Thread-Flags zurückgeben.

Zwei Claude Code Skills zur Verwaltung der CLAUDE.md-Konfiguration
Ein Entwickler hat zwei Claude Code Skills erstellt, um die CLAUDE.md-Konfiguration zu verwalten: /cc-init erstellt schlanke Konfigurationen für neue Projekte, und /cc-optimize analysiert bestehende Projekte auf Überflüssiges und Probleme. Beide zielen darauf ab, den Kontext-Overhead zu reduzieren und die Befolgung von Anweisungen zu verbessern.