Omnicoder-9B-Leistungsbewertung: Geschwindigkeit vs. Probleme beim Tool-Aufruf

Technische Übersicht
Omnicoder-9B ist ein auf Codierung spezialisiertes Modell, das von Tesslate entwickelt wurde und auf der Qwen 3.5-Architektur basiert. Es wurde auf Basis von Qwen3.5 9B mit Ausgaben mehrerer Modelle feinabgestimmt, darunter Opus 4.6, GPT 5.4, GPT 5.3 Codex und Gemini 3.1 Pro.
Leistungsmerkmale
Das Modell zeigt starke Leistung auf mittlerer Hardware. Mit 12 GB VRAM berichten Nutzer von einer konsistenten Token-Erzeugung von 15 Token/Sekunde, selbst bei einer Kontextgröße von 100k. Die Prompt-Verarbeitung ist mit etwa 265 Token/Sekunde bemerkenswert schnell. Das Modell läuft, ohne Systeme zum Absturz zu bringen oder Leistungseinbußen zu verursachen.
Einschränkungen und Probleme
Trotz der Geschwindigkeitsvorteile zeigt Omnicoder-9B mehrere Einschränkungen in praktischen Codierungsszenarien:
- Konnte keinen vollständigen Super-Mario-Klon in einer eigenständigen HTML-Datei mit einem One-Shot-Prompt erzeugen
- Erlebte Fehler bei Werkzeugaufrufen mit MCP-Servern, was zu MCP-Fehlern während des Datenabrufs führte
- Probleme bei der Ausführung von Schreib-Werkzeugaufrufen von Claude Code, wobei dies Kompatibilitätsfaktoren betreffen könnte
IDE-Integrationstests
Tests in Entwicklungsumgebungen zeigten gemischte Ergebnisse:
- In LM Studio mit Roo Code: Es kam zu Unterbrechungen, wenn die Token-Größe auf 4k anstieg, was jedoch eher ein Integrationsproblem als ein modellspezifisches zu sein scheint
- Das Modell aktualisierte oder schrieb erfolgreich kleine Skripte mit Token-Größen zwischen 2-3k
- API-Anfragen für Token über 4k schlugen fehl, ohne Fehlermeldungen
- In Claude Code: Die Token-Erzeugung fühlte sich langsamer an im Vergleich zu Roo Code, und das Modell konnte Schreib-Werkzeugaufrufe nach der Ausgabeerzeugung nicht ausführen
Der Nutzer merkt an, dass Roo Code die effektivste Erweiterung für lokale LLMs unter Continue und anderen getesteten Optionen war.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

SubQ: Ein sub-quadratisches LLM mit 12-Millionen-Token-Kontextfenster
SubQ ist ein vollständig sub-quadratisches Sparse-Attention-LLM mit einem 12M-Token-Kontextfenster bei 150 Tokens/s, SWE-Bench Verified 81,8% und RULER @ 128K 95,0%. Es reduziert die Attention-Berechnung im Vergleich zu Transformatoren um etwa das 1000-fache.

companion-capture: Tool speichert Claudes Codes flüchtige Sprechblasen
companion-capture ist ein Open-Source-Tool, das die Sprechblasen des Begleitcharakters von Claude Code erfasst, bevor sie im Terminal verschwinden. Es speichert Nachrichten in Markdown-Dateien und SQLite für die Suche und verwendet VT100-Bildschirmpuffer-Parsing, um Cursorpositionen zu verfolgen.

Benutzerdefinierte PTC für Claude Code zeigt 40-65 % Token-Einsparungen bei Analyseaufgaben, nicht beim Code-Schreiben.
Ein Entwickler hat eine lokale PTC-Implementierung namens Thalamus für Claude Code erstellt und 79 reale Sitzungen analysiert. Dabei wurden 40-65 % Token-Einsparungen bei Analyseaufgaben festgestellt, jedoch nahezu keine Einsparungen bei Code-Schreibaufgaben. Der Agent nutzte execute() hauptsächlich für allgemeine Python-Berechnungen anstatt für gebündelte Tool-Aufrufe.

Claude Desktop App fügt Projekte-Funktion zur Cowork-Oberfläche hinzu
Die Claude-Desktop-App enthält nun eine Projekte-Funktion in Cowork, die es Nutzern ermöglicht, Aufgaben und Kontext in dedizierten Arbeitsbereichen zu organisieren. Dateien und Anweisungen verbleiben auf dem lokalen Computer des Nutzers, mit Optionen zum Importieren bestehender Projekte oder zum Starten neuer.