Durch Auslagerung mechanischer Aufgaben an DeepSeek V4 Flash via MCP senkt Claude Kosten um das 60-fache

Ein Reddit-Nutzer analysierte seine Claude-Nutzung und stellte fest, dass der Großteil auf mechanische Aufgaben entfiel: Dateien klassifizieren, JSON neu formatieren, Felder aus Texten extrahieren und Dokumente zusammenfassen, die er ohnehin überfliegen würde. Nichts davon benötigte Sonnet. Die Lösung: ein kleines, günstiges Modell, das als Side-Worker über MCP läuft, plus eine einzelne Regel in CLAUDE.md, die Claude anweist, diese Aufgaben nicht zu erledigen.
Einrichtung: ein MCP-Tool + CLAUDE.md-Deny-List
Die Einrichtung verwendet ein einzelnes MCP-Tool, das Text sendet und Text zurückerhält. Das Standardmodell ist DeepSeek V4 Flash (günstig, 1M Kontext). Der Endpunkt ist eine einzige Konfigurationszeile und funktioniert mit jedem OpenAI-kompatiblen Anbieter (lokales ollama, vllm, lm studio). Das Repository ist github.com/arizen-dev/deepseek-mcp (MIT, Python 3.10+).
Das entscheidende Element: Die CLAUDE.md-Regel verwendet negative Formulierung – eine Deny-List, keine Permission-List. Der Benutzer berichtet, dass positive Formulierung („Verwende DeepSeek für X“) zu etwa 30 % der Fälle ignoriert wurde. Der Deny-List-Ansatz fängt dies zuverlässig ab.
# In CLAUDE.md:
# NICHT Claude verwenden für:
# - JSON-Formatierung
# - Feldextraktion
# - Dateiklassifizierung
# - Zusammenfassungen, die du ohnehin überprüfst
Ergebnisse: 60-fache Kostenreduktion
Bei 3 Wochen echter Nutzung: 217 mechanische Aufrufe an DeepSeek V4 Flash ausgelagert, Gesamtkosten 0,41 $. Dieselbe Arbeitslast mit Sonnet hätte etwa 7 $ gekostet. Das ist ein etwa 17-facher Multiplikator allein für diese Aufgaben, und der Benutzer gibt an, dass die Gesamtrechnung um das 60-fache gesunken ist, wenn man die schwereren Aufgaben, die weiterhin auf Sonnet laufen, einbezieht.
Wie der Side-Worker arbeitet
Der Side-Worker ist ein überwachtes Tool, kein Agent – keine Tool-Aufrufe, kein Dateizugriff, keine Ketten. Die Latenz beträgt 3–25 Sekunden. Du überprüfst die Ausgabe. Das gesamte Konzept: Text senden, Text zurückerhalten, prüfen, weitermachen.
Für wen es gedacht ist
Entwickler, die die Claude-API oder Claude Code verwenden und die Kosten für stark frequentierte mechanische Aufgaben senken möchten, ohne auf die Argumentationsfähigkeiten von Sonnet für komplexe Arbeiten zu verzichten.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Qwen3.6 27B und 35B auf 6GB VRAM mit ik_llama ausführen: Praktische Konfigurationen und Benchmarks
Ein Nutzer teilt detaillierte ik_llama-Konfigurationen und Leistungszahlen zum Ausführen der Qwen3.6 27B- und 35B-A3B-Modelle auf einem RTX2060 Mobile (6 GB VRAM, 32 GB RAM) mit Prefill-Geschwindigkeiten von 40–100 t/s und Generation bis zu 11 t/s.

Maßgeschneiderter 4x RTX PRO 6000 Server vs Dell GB300: Entscheidung für 30 feinabgestimmte Pipelines
Ein detaillierter Vergleich zweier On-Premises-Architekturen für den Betrieb von etwa 30 feinabgestimmten Produktions-Pipelines: ein kundenspezifischer 4U-Server mit 4-8x RTX PRO 6000 Blackwell (je 96 GB) vs. NVIDIA GB300 Grace Blackwell Appliance mit 252 GB HBM3e + 496 GB Unified Memory.

Ihr LLM sollte nicht Ihr Codierungs-Agent-Workflow sein: Trennung der Zuständigkeiten in OpenClaw
Wenn Ihr Coding-Agent-Workflow stoppt, sobald Ihr LLM-Limit erreicht ist, übernimmt das LLM zu viel. Halten Sie Warteschlangen, Zustand, Wiederholungen und Verifikation deterministisch – rufen Sie das LLM nur für Urteilsvermögen auf.

Claude Code LSP Einrichtungsanleitung: Strukturelles Code-Verständnis
Ein Reddit-Post beschreibt, wie man Claude Code so konfiguriert, dass er das Language Server Protocol für strukturelles Code-Verständnis anstelle von Textabgleich verwendet, wodurch Abfragezeiten von 30-60 Sekunden auf ~50ms reduziert werden, mit Funktionen wie Gehe-zur-Definition, Finde-Referenzen und Aufrufhierarchie.