Claude Code offline auf einem M3 Pro mit Qwen3.6 ausführen: 4 Korrekturen, die es zum Laufen brachten

✍️ OpenClawRadar📅 Veröffentlicht: 26. Juni 2026🔗 Source
Claude Code offline auf einem M3 Pro mit Qwen3.6 ausführen: 4 Korrekturen, die es zum Laufen brachten
Ad

Claude Code verbindet sich mit einem lokalen Modell auf einem Apple M3 Pro (18 GPU-Kerne, 36 GiB Unified Memory, ~150 GB/s Bandbreite), das qwen3.6:35b-a3b-coding-nvfp4 ausführt – ein 35,1B-Parameter-MoE-Modell mit ~3B aktiven Parametern pro Token, NVFP4-quantisiert, ~21 GB auf der Platte und ~20 GiB im Arbeitsspeicher. Der Aufbau durchlief einen Kubernetes-Incident von der Untersuchung bis zum PR: Root Cause gefunden, Patch geschrieben, Branch gepusht, PR via gh eingereicht – alles ohne Internetanbindung. Vier Fixes verwandelten ein Modell, das nach 10 Minuten eine Zeitüberschreitung hatte, in eines, das den Kreislauf schließt. Die Geschwindigkeit ist hardwarebegrenzt; die Fähigkeiten sind es nicht.

Stack und Umgebung

  • Hardware: Apple M3 Pro, 18 GPU-Kerne, 36 GiB Unified Memory, ~150 GB/s Speicherbandbreite
  • Modell: qwen3.6:35b-a3b-coding-nvfp4
  • Laufzeit: Ollama 0.24.0, MLX-Runner (Apple-Silicon-nativ)
  • Client: Claude Code v2.1.84, zeigt auf lokalen Ollama-Endpunkt

Wichtige Umgebungsvariablen (in einer launchd-plist für Persistenz gesetzt):

OLLAMA_MLX=1
OLLAMA_CONTEXT_LENGTH=32768
OLLAMA_FLASH_ATTENTION=1
OLLAMA_MULTIUSER_CACHE=1
OLLAMA_KEEP_ALIVE=24h
OLLAMA_NO_CLOUD=1
Ad

Einrichtungsschritte

  1. Installiere Ollama 0.24.0+
  2. ollama pull qwen3.6:35b-a3b-coding-nvfp4 (~21 GB einmalig)
  3. Starte den Server mit den obigen Umgebungsvariablen
  4. Starte Claude Code:
    ANTHROPIC_BASE_URL=http://localhost:11434 MAX_THINKING_TOKENS=0 claude --model qwen3.6:35b-a3b-coding-nvfp4
  5. Rauchtest: Run kubectl get pods -A and tell me if anything appears unhealthy

Leistungshinweise

Erster Toolaufruf: Sekunden (Thinking deaktiviert). Prefill (Laden von ~25.000 Token) dauert ~60 s. Nachfolgende Iterationen sind dank Prefix-Caching (OLLAMA_MULTIUSER_CACHE) schneller. Das Modell bleibt via OLLAMA_KEEP_ALIVE=24h geladen. Eine Flut von 404ern im Ollama-Log während des Prefill ist normal (Fix #4).

Die MoE-Architektur ist der Schlüssel: Nur ~3B aktive Parameter pro Token, daher ähnelt die Laufzeitkosten einem 14B dichten Modell, während die Antworten an ein 35B-Modell heranreichen. Ein dichtes 35B-Modell passt nicht in 36 GiB.

📖 Vollständige Quelle lesen: HN LLM Tools

Ad

👀 Siehe auch

TradesMCP: Open-Source-MCP-Server für die Überprüfung von Auftragnehmerlizenzen und Baudaten
Werkzeuge

TradesMCP: Open-Source-MCP-Server für die Überprüfung von Auftragnehmerlizenzen und Baudaten

TradesMCP ist ein Open-Source-Model-Context-Protocol-Server, der Claude Zugang zu echten Daten von Auftragnehmerlizenzen, Baugenehmigungen, Materialpreisen und Arbeitskosten bietet. Das Tool hat eine aktive Auftragnehmerlizenz in Kalifornien korrekt verifiziert, während ChatGPT falsche Informationen lieferte.

OpenClawRadar
GPT-5.5 Codex gegen Claude Opus 4.7: Praxisnahe KI-Coding-Benchmarks
Werkzeuge

GPT-5.5 Codex gegen Claude Opus 4.7: Praxisnahe KI-Coding-Benchmarks

Ein Entwickler ließ GPT-5.5 Codex gegen Claude Opus 4.7 bei zwei realen Aufgaben antreten: einen PR-Triage-Bot und eine Echtzeit-Code-Review-Oberfläche. Claude lieferte sauberer mit null Fehlern; Codex war 18 % günstiger, benötigte aber einen Korrekturdurchlauf.

OpenClawRadar
Claude Code Plugin analysiert Token-Verschwendung und Anomalien lokal
Werkzeuge

Claude Code Plugin analysiert Token-Verschwendung und Anomalien lokal

Ein Entwickler hat ein Claude Code Plugin erstellt, das Token-Verschwendung diagnostiziert, indem es sechs Anomaliearten aus lokalen Sitzungsdaten erkennt. Das Tool analysierte 8.392 Sitzungen und fand 1.015 Anomalien, wobei ExcessiveToolUse am häufigsten auftrat.

OpenClawRadar
OpenClaw-Benutzer erstellt 'feelslikeclaude'-Skill, um das Arbeitsablaufverhalten von ChatGPT-Agenten zu verbessern
Werkzeuge

OpenClaw-Benutzer erstellt 'feelslikeclaude'-Skill, um das Arbeitsablaufverhalten von ChatGPT-Agenten zu verbessern

Ein Entwickler wechselte sein OpenClaw-Setup von Claude zu ChatGPT und stellte fest, dass der Hauptunterschied nicht im Schreibstil oder Ton lag, sondern im Workflow-Verhalten. Er erstellte eine Clawhub-Fähigkeit namens 'feelslikeclaude', um ChatGPT zu besseren Ausführungsgewohnheiten zu lenken.

OpenClawRadar