Claude 4.6 Opus Reasoning auf 14 GB für Apple Silicon mittels MLX-Quantisierung destilliert

✍️ OpenClawRadar📅 Veröffentlicht: 7. März 2026🔗 Source
Claude 4.6 Opus Reasoning auf 14 GB für Apple Silicon mittels MLX-Quantisierung destilliert
Ad

Ein Entwickler hat erfolgreich ein lokales KI-Modell quantisiert, das die Denkfähigkeiten von Claude 4.6 Opus auf Apple Silicon Hardware bringt und dabei seinen Speicherbedarf erheblich reduziert, während die Leistung erhalten bleibt.

Das Modell und sein Ursprung

Die Arbeit konzentriert sich auf Qwen 3.5 27B, insbesondere eine Version, die aus Claude 4.6 Opus Reasoning Trajectories destilliert wurde. Der Entwickler suchte ein Modell, das "denken" kann, anstatt nur Code zu vervollständigen, und beschrieb Opus' Signatur als "überlegt, analytisch und fängt die subtilen architektonischen Schwächen auf, die andere Modelle übersehen". Diese destillierte Version bringt dieses "Denkgerüst" in eine Open-Weight-Architektur.

Der Quantisierungsprozess

Das ursprüngliche Modell war 55,6 GB im BF16-Format, was der Entwickler als "nicht startfähig" für die meisten lokalen Setups bezeichnete, da es den gesamten Speicherpool verbraucht. Um dies zu lösen, verwendete er MLX, um das Modell für Apple Silicon zu quantisieren und es auf 4-Bit-Präzision zu konvertieren. Das Ziel war es, die hochwertige Opus-Denkfähigkeit beizubehalten und es gleichzeitig schlank genug für den täglichen Einsatz in technischer Planung und komplexer Logik zu machen.

Ad

Ergebnisse und Leistung

  • Speicherbedarf: Reduziert von 55 GB auf 14 GB
  • Geschwindigkeit: ~16 Token/Sekunde auf einem M4 Pro
  • Denkfähigkeit: Behält den vollständigen <think>-Block bei, sodass das Modell "mit sich selbst sprechen" kann, um Logik zu überprüfen, Randfälle zu simulieren und sich selbst zu korrigieren, bevor es endgültige Antworten präsentiert

Verfügbarkeit und Anforderungen

Der Entwickler hat die Gewichte auf Hugging Face hochgeladen. Das Modell benötigt einen Mac mit 24 GB+ RAM, um private, hochwertige Logik und technische Planung vollständig offline auszuführen.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Lokale semantische Speichersuche für OpenClaw-Agenten mittels Harrier-Embeddings
Werkzeuge

Lokale semantische Speichersuche für OpenClaw-Agenten mittels Harrier-Embeddings

Betreiben Sie einen lokalen Embedding-Server mit Microsofts Harrier-Modell, stellen Sie eine Ollama-kompatible API bereit und konfigurieren Sie OpenClaws memorySearch für lokale semantische Gedächtnisabfragen ohne externe Dienste.

OpenClawRadar
GoStaff: Go-Neufassung von OpenClaw mit 100-facher Speicherreduzierung
Werkzeuge

GoStaff: Go-Neufassung von OpenClaw mit 100-facher Speicherreduzierung

GoStaff ist eine in Go neu geschriebene Version von OpenClaw, die etwa 100-mal weniger Speicher (~17 MB) verbraucht und gleichzeitig die Kompatibilität mit OpenClaw-Plugins über einen JavaScript-Shim beibehält. Es verfügt über ein dreistufiges Skill-System, eine einheitliche Postgres-Persistenz und Multi-Provider-ReAct-Schleifen.

OpenClawRadar
Einführung von NetViews 2.3: Ein robustes Netzwerkdiagnosetool für macOS
Werkzeuge

Einführung von NetViews 2.3: Ein robustes Netzwerkdiagnosetool für macOS

NetViews 2.3 kombiniert Host-Erkennung, WLAN-Insights und Echtzeitüberwachung mit einer optimierten Benutzeroberfläche für bessere Netzwerkdiagnosen unter macOS.

OpenClawRadar
Erstellung eines selbstaktualisierenden Schreibstil-Leitfadens für KI-unterstützte Inhalte
Werkzeuge

Erstellung eines selbstaktualisierenden Schreibstil-Leitfadens für KI-unterstützte Inhalte

Ein Team, das eine Spracherkennungsplattform namens Noren entwickelt, hat einen 117-zeiligen Markdown-Stilleitfaden erstellt, der sich nach jedem veröffentlichten Beitrag selbst neu schreibt. Dabei nutzt es Claude, um Regeln durchzusetzen und KI-typische Wörter wie 'Kadenz' und 'optimieren' zu verbieten.

OpenClawRadar