Claude 4.6 Opus Reasoning auf 14 GB für Apple Silicon mittels MLX-Quantisierung destilliert

✍️ OpenClawRadar📅 Veröffentlicht: 7. März 2026🔗 Source
Claude 4.6 Opus Reasoning auf 14 GB für Apple Silicon mittels MLX-Quantisierung destilliert
Ad

Ein Entwickler hat erfolgreich ein lokales KI-Modell quantisiert, das die Denkfähigkeiten von Claude 4.6 Opus auf Apple Silicon Hardware bringt und dabei seinen Speicherbedarf erheblich reduziert, während die Leistung erhalten bleibt.

Das Modell und sein Ursprung

Die Arbeit konzentriert sich auf Qwen 3.5 27B, insbesondere eine Version, die aus Claude 4.6 Opus Reasoning Trajectories destilliert wurde. Der Entwickler suchte ein Modell, das "denken" kann, anstatt nur Code zu vervollständigen, und beschrieb Opus' Signatur als "überlegt, analytisch und fängt die subtilen architektonischen Schwächen auf, die andere Modelle übersehen". Diese destillierte Version bringt dieses "Denkgerüst" in eine Open-Weight-Architektur.

Der Quantisierungsprozess

Das ursprüngliche Modell war 55,6 GB im BF16-Format, was der Entwickler als "nicht startfähig" für die meisten lokalen Setups bezeichnete, da es den gesamten Speicherpool verbraucht. Um dies zu lösen, verwendete er MLX, um das Modell für Apple Silicon zu quantisieren und es auf 4-Bit-Präzision zu konvertieren. Das Ziel war es, die hochwertige Opus-Denkfähigkeit beizubehalten und es gleichzeitig schlank genug für den täglichen Einsatz in technischer Planung und komplexer Logik zu machen.

Ad

Ergebnisse und Leistung

  • Speicherbedarf: Reduziert von 55 GB auf 14 GB
  • Geschwindigkeit: ~16 Token/Sekunde auf einem M4 Pro
  • Denkfähigkeit: Behält den vollständigen <think>-Block bei, sodass das Modell "mit sich selbst sprechen" kann, um Logik zu überprüfen, Randfälle zu simulieren und sich selbst zu korrigieren, bevor es endgültige Antworten präsentiert

Verfügbarkeit und Anforderungen

Der Entwickler hat die Gewichte auf Hugging Face hochgeladen. Das Modell benötigt einen Mac mit 24 GB+ RAM, um private, hochwertige Logik und technische Planung vollständig offline auszuführen.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Überarbeitung: KI-Editor entwickelt mit agentenbasierten Codierungstools und Y.js CRDT
Werkzeuge

Überarbeitung: KI-Editor entwickelt mit agentenbasierten Codierungstools und Y.js CRDT

Revise ist ein KI-Editor für Dokumente, der über 10 Monate hinweg von Grund auf mit agentenbasierten Codierungswerkzeugen entwickelt wurde. Er verfügt über eine eigene Textverarbeitungs-Engine und eine Rendering-Schicht, die nur Y.js für den CRDT-Stack verwendet. Das System integriert mehrere KI-Modelle, darunter GPT-5.4-Varianten und Claude-Modelle, für Korrekturlesen und Überarbeitungen.

OpenClawRadar
OpenClaw Janitor Skill für automatisierte Systemverwaltung und Sicherheitshärtung
Werkzeuge

OpenClaw Janitor Skill für automatisierte Systemverwaltung und Sicherheitshärtung

Ein Entwickler hat eine Fähigkeit erstellt, die Claude Code nutzt, um sich per SSH in OpenClaw-Maschinen einzuwählen und Konfigurationen zu härten, einschließlich Sandboxing, OS-Hygiene und Kanalsicherheit, während ein Projektordner mit Audit-Anweisungen in CLAUDE.md gepflegt wird.

OpenClawRadar
LoreConvo: MCP-Server fügt Claude Code persistenten Sitzungsspeicher hinzu
Werkzeuge

LoreConvo: MCP-Server fügt Claude Code persistenten Sitzungsspeicher hinzu

LoreConvo ist ein MCP-Server, der Claude Code mit persistenter Sitzungsspeicherung versorgt und automatisch Kontext zwischen Sitzungen speichert und lädt. Er spart 3.000–8.000 Token pro Sitzung, indem er den Aufwand für das erneute Kontextualisieren eliminiert.

OpenClawRadar
Agentischer Kontext-Motor: Automatisierte Agenten-Verbesserungsschleife mit 34,2 % Genauigkeitssteigerung
Werkzeuge

Agentischer Kontext-Motor: Automatisierte Agenten-Verbesserungsschleife mit 34,2 % Genauigkeitssteigerung

Ein Open-Source-Tool automatisiert den gesamten Agentenverbesserungsprozess von der Spurenanalyse bis zur Fehlerbehebung und erreicht in einer Iteration eine Genauigkeitssteigerung von 34,2 % auf dem Tau-2 Bench. Das System nutzt Claude Code in einer REPL-Umgebung, um Fehler zu analysieren und zwischen Prompt- oder Codekorrekturen zu entscheiden.

OpenClawRadar