Lightning MLX: Schnelle lokale KI-Engine für Apple Silicon Agentic Use liefert 220 tok/s auf Qwen 35B-A3B

✍️ OpenClawRadar📅 Veröffentlicht: 8. Mai 2026🔗 Source
Lightning MLX: Schnelle lokale KI-Engine für Apple Silicon Agentic Use liefert 220 tok/s auf Qwen 35B-A3B
Ad

Eine neue Open-Source-Inferenz-Engine für Apple Silicon namens Lightning MLX beansprucht, die schnellste lokale KI-Engine zu sein, die speziell für agentische Workflows optimiert ist — Codierungsagenten, Tool-Aufrufe und kurzzyklische Aufgaben. Das Projekt ist auf GitHub unter samuelfaj/lightning-mlx verfügbar.

Benchmark-Ergebnisse

Der Autor testete auf einem MacBook Max M5 mit 128 GB RAM und berichtete folgende Token-Generierungsgeschwindigkeiten:

  • Qwen3.6-27B: 40,67 Tok/s
  • Qwen3.6-35B-A3B: 220,86 Tok/s

Diese Ergebnisse deuten darauf hin, dass die Engine besonders effizient für die Mixture-of-Expert-Architektur des Qwen3.6-35B-A3B-Modells ist, das nur eine Teilmenge der Parameter pro Token aktiviert.

Ad

Hauptmerkmale

  • Optimiert für kurzzyklische agentische Anwendungsfälle — Codegenerierung, Tool-Aufrufe und schnelle Inferenzschleifen
  • Enthält eine voreingestellte Konfiguration namens MTPLX (benutzerdefinierte Sampling-Standardwerte); der Autor sucht Feedback, ob diese Standardeinstellungen für den Produktionseinsatz sinnvoll sind
  • Open Source unter der MIT-Lizenz (vermutlich) auf GitHub

Rückmeldungsanfragen

Der Ersteller bittet die Community aktiv um:

  • Bessere Benchmark-Designs für lokale Codierungsagenten
  • Meinungen zu den MTPLX-Standardeinstellungen
  • Testergebnisse auf anderen Apple-Silicon-Konfigurationen (z. B. M1, M2, M3, M4, unterschiedliche RAM-Größen)

Für wen es gedacht ist

Entwickler, die lokale LLMs auf Apple Silicon für agentische Codierungs-Workflows ausführen und maximale Inferenzgeschwindigkeit benötigen.

📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA

Ad

👀 Siehe auch

🦀
Werkzeuge

Claude erstellt in 3 Stunden eine Immobilienanalyse-App mit Live-Zillow-Daten über clawhub

Ein Entwickler nutzte Claude mit dem zillow-full clawhub-Tool, um eine Analyse-App für Miet-Cashflows zu erstellen – mit Live-Zugriff auf die Zillow-API, UI-Prototyping auf Basis echter JSON-Antworten und einem funktionsfähigen Prototypen in einem Nachmittag.

OpenClawRadar
OpenClaw 2026.3.23 fügt den DeepSeek-Provider hinzu, bietet Qwen nach Nutzungsabrechnung und verbessert die Chrome-MCP-Funktionen.
Werkzeuge

OpenClaw 2026.3.23 fügt den DeepSeek-Provider hinzu, bietet Qwen nach Nutzungsabrechnung und verbessert die Chrome-MCP-Funktionen.

OpenClaw v2026.3.23 führt ein DeepSeek-Provider-Plugin ein, Qwen-Nutzungsbasierte Preisgestaltung, OpenRouter automatische Preisgestaltung mit Anthropic-Denkreihenfolge, Chrome MCP Tab-Wartezeit und Fehlerbehebungen für Discord/Slack/Matrix und Web UI.

OpenClawRadar
cq: Ein lokales Wissensaustauschsystem für KI-Codierungsagenten
Werkzeuge

cq: Ein lokales Wissensaustauschsystem für KI-Codierungsagenten

cq von Mozilla.ai ist ein Open-Source-Tool, das KI-Code-Agenten ermöglicht, 'Wissenseinheiten' über häufige Fallstricke über einen lokalen SQLite-Speicher zu teilen, mit optionaler Team-Freigabe über eine Docker-API. Es wird als Claude Code-Plugin oder OpenCode MCP-Server installiert.

OpenClawRadar
Ollamas technische Probleme und Kontroversen in der Community
Werkzeuge

Ollamas technische Probleme und Kontroversen in der Community

Ollama, ein beliebtes lokales LLM-Tool, steht in der Kritik, weil es seine Abhängigkeit von llama.cpp herunterspielt, Lizenzprobleme hat und technische Probleme mit seinem eigenen Backend aufweist, einschließlich Leistungseinbußen und wieder eingeführter Fehler.

OpenClawRadar