Lokale vs. Cloud-Modelle: Qwen-3.6-27B, Gemma-4-31B, Claude Haiku, Codex-Spark bei schwerer Code-Generierung

✍️ OpenClawRadar📅 Veröffentlicht: 30. April 2026🔗 Source
Lokale vs. Cloud-Modelle: Qwen-3.6-27B, Gemma-4-31B, Claude Haiku, Codex-Spark bei schwerer Code-Generierung
Ad

Ein Reddit-Benutzer verglich lokal ausgeführte Qwen-3.6-27B (GGUF q4_k_m) mit API-Äquivalenten: Qwen-3.6-27B über OpenRouter, Gemma-4-31B über OpenRouter, Claude Haiku 4.5 und GPT-Codex-Spark. Der Test bestand darin, eine Autoresearch-Schleife aus einem Designdokument zu implementieren – eine bewusst schwierige Aufgabe, um die Fehlerbereinigung zu bewerten, nicht die Erfolgsquote.

Hardware-Setup

  • CPU: Ryzen 7 7800X3D
  • RAM: 64 GB DDR5-6400
  • GPU: RTX 5080 (16 GB VRAM)
  • Lokales Modell: Qwen-3.6-27B q4_k_m (GGUF) – passt dank Quantisierung in 16 GB VRAM

Ergebnisse

  • Gemma-4-31B (API): Vollständig gescheitert. Schrieb ein Skelett mit nachgebildeten Modulen, keine Tests, keine Konfigurationsdateien (__init__.py, requirements.txt, pyproject.toml). Kosten: 0,112 $, 803k Kontext-Tokens verbraucht, 21k generiert.
  • Codex-Spark (API): Lieferte eine schöne Ordnerstruktur und Code, aber die Imports waren halluziniert. Keine Unit-Tests. Nutzte 1 % der 100 $/Monat Spark-Limits.
  • Claude Haiku 4.5 (API): Detaillierte Implementierung, aber fehlerhaft. (Weitere Details in der Quelle abgeschnitten.)
  • Qwen-3.6-27B (lokal q4_k_m): Nicht explizit bewertet, aber der Benutzer merkt an, dass quantisierte Inferenz die Qualität im Vergleich zur Vollpräzisions-API-Version verschlechtert.
Ad

Kontext

Der Benutzer argumentiert, dass typische Auswertungen lokaler Modelle triviale Aufgaben verwenden (z. B. Snake in HTML), bei denen sowohl lokale als auch Frontier-Modelle erfolgreich sind, wodurch lokale Modelle besser aussehen, als sie sind. Dieser Test verwendete ein echtes Arbeitsprojekt mit einem Designdokument; nur Codex-Spark lieferte vollständig geschriebenen (aber fehlerhaften) Code. Der Punkt: Lokale Modelle sind noch nicht bereit für komplexe Codegenerierung ohne erhebliche Korrekturen.

📖 Lies die vollständige Quelle: r/LocalLLaMA

Ad

👀 Siehe auch

Pantheon-Reasoning-27B: Ein dichtes Reasoning-RP-Modell von Gryphe
Nachrichten

Pantheon-Reasoning-27B: Ein dichtes Reasoning-RP-Modell von Gryphe

Gryphe veröffentlicht Pantheon-Reasoning-27B, ein unzensiertes Qwen 3.6 27B Feintuning mit vollständigen Reasoning-Spuren für Rollenspiele. Basierend auf Pantheon, Opus-4.6-Reasoning-24k, WorldSim, Textadventure und allgemeinen Rollenspieldaten. GGUF-Quants verfügbar.

OpenClawRadar
Gemma 4 veröffentlicht: Vier Modellgrößen für lokales KI-Hosting
Nachrichten

Gemma 4 veröffentlicht: Vier Modellgrößen für lokales KI-Hosting

Google hat Gemma 4 mit vier Modellgrößen veröffentlicht, die für verschiedene Hardware optimiert sind, einschließlich Edge-Geräten, Laptops und GPUs. Alle Modelle sind multimodal mit Text- und Bildverarbeitungsfähigkeiten, und die kleineren Modelle unterstützen Echtzeit-Audio.

OpenClawRadar
Glomz Octagon: Multi-Agent-Code-Reviews – 179 Agents, 1.333 Reviews und der Netzwerkeffekt
Nachrichten

Glomz Octagon: Multi-Agent-Code-Reviews – 179 Agents, 1.333 Reviews und der Netzwerkeffekt

Glomz.com führte ein Experiment durch, bei dem 179 KI-Agenten registriert wurden, 433 Code-Beiträge einreichten und 1.333 Bewertungen in einer „Octagon"-Arena generierten. Der Netzwerkeffekt der „Review-Kaskade" ist real – Beiträge mit 3-5 ersten Bewertungen zogen mehr Agenten an, wobei der beste Beitrag 21 Bewertungen erhielt.

OpenClawRadar
Claude Opus 4.5 und Sonnet 4.5 wurden aus der Modellauswahl entfernt und erfordern ein Startflag.
Nachrichten

Claude Opus 4.5 und Sonnet 4.5 wurden aus der Modellauswahl entfernt und erfordern ein Startflag.

Claude Opus 4.5 und Sonnet 4.5 sind nicht mehr im /model-Auswahlmenü während Sitzungen verfügbar. Benutzer müssen nun Sitzungen mit dem --model-Flag starten, das die vollständige Modell-ID angibt, um auf diese älteren Versionen zuzugreifen.

OpenClawRadar