Lokale vs. Cloud-Modelle: Qwen-3.6-27B, Gemma-4-31B, Claude Haiku, Codex-Spark bei schwerer Code-Generierung

✍️ OpenClawRadar📅 Veröffentlicht: 30. April 2026🔗 Source
Lokale vs. Cloud-Modelle: Qwen-3.6-27B, Gemma-4-31B, Claude Haiku, Codex-Spark bei schwerer Code-Generierung
Ad

Ein Reddit-Benutzer verglich lokal ausgeführte Qwen-3.6-27B (GGUF q4_k_m) mit API-Äquivalenten: Qwen-3.6-27B über OpenRouter, Gemma-4-31B über OpenRouter, Claude Haiku 4.5 und GPT-Codex-Spark. Der Test bestand darin, eine Autoresearch-Schleife aus einem Designdokument zu implementieren – eine bewusst schwierige Aufgabe, um die Fehlerbereinigung zu bewerten, nicht die Erfolgsquote.

Hardware-Setup

  • CPU: Ryzen 7 7800X3D
  • RAM: 64 GB DDR5-6400
  • GPU: RTX 5080 (16 GB VRAM)
  • Lokales Modell: Qwen-3.6-27B q4_k_m (GGUF) – passt dank Quantisierung in 16 GB VRAM

Ergebnisse

  • Gemma-4-31B (API): Vollständig gescheitert. Schrieb ein Skelett mit nachgebildeten Modulen, keine Tests, keine Konfigurationsdateien (__init__.py, requirements.txt, pyproject.toml). Kosten: 0,112 $, 803k Kontext-Tokens verbraucht, 21k generiert.
  • Codex-Spark (API): Lieferte eine schöne Ordnerstruktur und Code, aber die Imports waren halluziniert. Keine Unit-Tests. Nutzte 1 % der 100 $/Monat Spark-Limits.
  • Claude Haiku 4.5 (API): Detaillierte Implementierung, aber fehlerhaft. (Weitere Details in der Quelle abgeschnitten.)
  • Qwen-3.6-27B (lokal q4_k_m): Nicht explizit bewertet, aber der Benutzer merkt an, dass quantisierte Inferenz die Qualität im Vergleich zur Vollpräzisions-API-Version verschlechtert.
Ad

Kontext

Der Benutzer argumentiert, dass typische Auswertungen lokaler Modelle triviale Aufgaben verwenden (z. B. Snake in HTML), bei denen sowohl lokale als auch Frontier-Modelle erfolgreich sind, wodurch lokale Modelle besser aussehen, als sie sind. Dieser Test verwendete ein echtes Arbeitsprojekt mit einem Designdokument; nur Codex-Spark lieferte vollständig geschriebenen (aber fehlerhaften) Code. Der Punkt: Lokale Modelle sind noch nicht bereit für komplexe Codegenerierung ohne erhebliche Korrekturen.

📖 Lies die vollständige Quelle: r/LocalLLaMA

Ad

👀 Siehe auch

Pentagon wird Palantir-KI als zentrales US-Militärsystem übernehmen
Nachrichten

Pentagon wird Palantir-KI als zentrales US-Militärsystem übernehmen

Das Pentagon plant, die KI-Technologie von Palantir als Kernsystem für das US-Militär zu übernehmen, wie aus einem Memo hervorgeht. Der Reuters-Artikel erzielte 47 Punkte und 2 Kommentare auf Hacker News.

OpenClawRadar
Anthropic entfernt Claude Code aus Pro-Abonnement für neue Nutzer in Test
Nachrichten

Anthropic entfernt Claude Code aus Pro-Abonnement für neue Nutzer in Test

Anthropic entfernte vorübergehend den Zugang zu Claude Code aus seinem 20-Dollar-pro-Monat-Pro-Abonnement für neue Nutzer, änderte Website-Preislisten und Support-Dokumente, bevor die Änderungen rückgängig gemacht wurden. Das Unternehmen beschrieb dies als einen 'kleinen Test mit 2 % der neuen Prosumer-Anmeldungen'.

OpenClawRadar
Claude Code v2.1.187: Korrekturen der strukturierten Ausgabe, Sandbox-Sicherheit und Einschränkungen des Organisationsmodells
Nachrichten

Claude Code v2.1.187: Korrekturen der strukturierten Ausgabe, Sandbox-Sicherheit und Einschränkungen des Organisationsmodells

Claude Code v2.1.187 fügt die Einstellung sandbox.credentials, Organisations-Modellbeschränkungen sowie Fehlerbehebungen für strukturierte Ausgabeschleifen, Remote-MCP-Hänger und Tiefenverfolgung von Unteragenten hinzu.

OpenClawRadar
Anthropic API-Abrechnungsfehler: Sonnet-Modell zu Opus-Preisen abgerechnet
Nachrichten

Anthropic API-Abrechnungsfehler: Sonnet-Modell zu Opus-Preisen abgerechnet

Ein Nutzer entdeckte, dass die Anthropic API das claude-sonnet-4-6-Modell fälschlicherweise zu Opus-Preisen abrechnet, obwohl die korrekte Modellzeichenfolge zurückgegeben wird. Der Fehler wurde durch die Analyse von Rohdatenereignissen identifiziert, die eine Kostenabweichung zeigten.

OpenClawRadar