Entwickler testet Qwen3.5 27B im Vergleich zu größeren Modellen für lokale Programmieraufgaben

✍️ OpenClawRadar📅 Veröffentlicht: 28. März 2026🔗 Source
Entwickler testet Qwen3.5 27B im Vergleich zu größeren Modellen für lokale Programmieraufgaben
Ad

Ein Entwickler testete mehrere große Sprachmodelle für lokale Programmieraufgaben und verglich Leistung und Hardwareanforderungen. Der Test konzentrierte sich auf Qwen3.5-Varianten und Nemotron-Modelle, mit Vergleichen zu GPT-5.4 High.

Testergebnisse und Erkenntnisse

Der Entwickler testete diese spezifischen Modelle:

  • unsloth/Qwen3.5-27B-GGUF:UD-Q4_K_XL
  • unsloth/Qwen3.5-35B-A3B-GGUF:UD-Q4_K_XL
  • unsloth/Qwen3.5-122B-A10B-GGUF
  • unsloth/Qwen3.5-27B-GGUF:UD-Q6_K_XL
  • unsloth/Qwen3.5-27B-GGUF:UD-Q8_K_XL
  • unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF:UD-IQ4_XS
  • unsloth/gpt-oss-120b-GGUF:F16

Wichtige Erkenntnisse aus dem Test:

  • Nemotron-3-Super-120B schnitt "sehr, sehr gut" ab, auf Augenhöhe mit GPT-5.4 High
  • Qwen3.5-27B eignete sich gut für Entwicklungsaufgaben
  • GPT-OSS-120B und Qwen3.5-122B schnitten schlechter ab als die beiden anderen Modelle
  • Nemotron-3-Super-120B antwortete durchgehend auf Spanisch (die Muttersprache des Testers), während andere auf Englisch antworteten

Leistungsmetriken

Der Entwickler lieferte spezifische Leistungszahlen:

  • Nemotron-3-Super-120B: 80 Token pro Sekunde (tg/s), ~2000 Prompt-Verarbeitung (pp), 100k Kontext auf vast.ai mit 4x RTX 3090
  • Qwen3.5-27B Q6: 803 pp, 25 tg/s, 256k Kontext auf vast.ai
Ad

Hardwareanforderungen

Der Entwickler stellte Hardwareeinschränkungen fest:

  • Qwen3.5-122B würde ein neues Mainboard und 1-2 weitere RTX 3090-Karten erfordern, was zu teuer wäre
  • Qwen3.5-27B läuft auf bestehender 2x RTX 3090-Hardware ohne zusätzliche Investition
  • Wenn sie die Hardware für Nemotron-3-Super-120B hätten, würden sie diese stattdessen verwenden

Implementierungsdetails

Der Entwickler plant, Qwen3.5-27B-GGUF:UD-Q6_K_XL für echte Entwicklungsaufgaben lokal zu nutzen, und gab den für den Test verwendeten llama.cpp-Befehl an:

./llama.cpp/llama-server -hf unsloth/Qwen3.5-27B-GGUF:UD-Q6_K_XL --ctx-size 262144 --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.00 -ngl 999

Der Entwickler erwähnte, dass sie CODEX für komplexe Aufgaben weiterhin nutzen werden, aber API-Abonnements für tägliche Aufgaben durch das lokale Setup ersetzen können.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Bitcoin MCP Server mit 43 Tools für KI-Codierungsagenten
Werkzeuge

Bitcoin MCP Server mit 43 Tools für KI-Codierungsagenten

bitcoin-mcp ist ein MCP-Server mit 43 Bitcoin-Tools, darunter Gebührenberater, Mempool-Analyse und Inskriptionserkennung. Er funktioniert mit Claude Desktop, Claude Code, Cursor, VS Code und Windsurf und verwendet Live-Daten von APIs oder lokalen Nodes.

OpenClawRadar
GAN-Fähigkeit für Claude Code: Adversarial KI-Tool zur Ideenverfeinerung
Werkzeuge

GAN-Fähigkeit für Claude Code: Adversarial KI-Tool zur Ideenverfeinerung

Eine Claude Code-Fähigkeit namens /gan nutzt gegnerische KI-Rollen, um Ideen durch abwechselnde Diskriminator- und Generator-Phasen zu kritisieren und zu verbessern, mit Funktionen wie Intensitätsmodi, mehrsprachiger Ausgabe und erzwungener Rollenauswahl, die durch Selbstiteration entwickelt wurden.

OpenClawRadar
Manifest fügt MiniMax-Token-Pläne mit M2.7-Modellunterstützung hinzu
Werkzeuge

Manifest fügt MiniMax-Token-Pläne mit M2.7-Modellunterstützung hinzu

Manifest, eine Open-Source-Routing-Schicht für OpenClaw, unterstützt jetzt MiniMax-Token-Pläne ab 10 US-Dollar pro Monat. Das neue MiniMax M2.7-Modell wurde speziell für OpenClaw-Workflows entwickelt und erreicht 62,7 auf MM-ClawBench und 56,2 auf SWE-Bench Pro.

OpenClawRadar
GuppyLM: Ein 9-Millionen-Parameter-LLM, das zu Bildungszwecken von Grund auf entwickelt wurde
Werkzeuge

GuppyLM: Ein 9-Millionen-Parameter-LLM, das zu Bildungszwecken von Grund auf entwickelt wurde

GuppyLM ist ein Sprachmodell mit ~9M Parametern, das von Grund auf mit 60K synthetischen Gesprächen trainiert wurde. Es verwendet eine einfache Transformer-Architektur mit 6 Schichten, 384 versteckten Dimensionen und 6 Aufmerksamkeitsköpfen. Das Training dauert etwa 5 Minuten auf einer kostenlosen Colab T4 GPU, und es spricht mit einer Fisch-Persönlichkeit, die sich auf Wasser, Futter und Aquarienleben konzentriert.

OpenClawRadar