GGUF-Modell-Zusammenführungs-Skript und Workflow für Qwen3.5-35B-Varianten

✍️ OpenClawRadar📅 Veröffentlicht: 1. April 2026🔗 Source
GGUF-Modell-Zusammenführungs-Skript und Workflow für Qwen3.5-35B-Varianten
Ad

Ein Reddit-Nutzer hat ein Python-Skript und einen Arbeitsablauf zum Zusammenführen von GGUF-Modelldateien mit minimalem Verlust geteilt, der speziell auf Qwen3.5-35B-Varianten abzielt. Der Ansatz kombiniert zwei bestehende Modelle: HauhauCS' Qwen3.5-35B-A3B-Uncensored-HauhauCS-Aggressive und samuelcardillos Qwen3.5-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF.

Technische Details

Das zusammengeführte Modell ist als Q4_0-quantisierte Version bei Hugging Face verfügbar. Laut Quelle übertrifft samuelcardillos Feinabstimmung die Version von Jackrong für Qwen 3.5 35B.

Zusammenführungs-Workflow

Das Python-Skript (verfügbar auf Pastebin) wurde "vibecoded via Claude Opus 4.6" und unterstützt:

  • Zusammenführung von GGUF-Dateien auf Google Colab Free Tier
  • Quantisierung via llama-quantize
  • Q4_K_M-Quantisierung für 35B-Modelle
  • Q8-Quantisierung für 8B-Modelle

Der Autor merkt an, dass er aufgrund von Speicherplatzbeschränkungen auf Google Colab Free Tier keine Q8_0- oder F16-quantisierten Versionen erstellen kann, schlägt aber vor, dass andere das Skript via Claude Opus für diese Quantisierungen anpassen können.

Ad

Optimale Einstellungen

Für beste Leistung in LM Studio verwenden Sie diese Parameter:

Temperatur: 0.7
Top-K-Sampling: 20
Präsenzstrafe: 1.5
Top-P-Sampling: 0.8
Min-P-Sampling: 0
Seed: 3407 oder 42

Die Systemaufforderung (vollständige Version auf Pastebin) sollte diese erste Zeile enthalten: "Du bist Qwen, erstellt von Alibaba Cloud. Du bist ein hilfreicher Assistent." Der Autor stellt fest, dass das Modell ohne diese Zeile schlechter abschneidet.

📖 Source: r/LocalLLaMA

Ad

👀 Siehe auch

🦀
Werkzeuge

OpenClaw mit einem benutzerdefinierten LLM forken: Ein Leitfaden für lokale Einrichtung

Ein Reddit-Nutzer hat OpenClaw geforkt, um vollständig auf lokalen Modellen zu laufen und so einen vollständig angepassten 'JARVIS' ohne Cloud-Abhängigkeit zu schaffen. Der Prozess dauerte Minuten statt Stunden und läuft zwei Versionen parallel auf einem M2 Ultra.

OpenClawRadar
RelayPlane Open Source Proxy zeigt 73 % Kostensenkung durch Claude-Modell-Routing
Werkzeuge

RelayPlane Open Source Proxy zeigt 73 % Kostensenkung durch Claude-Modell-Routing

RelayPlane, ein Open-Source-npm-nativer Proxy für die Anthropic API, zeigte in Benchmarks 73,4 % Kosteneinsparungen, indem Anfragen basierend auf der Komplexität an geeignete Claude-Modelle weitergeleitet wurden. Das Tool reduzierte die Kosten pro 10 Anfragen von 0,0323 $ auf 0,0086 $ und verbesserte gleichzeitig die p50-Latenz von 1,55 s auf 0,78 s.

OpenClawRadar
GAN-Fähigkeit für Claude Code: Adversarial KI-Tool zur Ideenverfeinerung
Werkzeuge

GAN-Fähigkeit für Claude Code: Adversarial KI-Tool zur Ideenverfeinerung

Eine Claude Code-Fähigkeit namens /gan nutzt gegnerische KI-Rollen, um Ideen durch abwechselnde Diskriminator- und Generator-Phasen zu kritisieren und zu verbessern, mit Funktionen wie Intensitätsmodi, mehrsprachiger Ausgabe und erzwungener Rollenauswahl, die durch Selbstiteration entwickelt wurden.

OpenClawRadar
Kontext-Gateway: Ein Open-Source-Proxy zur Komprimierung von KI-Agenten-Kontext
Werkzeuge

Kontext-Gateway: Ein Open-Source-Proxy zur Komprimierung von KI-Agenten-Kontext

Context Gateway ist ein Open-Source-Proxy, der zwischen Coding-Agenten und LLMs sitzt und Tool-Ausgaben komprimiert, bevor sie in das Kontextfenster gelangen. Es verwendet kleine Sprachmodelle, um Signale im Kontext zu erkennen, führt Hintergrundkomprimierung bei 85% Fensterkapazität durch und beinhaltet Ausgabenobergrenzen, ein Dashboard und Slack-Benachrichtigungen.

OpenClawRadar