GGUF-Modell-Zusammenführungs-Skript und Workflow für Qwen3.5-35B-Varianten

Ein Reddit-Nutzer hat ein Python-Skript und einen Arbeitsablauf zum Zusammenführen von GGUF-Modelldateien mit minimalem Verlust geteilt, der speziell auf Qwen3.5-35B-Varianten abzielt. Der Ansatz kombiniert zwei bestehende Modelle: HauhauCS' Qwen3.5-35B-A3B-Uncensored-HauhauCS-Aggressive und samuelcardillos Qwen3.5-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF.
Technische Details
Das zusammengeführte Modell ist als Q4_0-quantisierte Version bei Hugging Face verfügbar. Laut Quelle übertrifft samuelcardillos Feinabstimmung die Version von Jackrong für Qwen 3.5 35B.
Zusammenführungs-Workflow
Das Python-Skript (verfügbar auf Pastebin) wurde "vibecoded via Claude Opus 4.6" und unterstützt:
- Zusammenführung von GGUF-Dateien auf Google Colab Free Tier
- Quantisierung via llama-quantize
- Q4_K_M-Quantisierung für 35B-Modelle
- Q8-Quantisierung für 8B-Modelle
Der Autor merkt an, dass er aufgrund von Speicherplatzbeschränkungen auf Google Colab Free Tier keine Q8_0- oder F16-quantisierten Versionen erstellen kann, schlägt aber vor, dass andere das Skript via Claude Opus für diese Quantisierungen anpassen können.
Optimale Einstellungen
Für beste Leistung in LM Studio verwenden Sie diese Parameter:
Temperatur: 0.7
Top-K-Sampling: 20
Präsenzstrafe: 1.5
Top-P-Sampling: 0.8
Min-P-Sampling: 0
Seed: 3407 oder 42
Die Systemaufforderung (vollständige Version auf Pastebin) sollte diese erste Zeile enthalten: "Du bist Qwen, erstellt von Alibaba Cloud. Du bist ein hilfreicher Assistent." Der Autor stellt fest, dass das Modell ohne diese Zeile schlechter abschneidet.
📖 Source: r/LocalLLaMA
👀 Siehe auch
OpenClaw mit einem benutzerdefinierten LLM forken: Ein Leitfaden für lokale Einrichtung
Ein Reddit-Nutzer hat OpenClaw geforkt, um vollständig auf lokalen Modellen zu laufen und so einen vollständig angepassten 'JARVIS' ohne Cloud-Abhängigkeit zu schaffen. Der Prozess dauerte Minuten statt Stunden und läuft zwei Versionen parallel auf einem M2 Ultra.

RelayPlane Open Source Proxy zeigt 73 % Kostensenkung durch Claude-Modell-Routing
RelayPlane, ein Open-Source-npm-nativer Proxy für die Anthropic API, zeigte in Benchmarks 73,4 % Kosteneinsparungen, indem Anfragen basierend auf der Komplexität an geeignete Claude-Modelle weitergeleitet wurden. Das Tool reduzierte die Kosten pro 10 Anfragen von 0,0323 $ auf 0,0086 $ und verbesserte gleichzeitig die p50-Latenz von 1,55 s auf 0,78 s.

GAN-Fähigkeit für Claude Code: Adversarial KI-Tool zur Ideenverfeinerung
Eine Claude Code-Fähigkeit namens /gan nutzt gegnerische KI-Rollen, um Ideen durch abwechselnde Diskriminator- und Generator-Phasen zu kritisieren und zu verbessern, mit Funktionen wie Intensitätsmodi, mehrsprachiger Ausgabe und erzwungener Rollenauswahl, die durch Selbstiteration entwickelt wurden.

Kontext-Gateway: Ein Open-Source-Proxy zur Komprimierung von KI-Agenten-Kontext
Context Gateway ist ein Open-Source-Proxy, der zwischen Coding-Agenten und LLMs sitzt und Tool-Ausgaben komprimiert, bevor sie in das Kontextfenster gelangen. Es verwendet kleine Sprachmodelle, um Signale im Kontext zu erkennen, führt Hintergrundkomprimierung bei 85% Fensterkapazität durch und beinhaltet Ausgabenobergrenzen, ein Dashboard und Slack-Benachrichtigungen.