DeepSeek-V4-Flash macht LLM-Steuerung für lokale Modelle praktikabel

✍️ OpenClawRadar📅 Veröffentlicht: 16. Mai 2026🔗 Source
DeepSeek-V4-Flash macht LLM-Steuerung für lokale Modelle praktikabel
Ad

Der neueste Beitrag von Seen Goedecke argumentiert, dass DeepSeek-V4-Flash die Kalkulation für LLM-Steuerung verändert – die Technik, Modellaktivierungen während der Inferenz zu manipulieren, um Ausgaben zu lenken. Der Schlüsselfaktor ist DwarfStar, ein abgespeckter llama.cpp-Fork von antirez, der nur DeepSeek-V4-Flash ausführt und Steuerung als erstklassige Funktion integriert.

Was ist Steuerung?

Steuerung extrahiert ein Konzept (wie „antwort kurz“) aus den internen Aktivierungen des Modells. Eine Methode: Hundert Eingabeaufforderungen zweimal eingeben – einmal normal, einmal mit „antwort kurz“ ergänzt – dann die Aktivierungsmatrizen subtrahieren, um einen Steuerungsvektor zu erhalten. Diesen Vektor zu den Aktivierungen einer beliebigen Eingabe hinzufügen, und das Modell wird kurz angebunden. Ein fortgeschrittenerer Ansatz verwendet spärliche Autoencoder (wie die von Anthropic), um Merkmalsmuster zu lernen, allerdings zu höheren Kosten.

Ad

Warum es wichtig ist

Steuerung verspricht direkte Kontrolle über das Modellverhalten ohne Prompt-Engineering. Statt „Du MUSST“-Qualifikationen zu schreiben, hätte man einen Schieberegler für Prägnanz oder Gewissenhaftigkeit. Aus interpretatorischer Sicht ist es ebenfalls faszinierend – denken Sie an Golden Gate Claudes Fixierung, aber selbst einstellbar.

Warum nicht schon früher?

Steuerung war eine Idee der Mittelklasse: zu grob für große Labore (die trainieren das Modell einfach neu) und für API-Benutzer unzugänglich (kein Zugriff auf Gewichte oder Aktivierungen). Open-Weight-Modelle waren zu schwach, um sich damit zu befassen – bis DeepSeek-V4-Flash, das stark genug für agentisches Programmieren ist. Selbst dann übertrifft Prompting oft die Steuerung für einfache Eigenschaften wie Ausführlichkeit; der wahre Gewinn liegt in der Steuerung eines nicht durch Prompting erreichbaren Konzepts wie Intelligenz.

Goedecke plant, DwarfStar genau zu verfolgen. Zum Zeitpunkt des Schreibens ist die Steuerungsunterstützung rudimentär (nur ein Ausführlichkeits-Umschalter ähnlich dem Prompting), aber die Veröffentlichung liegt erst acht Tage zurück.

📖 Lesen Sie die vollständige Quelle: HN LLM Tools

Ad

👀 Siehe auch

Claude Code Postmortem: Drei Fehler führten zu Qualitätsminderung – jetzt behoben
Nachrichten

Claude Code Postmortem: Drei Fehler führten zu Qualitätsminderung – jetzt behoben

Anthropic führte die jüngsten Qualitätsbeschwerden zu Claude Code auf drei separate Änderungen zurück: Der standardmäßige Reasoning-Aufwand wurde gesenkt, ein Caching-Fehler ließ das Sitzungsgedächtnis fallen, und ein Prompt zur Reduzierung der Ausführlichkeit beeinträchtigte die Code-Qualität. Alle wurden zum 20. April (v2.1.116) behoben.

OpenClawRadar
Claude Pro Benutzer berichtet: 5-stündiges Nutzungsfenster durch eine einzige Eingabe verbraucht, keine Ausgabe
Nachrichten

Claude Pro Benutzer berichtet: 5-stündiges Nutzungsfenster durch eine einzige Eingabe verbraucht, keine Ausgabe

Ein Claude Pro-Benutzer berichtet, dass ein einziger Prompt sein gesamtes 5-Stunden-Nutzungsfenster verbraucht hat und nur Plantext ohne Ergebnis zurückgab. Der Vorfall verdeutlicht Probleme mit dem Token-Verbrauch während interner Überlegungen und fehlenden Sicherheitsvorkehrungen.

OpenClawRadar
Apple Core AI Framework: Erster Blick auf Apples aufkommende KI-Agentenbasis
Nachrichten

Apple Core AI Framework: Erster Blick auf Apples aufkommende KI-Agentenbasis

Apples neue Core AI Framework-Dokumentationsseite ist live, der Inhalt ist jedoch hinter einer JavaScript-Wand verborgen. Wir erklären, was dies für die KI-Agentenentwicklung auf Apple-Plattformen bedeutet.

OpenClawRadar
Anthropic kehrt Politik zu Drittanbieter-Agent-SDK und claude-p um, senkt effektiven Inferenzwert für Max-Abonnenten um das 25- bis 40-fache
Nachrichten

Anthropic kehrt Politik zu Drittanbieter-Agent-SDK und claude-p um, senkt effektiven Inferenzwert für Max-Abonnenten um das 25- bis 40-fache

Anthropic hat sein Verbot von Drittanbieter-Agenten, die Abonnement-Anmeldedaten verwenden, aufgehoben, jedoch wurden claude-p und das Agent SDK in einen separaten, nicht übertragbaren Guthabenpool verschoben, der zu API-Preisen abgerechnet wird, was den effektiven Inferenzwert für Max-Abonnenten um das 25- bis 40-fache reduziert.

OpenClawRadar