Deterministische Compiler-Architektur für mehrstufige LLM-Workflows zeigt starke Benchmark-Ergebnisse

✍️ OpenClawRadar📅 Veröffentlicht: 11. März 2026🔗 Source
Deterministische Compiler-Architektur für mehrstufige LLM-Workflows zeigt starke Benchmark-Ergebnisse
Ad

Deterministische Kompilierung für LLM-Workflows

Ein Entwickler experimentiert mit einer deterministischen Kompilierungsarchitektur für strukturierte LLM-Workflows. Anstatt das Modell alles autoregressiv planen und ausführen zu lassen, kompiliert das System einen Workflow-Graphen vorab unter Verwendung typisierter Knotenregister, Parameterverträge und statischer Validierung.

Das Ziel ist es, die Fehlerakkumulation zu verhindern, die normalerweise in tieferen mehrstufigen Ketten auftritt. Dieser Ansatz stellt einen Wechsel von der rein autoregressiven Ausführung zu einem strukturierteren, vorab kompilierten Workflow-System dar.

Benchmark-Ergebnisse

Der Entwickler führte Benchmarks bei Workflow-Tiefen von 3-12+ Knoten durch und verglich sie mit Baseline-Prompting bei GPT-4.1 und Claude Sonnet 4.6:

  • 3-5 Knoten Workflows: Compiler: 1.00, GPT-4.1 Baseline: 0.76, Claude Sonnet 4.6: 0.60
  • 5-8 Knoten: Compiler: 1.00, GPT-4.1: 0.72, Claude: 0.46
  • 8-10 Knoten: Compiler: 0.88, GPT-4.1: 0.68, Claude: 0.54
  • 10+ Knoten: Compiler: 0.96, GPT-4.1: 0.76, Claude: 0.72

Die Compiler-Architektur hielt bis zu 8 Knoten eine perfekte Leistung aufrecht, zeigte nur eine geringfügige Verschlechterung bei 8-10 Knoten und erholte sich dann bei 10+ Knoten wieder auf nahezu perfekte Leistung. Im Gegensatz dazu zeigten sowohl GPT-4.1 als auch Claude eine konsistente Leistungsverschlechterung mit zunehmender Workflow-Tiefe.

Ad

Projektstatus

Das Paper wird bald auf arXiv erscheinen, aber die Projektseite wurde frühzeitig für diejenigen veröffentlicht, die sich für den Ansatz interessieren oder die Evaluation kritisieren möchten. Die Projektseite ist verfügbar unter: https://prnvh.github.io/compiler.html

Dieser Ansatz könnte besonders nützlich für Entwickler sein, die komplexe, mehrstufige KI-Workflows erstellen, bei denen die Fehlerakkumulation in traditionellen autoregressiven Ansätzen problematisch wird. Das deterministische Kompilierungsmodell bietet ein vorhersehbareres Verhalten und potenziell bessere Fehlerbehandlung in komplexen Ketten.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Schiffbauer: Ein Open-Source-Projektmanagement-Tool, entwickelt auf Claude Code
Werkzeuge

Schiffbauer: Ein Open-Source-Projektmanagement-Tool, entwickelt auf Claude Code

Shipwright ist ein Open-Source-Projektmanagement-Tool, das auf Claude Code läuft und über 44 Fähigkeiten, 7 spezialisierte Agenten und 16 Workflows verfügt. Es umfasst binäre Qualitätskontrollen und Wiederherstellungsleitfäden und wurde zur Überprüfung von Berechtigungsregistern und zur Bewertung von Automatisierungsplattformen eingesetzt, bevor die Entwicklungsarbeit begann.

OpenClawRadar
Entwickler testet Qwen3.5 27B im Vergleich zu größeren Modellen für lokale Programmieraufgaben
Werkzeuge

Entwickler testet Qwen3.5 27B im Vergleich zu größeren Modellen für lokale Programmieraufgaben

Ein Entwickler testete mehrere Qwen3.5- und Nemotron-Modelle und stellte fest, dass Qwen3.5-27B-GGUF:UD-Q6_K_XL für Entwicklungsaufgaben auf bestehender 2x RTX 3090-Hardware gut abschneidet, mit 803 pp und 25 tg/s bei 256k Kontext auf vast.ai.

OpenClawRadar
Vibe Remote: Mobiler Zugang zu Claude Code von überall
Werkzeuge

Vibe Remote: Mobiler Zugang zu Claude Code von überall

Vibe Remote ist eine mobile App, die Fernzugriff auf Claude Code-Entwicklungsumgebungen vom Telefon aus ermöglicht und es den Nutzern erlaubt, ihre lokalen Konfigurationen, Git-Verlauf und Dateistruktur beizubehalten, ohne Tailscale oder komplexe VPN-Einrichtungen zu benötigen.

OpenClawRadar
rawq: Lokales CLI-Tool für semantische KI-Agenten-Codesuche
Werkzeuge

rawq: Lokales CLI-Tool für semantische KI-Agenten-Codesuche

rawq ist ein Open-Source-CLI-Tool, das KI-Agenten hilft, relevanten Code mithilfe semantischer Suche mit einem 33 MB lokalen Modell über ONNX Runtime und lexikalischer BM25-Suche über tantivy zu finden. In Tests verbrauchten KI-Agenten, die rawq nutzten, 4x weniger Tokens und erledigten Aufgaben 2x schneller im Vergleich zu blinden read/grep-Tools.

OpenClawRadar