Kurze-Leine-KI-Coding-Methode: Fable schlagen, indem man die Kontrolle behält

Greg Slepak, Maintainer sicherheitskritischer Software, destilliert über ein Jahr Forschung zu KI-Coding-Agenten in der Kurzleinenmethode. Sie richtet sich an erfahrene Entwickler, die die Produktivität durch KI steigern möchten, ohne Abstriche bei der Qualität zu machen – und behauptet, selbst ohne Spitzenmodelle bessere Ergebnisse als Fable 5 zu erzielen.
Das Kernproblem, das Slepak identifiziert: KI-Agenten geraten regelmäßig „außer Kontrolle“, produzieren hässlichen/ineffizienten Code oder erfordern YouTuber-artige Orchestrierungssysteme, die den Entwickler aus dem Loop nehmen. Seine Methode hält Sie bei jedem Schritt am Steuer.
Regeln der Kurzleinenmethode
- Planen Sie die Aufgabe, optional mit etwas wie
tasks skill, um große Aufgaben in Schritte zu zerlegen. - Nie den „YOLO“-Modus verwenden (auch bekannt als „gefährlich Berechtigungen überspringen“).
- Die KI arbeitet nur, während Sie zusehen – kein „Vibe-Coding“ während Sie Videospiele spielen.
- Verwenden Sie einen Coding-Agenten, der vor Änderungen einen Diff im Berechtigungsdialog anzeigt.
- Analysieren Sie jeden vorgeschlagenen Diff – verweigern Sie Berechtigungen, wenn die KI etwas tun will, das Sie nicht möchten.
- Bleiben Sie im Loop, um ein aktuelles Verständnis der Codebasis zu bewahren.
- Greifen Sie häufig ein, um zu verhindern, dass die KI entgleist.
- Nach jeder Unteraufgabe committen, um die KI daran zu hindern, vorherige Arbeit zu löschen (Slepak hat Opus dabei erlebt).
KI-Reviews
Slepak empfiehlt, die KI als Linter für PR-Reviews zu behandeln. Die KI fängt häufige Fehler, der Mensch fängt Probleme auf hoher Ebene. Beide zusammen übertreffen jeden allein. Die KI benötigt ausreichend Kontext (Issue, PR-Beschreibung).
Er merkt auch an, dass er eigene KI-Review-Tools gebaut hat, die so gut sind wie milliardenschwere Systeme, und einen Fork des Agenten namens Crush pflegt.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

vLLM-Einrichtung und -Tests auf einem 10x-NVIDIA-V100-Server mit 320 GB VRAM
Ein Anwalt, der einen lokalen KI-Server für juristische Arbeiten aufbaut, teilt vLLM-Testergebnisse auf 10x Tesla V100 SXM2 32GB GPUs mit und erläutert, was funktioniert (FP16 unquantisiert, bitsandbytes 4-Bit) und was nicht (GPTQ, AWQ, FlashAttention2) auf der Volta-Architektur.

Qwen3.6-35B-A3B mit ~190K Kontext auf 8 GB VRAM + 32 GB RAM ausführen – Einrichtung und Benchmarks
Ein Reddit-Nutzer teilt eine funktionierende llama.cpp-Konfiguration für Qwen3.6-35B-A3B GGUF-Modelle auf einer RTX 4060 (8 GB VRAM) + 32 GB DDR5, die 37-51 tok/s bei 192k Kontext mit TurboQuant und spezifischen Flags erreicht.

Ihr LLM sollte nicht Ihr Codierungs-Agent-Workflow sein: Trennung der Zuständigkeiten in OpenClaw
Wenn Ihr Coding-Agent-Workflow stoppt, sobald Ihr LLM-Limit erreicht ist, übernimmt das LLM zu viel. Halten Sie Warteschlangen, Zustand, Wiederholungen und Verifikation deterministisch – rufen Sie das LLM nur für Urteilsvermögen auf.

So forscht man Anthropic-API-Guthaben über den Router von Manifest beansprucht und erweitert
Ein Reddit-Beitrag beschreibt Schritte, um bis zu 200 US-Dollar kostenlose Anthropic-API-Guthaben zu beanspruchen und den Router von Manifest so zu konfigurieren, dass Anfragen automatisch zu günstigeren Modellen wie Haiku für einfache Aufgaben weitergeleitet werden, wodurch sich die Lebensdauer des Guthabens von einem Monat auf mehrere Monate verlängert.