Skalierung agentischen Programmierens auf 150+ PRs/Woche: Lehren aus 85.000 $ Tokens bei Lovable

✍️ OpenClawRadar📅 Veröffentlicht: 5. Juli 2026🔗 Source
Skalierung agentischen Programmierens auf 150+ PRs/Woche: Lehren aus 85.000 $ Tokens bei Lovable
Ad

Alexander Lebedev kam im Januar 2026 zu Lovable, kurz nach dem Boom der KI-Coding-Agenten. Bis Juni hatte er von einem einzelnen Entwickler mit ein paar Agenten, die 20–30 gemergte PRs pro Woche erstellten, auf einen Menschen skaliert, der 6–7 Agenten (jeder mit eigenem Subagenten-Schwarm) beaufsichtigt und über 150 gemergte PRs pro Woche liefert. Die Kosten: ~25.000 $/Monat im Mai, insgesamt ~85.000 $ für Tokens seit Januar. So hat er es gemacht – und was dabei schiefging.

Von 30 auf über 150 PRs/Woche: Die Architektur

Im Januar war der Prozess traditionell: Plan-Modus, Genehmigungsanfragen, klassisches menschliches Code-Review. Bis Juni hatte Lebedev einen eigenen Agenten entwickelt, der Aufgaben für andere Agenten schreibt, mit mehreren Ebenen von Implementierungs- und Review-Agenten. Große Änderungen werden nun als 10-PR-Stapel statt als einzelne PR ausgeliefert. Menschliche Reviews betreffen nur wichtige Entscheidungen, selten den Code selbst.

Wohin die Tokens fließen: 75% Implementierung, 25% Automatisierung

Der Großteil der 85.000 $ – etwa 75% – fließt direkt in die Implementierung (Code-Erstellung). Die restlichen 25% (und wachsend) finanzieren Automatisierung: KI-Reviews außerhalb der Entwicklungsumgebung, Post-Merge-KI-Reviews und routinemäßige automatisierte Aufgaben. Lebedev sagt voraus, dass der Anteil der Automatisierung weiter steigen wird, da mehr Arbeit aus dem Code-Erstellungs-PR-Zyklus ausgelagert wird.

Menschliches Review: Ausnahme, nicht Regel

Lebedev argumentiert, dass zeilenweise Reviews von KI-generiertem Code genauso unpraktisch sind wie das Reviewen von Compiler-Output nach dem Wechsel von Assembler zu höheren Sprachen. Stattdessen bleiben menschliche Reviews den wichtigsten Änderungen vorbehalten – meist nicht bei PRs, sondern auf RFC/ADR-Ebene: Systemdesign-Diskussionen, Whiteboard-Sessions, Infrastrukturentscheidungen. Eine einzige Designentscheidung kann größere Auswirkungen haben als 50 Implementierungs-PRs.

Der Nachteil: Code-Review war ein Lernwerkzeug und ein Mechanismus zur Wissensweitergabe. Die Engineering-Abteilung braucht jetzt neue Wege, um diese sekundären Effekte zu erhalten. Lebedev gibt zu: „Ich sehe noch keine guten Lösungen, nur Raum für neue Experimente.“

Ad

Änderungsrisikoklassifizierung: Das Sicherheitsnetz

Menschliche Reviews naiv zu umgehen, funktioniert im großen Maßstab nicht – besonders für Neueinsteiger, die nicht wissen, was sie nicht wissen. Lebedev baute einen KI-Workflow, der jede PR nach Risikostufe klassifiziert und bei hohem Risiko ein menschliches Review erzwingt. Der Klassifizierer verwendet:

  • Eine einzelne Markdown-Richtliniendatei, die vom Agenten gelesen wird und den PR-Diff sowie Metadaten inspiziert.
  • Klassifizierungsdimensionen: Größe, Risikostufe, Code-Besitz (gehört die Mehrheit des geänderten Codes zum Team des Autors?).
  • Hochrisikokategorien: Infrastruktur, Authentifizierung, große Diffs, Produktionsfunktionen.
  • Niedrigrisikobeispiel: Veröffentlichung eines Blogbeitrags.

Das Klassifizierungsergebnis wird an ein deterministisches Tool weitergegeben, das die Richtlinie über GitHub-Aktionen und Branch-Regelsets anwendet, um Merging zu erlauben oder zu verweigern.

Wichtige Erkenntnis

Agentisches Coding zu skalieren erfordert nicht nur mehr Agenten, sondern strukturelle Veränderungen: Aufgaben-generierende Agenten, PR-Stapelung, automatisierte Risikoklassifizierung und eine bewusste Verlagerung der menschlichen Aufmerksamkeit von zeilenweisen Reviews hin zu Entscheidungen auf Architekturebene. Die Token-Rechnung von 85.000 $ ist eine Investition, um zu beweisen, dass das Modell funktioniert – aber die schwierigen Probleme (Wissensaustausch, Onboarding) bleiben ungelöst.

📖 Vollständige Quelle lesen: HN AI Agents

Ad

👀 Siehe auch

Kostenloses OpenClaw Gateway mit lokalem LLM auf Oracle Cloud
Anleitungen

Kostenloses OpenClaw Gateway mit lokalem LLM auf Oracle Cloud

Ein Entwickler teilt mit, wie man OpenClaw Gateway mit einem lokalen Qwen3.5 27B A3B 4-Bit-LLM auf der kostenlosen Stufe von Oracle Cloud unter Verwendung einer VM.Standard.A2.Flex-Instanz mit 4 OCPUs, 24 GB RAM und 200 GB SSD betreibt, die über die QCAI-App ferngesteuert wird.

OpenClawRadar
Camoufox Cookie Injection: Reddit durchsuchen als du selbst während dein Agent arbeitet
Anleitungen

Camoufox Cookie Injection: Reddit durchsuchen als du selbst während dein Agent arbeitet

Detaillierte Anleitung zur Umgehung der Reddit-Bot-Erkennung durch Extrahieren von Firefox-Cookies und Injektion in Camoufox via Playwright.

OpenClaw community
Einen MCP-Server zur Selbstinstallation bringen: Drei Hosts, drei Mechanismen, Stolperfallen
Anleitungen

Einen MCP-Server zur Selbstinstallation bringen: Drei Hosts, drei Mechanismen, Stolperfallen

Ein tiefer Einblick in die programmatische Installation von MCP-Servern in VS Code, Cursor und Claude Code – inklusive APIs, Dateioperationen und Randfälle wie fehlerhaftes JSON, atomare Schreibvorgänge und idempotente Updates.

OpenClawRadar
Ausführen eines 1-Billionen-Parameter-LLM lokal auf einem AMD Ryzen AI Max+-Cluster
Anleitungen

Ausführen eines 1-Billionen-Parameter-LLM lokal auf einem AMD Ryzen AI Max+-Cluster

AMD demonstriert das Ausführen des Kimi K2.5 Open-Source-Modells (375 GB, 1 Billion Parameter) auf vier Framework Desktop-Systemen mit Ryzen AI Max+ 395 Prozessoren unter Verwendung von llama.cpp RPC. Die Anleitung behandelt TTM-Kernel-Modifikationen für 120 GB VRAM pro Knoten und bietet zwei Einrichtungsoptionen: vorgefertigte Lemonade SDK-Binärdateien oder manuelle ROCm 7.0.2-Installation.

OpenClawRadar