Agenten-Geschirr außerhalb der Sandbox: Dauerhafte Ausführung & Kaltstarts

In Mendrals Blog wird argumentiert, dass die Agenten-Harness – die Schleife, die ein LLM antreibt, indem sie Prompts sendet, Tool-Aufrufe ausführt und Ergebnisse zurückführt – außerhalb der Sandbox laufen sollte, insbesondere bei Multi-User-Agenten. Es werden zwei Architekturen gegenübergestellt und die drei Herausforderungen detailliert beschrieben, die bei der Einführung des Außenmodells gelöst wurden.
Zwei Architekturen
- Harness innerhalb der Sandbox: Die Schleife lebt im selben Container wie der Code, an dem sie arbeitet. Tool-Aufrufe (bash, read, write) werden lokal ausgeführt. Skills und Speicher sind Dateien im Dateisystem des Containers. So arbeitet Claude Code lokal. Einfaches Ausführungsmodell, aber Anmeldeinformationen befinden sich in der Sandbox, die Sandbox ist die Sitzung (Verlust der Sandbox bedeutet Verlust des Fortschritts), und Multi-User wird zu einem Problem mit verteilten Dateisystemen.
- Harness außerhalb der Sandbox: Die Schleife läuft auf dem Backend und greift über eine API auf eine Sandbox zu, um Tools auszuführen. Anmeldeinformationen bleiben außerhalb der Sandbox (kein Berechtigungsmodell erforderlich). Sandboxen können bei Inaktivität pausiert werden, werden zu Wegwerfobjekten (überleben Fehler), und die gemeinsame Nutzung durch mehrere Benutzer ist ein Problem einer gemeinsamen Datenbank, nicht eines verteilten Dateisystems.
Drei gelöste Herausforderungen
- Dauerhafte Ausführung: Agentensitzungen können Stunden dauern und müssen Deployments und Fehler überstehen. Mendral verwendet Inngest zum Setzen von Kontrollpunkten – jede Runde ist ein Schritt, und die Schleife setzt dort fort, wo sie aufgehört hat, falls der Server neu startet.
- Sandbox-Lebenszyklus mit niedrigen Kaltstarts: Die Schleife ist die meiste Zeit pausiert (z. B. während LLM-Aufrufen). Sie verwenden Blaxel, um Sandboxen in etwa 25 ms aus dem Standby zu reaktivieren, wodurch sekundenlange Kaltstarts bei interaktiven Runden vermieden werden.
- Dateisystem-Abstraktion: Da Harness und Sandbox auf verschiedenen Maschinen laufen, steht kein gemeinsames Dateisystem mehr zur Verfügung. Mendral erwähnt, dass dies behandelt werden musste, aber der Beitrag konzentriert sich auf die ersten beiden als die wichtigsten gelösten Probleme.
Der Beitrag schließt mit der Feststellung, dass das Außenmodell für Multi-User-Setups überlegen ist, trotz der Komplexität von dauerhafter Ausführung und Kaltstart-Handling.
📖 Read the full source: HN AI Agents
👀 Siehe auch

KI-Inferenz ist offensichtlich profitabel: Eine Analyse der Wirtschaftlichkeit
Anbieter von KI-Inferenz melden Bruttomargen von 70-80 %. Kostenschätzungen zeigen ~1 $ pro Million Tokens für ein 70B-Modell, während die API-Preise bei 4,50 $+ pro Million Tokens liegen.

Reddit-Benutzer schlägt Zeitstempelfunktion für Claude vor, um zeitliche Wahrnehmungslücke zu adressieren
Ein Reddit-Nutzer identifiziert Claudes mangelndes Zeitbewusstsein als Einschränkung für Produktivitätsanwendungsfälle und schlägt eine optionale Zeitstempelfunktion vor, die jede Antwort mit Datum und Uhrzeit versehen würde, die über Sitzungen hinweg bestehen bleibt.

Der Doppelstandard bei der KI-gestützten Erstellung: Programmieren vs. Schreiben
Eine Reddit-Diskussion hebt die unterschiedliche Aufnahme von KI-unterstütztem Programmieren (Vibe Coding) und KI-unterstütztem Schreiben hervor und stellt fest, dass die Arbeitsabläufe identisch sind, aber die kulturellen Wahrnehmungen unterschiedlich sind.

Die KI-Blase platzt; wir wissen es nur noch nicht.
Die Q2-Ergebnisse der großen Tech-Unternehmen zeigen wilde Aktienausschläge, schrumpfende Free Cashflows und massive KI-Capex. Der Podcast von The Register analysiert, was das für IT-Teams bedeutet.