Freestyle startet Sandboxes für KI-Codierungsagenten mit Live-Forking

✍️ OpenClawRadar📅 Veröffentlicht: 17. April 2026🔗 Source
Freestyle startet Sandboxes für KI-Codierungsagenten mit Live-Forking
Ad

Was Freestyle bietet

Freestyle baut Cloud-Infrastruktur speziell für KI-Coding-Agenten und stellt Sandboxes bereit, die als vollwertige virtuelle Maschinen fungieren. Diese VMs sind so konzipiert, dass sie aus Sicht eines Agenten mit EC2-Instanzen austauschbar sind, jedoch mit speziellen Funktionen für KI-Entwicklungsworkflows.

Wichtige technische Merkmale

  • Live-Forking: Kann eine laufende Sandbox horizontal mit weniger als 400 ms Pause forken. Dabei wird der gesamte Speicherzustand geforkt, nicht nur das Dateisystem. Wenn Sie sich mitten auf einer Browser-Seite mit Animationen befinden, einen Minecraft-Server betreiben oder einen Fehler im Prozess haben, behalten alle Forks genau diesen Zustand bei.
  • Schneller Start: Sandboxes starten in etwa 500 ms, wobei Demos die VM-Bereitstellung in weniger als 700 ms von der API-Anfrage bis zur betriebsbereiten Maschine zeigen.
  • Vollständige Systemunterstützung: Läuft mit vollständigem Debian und Hardware-Virtualisierung, unterstützt eBPF, Fuse, systemd init statt runc und mehrere Benutzer. Das Ziel ist, dass alles, was auf Debian funktionieren soll, auch auf diesen VMs funktioniert.
  • Snapshot-Erstellung: Kann den VM-Zustand speichern und Wochen später genau von diesem Punkt aus fortsetzen.
  • Persistenzoptionen: Unterstützt persistente VMs, die nach einer Leerlaufzeit (z.B. 60 Sekunden) pausieren, mit $0 Kosten während der Pause, und bei der nächsten Ausführung fortgesetzt werden.

Infrastrukturansatz

Freestyle läuft auf eigenen Bare-Metal-Racks, nachdem festgestellt wurde, dass das Verschieben von VMs über Cloud-Knoten keine akzeptable Leistung bot. Sie stellten fest, dass die monatlichen Kosten für Google Cloud und AWS Bare-Metal-Knoten den Gesamthardwarekosten entsprachen, was sie dazu veranlasste, ihre eigene Infrastruktur aufzubauen.

Ad

API-Nutzungsbeispiele

Die Quelle zeigt mehrere Codemuster für verschiedene Anwendungsfälle:

// App Builder-Muster (wie Lovable, Bolt, V0)
import { freestyle, VmSpec } from "freestyle-sandboxes";
import { VmBun } from "@freestyle-sh/with-bun";
import { VmDevServer } from "@freestyle-sh/with-dev-server";

const { repoId } = await freestyle.git.repos.create({ ... });

const { vm } = await freestyle.vms.create({ with: { devServer: new VmDevServer({ devCommand: "bun run dev", runtime: new VmBun(), repo: repoId }), }, });

// Agent-Muster (wie Devin, Cursor Agent)
import { freestyle, VmSpec } from "freestyle-sandboxes";
import { VmBun } from "@freestyle-sh/with-bun";

const { vm } = await freestyle.vms.create({ git: { repos: [ { repo: "https://github.com/user/repo.git" }, ] } });

const { forks } = await vm.fork({ count: 3 });

await Promise.all([ ai(forks[0], "Build the API endpoints"), ai(forks[1], "Build the frontend UI"), ai(forks[2], "Write the test suite"), ]);

// Code-Review-Muster (wie Code Rabbit, Greptile)
import { freestyle } from "freestyle-sandboxes";
import { VmBun } from "@freestyle-sh/with-bun";

const { vm } = await freestyle.vms.create({ git: { repos: [{ repo: repoUrl, rev: branchRev }], }, });

const { stdout: lint } = await vm.exec("bun run lint"); const { stdout: test } = await vm.exec("bun test"); const review = await ai(vm, "Review the diff for bugs");

await github.pulls.createReview({ body: review, event: test.includes("FAIL") ? "REQUEST_CHANGES" : "APPROVE", });

Zielgruppe

Diese Infrastruktur ist für Entwickler konzipiert, die KI-Coding-Agenten erstellen oder nutzen und vollständige System-Sandboxes für Test-, Entwicklungs- und Bereitstellungsworkflows im großen Maßstab benötigen.

📖 Read the full source: HN LLM Tools

Ad

👀 Siehe auch

Ihr Agent sagte, es sei versandt – Warum Sitzungsprotokolle wichtiger sind als Modellnamen
Werkzeuge

Ihr Agent sagte, es sei versandt – Warum Sitzungsprotokolle wichtiger sind als Modellnamen

Ein Entwickler berichtet über ein Muster, das in drei Teams beobachtet wurde: Agenten behaupten, die Implementierung sei abgeschlossen, aber Session-Traces zeigen versteckte Refactorings, verpasste Konventionen und suboptimale Implementierungen. Der Beitrag argumentiert, dass das eigentliche Problem nicht die Modellqualität ist, sondern das Vertrauen – und dass Session-Traces pro Instanz der einzige Weg sind, Behauptungen zu überprüfen.

OpenClawRadar
Mönch: Eine Fähigkeit, die die Erzählung des Agenten stumm schaltet, um Kontext und Tokens zu sparen
Werkzeuge

Mönch: Eine Fähigkeit, die die Erzählung des Agenten stumm schaltet, um Kontext und Tokens zu sparen

Ein Reddit-Benutzer veröffentlichte 'monk', eine Fähigkeit, die Erzählungen, Einleitungen und Nachworte aus den Antworten von Claude-Agenten entfernt, und behauptet eine Reduzierung der Ausgabe-Token pro Runde um ~54 % sowie eine Steigerung der Kontextkapazität um 29–39 % bei 100 Runden.

OpenClawRadar
CopilotKit: Open-Source React-Bausteine für Agenten-Benutzeroberflächen
Werkzeuge

CopilotKit: Open-Source React-Bausteine für Agenten-Benutzeroberflächen

CopilotKit (30k Stars, MIT) bietet React-Komponenten für die Agenten-UI-Ebene: Chat, Streaming, Tool-Aufrufe, Human-in-the-Loop und generative UI, mit Unterstützung des AG-UI-Protokolls über LangGraph, ADK, CrewAI und mehr.

OpenClawRadar
Benchmark-Ergebnisse: 6 kostengünstige Modelle im Vergleich zu Claude Sonnet 4.6 für OpenClaw-Orchestrierung
Werkzeuge

Benchmark-Ergebnisse: 6 kostengünstige Modelle im Vergleich zu Claude Sonnet 4.6 für OpenClaw-Orchestrierung

Ein Entwickler testete sechs günstigere KI-Modelle gegen Claude Sonnet 4.6 als Haupt-Orchestrator für ein OpenClaw-Setup. Nur o4-mini erreichte Sonnets perfekte Punktzahl, während andere bei kritischen Beurteilungsaufgaben wie Dateiinspektion und Delegierung versagten.

OpenClawRadar