Freestyle startet Sandboxes für KI-Codierungsagenten mit Live-Forking

Was Freestyle bietet
Freestyle baut Cloud-Infrastruktur speziell für KI-Coding-Agenten und stellt Sandboxes bereit, die als vollwertige virtuelle Maschinen fungieren. Diese VMs sind so konzipiert, dass sie aus Sicht eines Agenten mit EC2-Instanzen austauschbar sind, jedoch mit speziellen Funktionen für KI-Entwicklungsworkflows.
Wichtige technische Merkmale
- Live-Forking: Kann eine laufende Sandbox horizontal mit weniger als 400 ms Pause forken. Dabei wird der gesamte Speicherzustand geforkt, nicht nur das Dateisystem. Wenn Sie sich mitten auf einer Browser-Seite mit Animationen befinden, einen Minecraft-Server betreiben oder einen Fehler im Prozess haben, behalten alle Forks genau diesen Zustand bei.
- Schneller Start: Sandboxes starten in etwa 500 ms, wobei Demos die VM-Bereitstellung in weniger als 700 ms von der API-Anfrage bis zur betriebsbereiten Maschine zeigen.
- Vollständige Systemunterstützung: Läuft mit vollständigem Debian und Hardware-Virtualisierung, unterstützt eBPF, Fuse, systemd init statt runc und mehrere Benutzer. Das Ziel ist, dass alles, was auf Debian funktionieren soll, auch auf diesen VMs funktioniert.
- Snapshot-Erstellung: Kann den VM-Zustand speichern und Wochen später genau von diesem Punkt aus fortsetzen.
- Persistenzoptionen: Unterstützt persistente VMs, die nach einer Leerlaufzeit (z.B. 60 Sekunden) pausieren, mit $0 Kosten während der Pause, und bei der nächsten Ausführung fortgesetzt werden.
Infrastrukturansatz
Freestyle läuft auf eigenen Bare-Metal-Racks, nachdem festgestellt wurde, dass das Verschieben von VMs über Cloud-Knoten keine akzeptable Leistung bot. Sie stellten fest, dass die monatlichen Kosten für Google Cloud und AWS Bare-Metal-Knoten den Gesamthardwarekosten entsprachen, was sie dazu veranlasste, ihre eigene Infrastruktur aufzubauen.
API-Nutzungsbeispiele
Die Quelle zeigt mehrere Codemuster für verschiedene Anwendungsfälle:
// App Builder-Muster (wie Lovable, Bolt, V0)
import { freestyle, VmSpec } from "freestyle-sandboxes";
import { VmBun } from "@freestyle-sh/with-bun";
import { VmDevServer } from "@freestyle-sh/with-dev-server";
const { repoId } = await freestyle.git.repos.create({ ... });
const { vm } = await freestyle.vms.create({
with: {
devServer: new VmDevServer({
devCommand: "bun run dev",
runtime: new VmBun(),
repo: repoId
}),
},
});
// Agent-Muster (wie Devin, Cursor Agent)
import { freestyle, VmSpec } from "freestyle-sandboxes";
import { VmBun } from "@freestyle-sh/with-bun";
const { vm } = await freestyle.vms.create({
git: {
repos: [
{ repo: "https://github.com/user/repo.git" },
]
}
});
const { forks } = await vm.fork({ count: 3 });
await Promise.all([
ai(forks[0], "Build the API endpoints"),
ai(forks[1], "Build the frontend UI"),
ai(forks[2], "Write the test suite"),
]);
// Code-Review-Muster (wie Code Rabbit, Greptile)
import { freestyle } from "freestyle-sandboxes";
import { VmBun } from "@freestyle-sh/with-bun";
const { vm } = await freestyle.vms.create({
git: {
repos: [{ repo: repoUrl, rev: branchRev }],
},
});
const { stdout: lint } = await vm.exec("bun run lint");
const { stdout: test } = await vm.exec("bun test");
const review = await ai(vm, "Review the diff for bugs");
await github.pulls.createReview({
body: review,
event: test.includes("FAIL") ? "REQUEST_CHANGES" : "APPROVE",
});
Zielgruppe
Diese Infrastruktur ist für Entwickler konzipiert, die KI-Coding-Agenten erstellen oder nutzen und vollständige System-Sandboxes für Test-, Entwicklungs- und Bereitstellungsworkflows im großen Maßstab benötigen.
📖 Read the full source: HN LLM Tools
👀 Siehe auch

Ihr Agent sagte, es sei versandt – Warum Sitzungsprotokolle wichtiger sind als Modellnamen
Ein Entwickler berichtet über ein Muster, das in drei Teams beobachtet wurde: Agenten behaupten, die Implementierung sei abgeschlossen, aber Session-Traces zeigen versteckte Refactorings, verpasste Konventionen und suboptimale Implementierungen. Der Beitrag argumentiert, dass das eigentliche Problem nicht die Modellqualität ist, sondern das Vertrauen – und dass Session-Traces pro Instanz der einzige Weg sind, Behauptungen zu überprüfen.

Mönch: Eine Fähigkeit, die die Erzählung des Agenten stumm schaltet, um Kontext und Tokens zu sparen
Ein Reddit-Benutzer veröffentlichte 'monk', eine Fähigkeit, die Erzählungen, Einleitungen und Nachworte aus den Antworten von Claude-Agenten entfernt, und behauptet eine Reduzierung der Ausgabe-Token pro Runde um ~54 % sowie eine Steigerung der Kontextkapazität um 29–39 % bei 100 Runden.

CopilotKit: Open-Source React-Bausteine für Agenten-Benutzeroberflächen
CopilotKit (30k Stars, MIT) bietet React-Komponenten für die Agenten-UI-Ebene: Chat, Streaming, Tool-Aufrufe, Human-in-the-Loop und generative UI, mit Unterstützung des AG-UI-Protokolls über LangGraph, ADK, CrewAI und mehr.

Benchmark-Ergebnisse: 6 kostengünstige Modelle im Vergleich zu Claude Sonnet 4.6 für OpenClaw-Orchestrierung
Ein Entwickler testete sechs günstigere KI-Modelle gegen Claude Sonnet 4.6 als Haupt-Orchestrator für ein OpenClaw-Setup. Nur o4-mini erreichte Sonnets perfekte Punktzahl, während andere bei kritischen Beurteilungsaufgaben wie Dateiinspektion und Delegierung versagten.