TREX: Greptiles AI-Code-Reviewer, der Ihren Code ausführt

Greptile hat TREX (Test, Run, Execute) veröffentlicht, eine Ausführungsebene, die Ihren Code während des KI-gestützten Code-Reviews ausführt. Anstatt nur Diffs zu lesen, führt TREX den geänderten Code tatsächlich aus und deckt Laufzeitfehler auf – UI-Regressionen, zustandsabhängige Logikfehler, Race Conditions – die die statische Analyse nicht erkennen kann.
Architektur: Orchestrator + Subagents pro Problem
Frühere Versionen versuchten separate Agents oder einen einzigen kombinierten Agenten. Beide scheiterten: Separate Agents duplizierten Arbeit ohne gemeinsamen Kontext; ein einzelner Agent war überfordert mit der Verwaltung von Setup, Screenshots und Tests. Die Lösung war ein Orchestrator-Agent (der Haupt-Greptile-Reviewer), der den Diff liest, verdächtige Probleme identifiziert und einen dedizierten TREX-Subagenten pro Problem startet, die alle parallel laufen. Jeder Subagent erbt den Kontext des Orchestrators und hat sein eigenes Kontextfenster, das auf seine spezifische Untersuchung zugeschnitten ist.
Beispiel: eine UI-Funktion hinter einer Authentifizierungssperre. Ein Subagent richtet autonom die Umgebung ein, kümmert sich um die Authentifizierung, schaltet Feature-Flags um und gibt einen Screenshot der gerenderten Funktion zurück.
Multimodale Artefakte vs. Aufzählungspunkte
Die erste TREX-Ausgabe bestand aus zusammenfassenden Aufzählungspunkten – aber Aufzählungspunkte erlaubten Halluzinationen (z. B. die Behauptung, ein Test sei bestanden, obwohl er es nicht war) und boten keine Möglichkeit zur Überprüfung. Die Lösung: Jeder TREX-Befund wird durch einen Satz multimodaler Artefakte untermauert: Screenshots, Ausführungsprotokolle, API-Traces und Ausführungsskripte. Jede Modalität erzählt einen Teil der Geschichte und ermöglicht es, genau nachzuvollziehen, was passiert ist. Das erste Artefakt, das das Team beeindruckte, war eine Video-Aufnahme einer Animationsänderung – die den tatsächlichen Laufzeiteffekt zeigt.
Was es erwischt
TREX zielt auf Fehler ab, die nicht in Code-Diffs auftauchen: Logikfehler, die bestimmte Zustandssequenzen erfordern, UI-Regressionen nach dem Seitenladen und Race Conditions, die echte Anfragen benötigen. Es generiert und führt Tests aus, aber der Fokus liegt auf dem Finden von Fehlern, nicht nur auf dem Schreiben von Tests. Der Subagent findet das Setup selbst heraus.
Wie Shlok Mehrotra, der Ingenieur hinter TREX, es ausdrückt: „Man kann den Diff perfekt lesen und diese Art von Fehlern dennoch völlig übersehen.“
📖 Lesen Sie die vollständige Quelle: HN AI Agents
👀 Siehe auch

Roost: Eine einzelne Go-Binär-Seitenleiste für Claude Code mit klickbarer Eingabehistorie, Dateibaum und Benachrichtigungen
Roost ist ein einzelnes Go-Binary, das Claude Code um eine webbasierte Seitenleiste erweitert: xterm.js-Terminal mit tmux im Hintergrund, Dateibaum, der Ihrem cd folgt, anklickbarer Verlauf aus ~/.claude/projects/*.jsonl und Push-Benachrichtigungen über den Stop-Hook von Claude Code. Läuft über SSH als Single-User-pro-Instanz; kein Build-Schritt im Frontend.

Slack-Nachrichtenformatierer: Repariere Claudes kaputtes Markdown in Slack
Ein Entwickler hat eine Fähigkeit erstellt, die von Claude generiertes Markdown in eine ordnungsgemäße Slack-Formatierung umwandelt. Damit werden Probleme gelöst, bei denen fettgedruckter Text als Sternchen angezeigt wird, Links roh erscheinen und Tabellen zerbrechen. Das Tool bietet sowohl eine Browser-Vorschau mit reichhaltigem HTML-Kopieren und Einfügen als auch API-Webhook-Unterstützung.

Open-Source-Browser-Tool zum Testen von MCP-Server ohne Installation
Ein Open-Source-Webtool namens MCP Playground ermöglicht es Entwicklern, MCP-Server direkt in ihrem Browser mithilfe von WebContainers, einer WASM Node.js-Laufzeitumgebung, zu testen. Es kann npm-basierte MCP-Server lokal ohne Backend-Installation ausführen und über URL mit entfernten Servern verbinden.

antirezs DS4: Ausführen von DeepSeek V4 Flash mit 1M Kontext auf Mac Metal und DGX
Redis-Erfinder Salvatore Sanfilippo hat DS4 veröffentlicht, ein Projekt, um DeepSeek V4 Flash mit einem 1M-Kontextfenster auf Mac Metal Hardware und DGX auszuführen, mit OpenAI/Anthropic-Endpunkten für agentische Codierungstools.