Karpathys Autoresearch-Projekt: KI-Agenten führen über Nacht LLM-Trainingsexperimente durch

Was Karpathys Autoresearch-Projekt macht
Andrej Karpathy hat ein winziges Repository namens "autoresearch" veröffentlicht, das das Konzept eines "KI-Forschers in der Schleife" demonstriert. Das System nutzt einen KI-Agenten, um über Nacht autonom LLM-Trainingsexperimente auf einer einzelnen GPU durchzuführen.
Wie es funktioniert
Der Agent folgt diesem Arbeitsablauf:
- Bearbeitet kontinuierlich die Datei
train.py - Führt 5-minütige Nanochat-Trainingsexperimente durch
- Prüft, ob sich die Validierungs-Bits-pro-Byte-Metrik (
val_bpb) verbessert hat - Wiederholt diesen Zyklus, während Sie schlafen
Einrichtung und Konfiguration
Das Projekt hat einen super-minimalen Aufbau:
- Hardware: Eine GPU
- Dateien: Eine Hauptdatei
- Metriken: Eine primäre Metrik (
val_bpb)
Der Mensch schreibt die Forschungsorganisationsaufforderung in program.md, und der Agent übernimmt die Code-Iteration.
Experimentdurchsatz
Mit einem festen Budget von 5 Minuten pro Experiment kann das System ungefähr 12 Experimente pro Stunde durchführen.
Dieser Ansatz zeigt eine praktische Implementierung von automatisiertem Forschung, bei der KI-Agenten Parameterräume und Trainingskonfigurationen autonom erkunden können, was möglicherweise die Experimentierzyklen für Entwickler, die mit Sprachmodellen arbeiten, beschleunigt.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Benchmark-Ergebnisse: Wann Claude Opus mit Codex gegenüber reinem Opus für Code-Generierung verwenden
Ein kontrollierter Benchmark testete den 'Planen mit Opus, Ausführen mit Codex'-Ansatz an drei realen Programmieraufgaben. Die Ergebnisse zeigen einen Kostenschwellenwert bei etwa 600 Codezeilen, mit spezifischen Empfehlungen basierend auf der Projektgröße.

DocMason: Lokale Agenten-Wissensdatenbank für komplexe Office-Dateien
DocMason ist eine Repo-native Agenten-App, die lokale Wissensdatenbanken aus komplexen Office-Dokumenten wie PPTX, DOCX, Excel und PDFs erstellt. Sie läuft vollständig innerhalb von Codex oder Claude Code, bewahrt die Dokumentenstruktur und liefert nachvollziehbare Antworten mit Herkunftsnachweis.

yburn: Tool zur Überprüfung und zum Ersetzen unnötiger KI-Agent-Cron-Jobs
yburn ist ein Python-Tool, das KI-Agenten-Cronjobs überprüft und solche, die keine LLMs benötigen, durch eigenständige Python-Skripte ersetzt. Der Ersteller stellte fest, dass 58 % von 98 Cronjobs rein mechanische Aufgaben wie Systemgesundheitsprüfungen und Git-Backups waren.

AgentPeek: Open-Source-Dashboard zur Überwachung von Claude-Code-Agent-Teams
AgentPeek ist ein lokales Dashboard, das sich in Claude Code einhakt, um Einblicke in Agententeams zu bieten, die Orchestrierungshierarchien, Ausführungsverläufe, Tokenkosten und Dateioperationen anzeigen. Die Installation erfordert das Klonen des GitHub-Repos und das Ausführen von pipx install.