Karpathys Autoresearch-Projekt: KI-Agenten führen über Nacht LLM-Trainingsexperimente durch

✍️ OpenClawRadar📅 Veröffentlicht: 9. März 2026🔗 Source
Karpathys Autoresearch-Projekt: KI-Agenten führen über Nacht LLM-Trainingsexperimente durch
Ad

Was Karpathys Autoresearch-Projekt macht

Andrej Karpathy hat ein winziges Repository namens "autoresearch" veröffentlicht, das das Konzept eines "KI-Forschers in der Schleife" demonstriert. Das System nutzt einen KI-Agenten, um über Nacht autonom LLM-Trainingsexperimente auf einer einzelnen GPU durchzuführen.

Wie es funktioniert

Der Agent folgt diesem Arbeitsablauf:

  • Bearbeitet kontinuierlich die Datei train.py
  • Führt 5-minütige Nanochat-Trainingsexperimente durch
  • Prüft, ob sich die Validierungs-Bits-pro-Byte-Metrik (val_bpb) verbessert hat
  • Wiederholt diesen Zyklus, während Sie schlafen
Ad

Einrichtung und Konfiguration

Das Projekt hat einen super-minimalen Aufbau:

  • Hardware: Eine GPU
  • Dateien: Eine Hauptdatei
  • Metriken: Eine primäre Metrik (val_bpb)

Der Mensch schreibt die Forschungsorganisationsaufforderung in program.md, und der Agent übernimmt die Code-Iteration.

Experimentdurchsatz

Mit einem festen Budget von 5 Minuten pro Experiment kann das System ungefähr 12 Experimente pro Stunde durchführen.

Dieser Ansatz zeigt eine praktische Implementierung von automatisiertem Forschung, bei der KI-Agenten Parameterräume und Trainingskonfigurationen autonom erkunden können, was möglicherweise die Experimentierzyklen für Entwickler, die mit Sprachmodellen arbeiten, beschleunigt.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Benchmark-Ergebnisse: Wann Claude Opus mit Codex gegenüber reinem Opus für Code-Generierung verwenden
Werkzeuge

Benchmark-Ergebnisse: Wann Claude Opus mit Codex gegenüber reinem Opus für Code-Generierung verwenden

Ein kontrollierter Benchmark testete den 'Planen mit Opus, Ausführen mit Codex'-Ansatz an drei realen Programmieraufgaben. Die Ergebnisse zeigen einen Kostenschwellenwert bei etwa 600 Codezeilen, mit spezifischen Empfehlungen basierend auf der Projektgröße.

OpenClawRadar
DocMason: Lokale Agenten-Wissensdatenbank für komplexe Office-Dateien
Werkzeuge

DocMason: Lokale Agenten-Wissensdatenbank für komplexe Office-Dateien

DocMason ist eine Repo-native Agenten-App, die lokale Wissensdatenbanken aus komplexen Office-Dokumenten wie PPTX, DOCX, Excel und PDFs erstellt. Sie läuft vollständig innerhalb von Codex oder Claude Code, bewahrt die Dokumentenstruktur und liefert nachvollziehbare Antworten mit Herkunftsnachweis.

OpenClawRadar
yburn: Tool zur Überprüfung und zum Ersetzen unnötiger KI-Agent-Cron-Jobs
Werkzeuge

yburn: Tool zur Überprüfung und zum Ersetzen unnötiger KI-Agent-Cron-Jobs

yburn ist ein Python-Tool, das KI-Agenten-Cronjobs überprüft und solche, die keine LLMs benötigen, durch eigenständige Python-Skripte ersetzt. Der Ersteller stellte fest, dass 58 % von 98 Cronjobs rein mechanische Aufgaben wie Systemgesundheitsprüfungen und Git-Backups waren.

OpenClawRadar
AgentPeek: Open-Source-Dashboard zur Überwachung von Claude-Code-Agent-Teams
Werkzeuge

AgentPeek: Open-Source-Dashboard zur Überwachung von Claude-Code-Agent-Teams

AgentPeek ist ein lokales Dashboard, das sich in Claude Code einhakt, um Einblicke in Agententeams zu bieten, die Orchestrierungshierarchien, Ausführungsverläufe, Tokenkosten und Dateioperationen anzeigen. Die Installation erfordert das Klonen des GitHub-Repos und das Ausführen von pipx install.

OpenClawRadar