Karpathys Autoresearch-Projekt: KI-Agenten führen über Nacht LLM-Trainingsexperimente durch

Was Karpathys Autoresearch-Projekt macht
Andrej Karpathy hat ein winziges Repository namens "autoresearch" veröffentlicht, das das Konzept eines "KI-Forschers in der Schleife" demonstriert. Das System nutzt einen KI-Agenten, um über Nacht autonom LLM-Trainingsexperimente auf einer einzelnen GPU durchzuführen.
Wie es funktioniert
Der Agent folgt diesem Arbeitsablauf:
- Bearbeitet kontinuierlich die Datei
train.py - Führt 5-minütige Nanochat-Trainingsexperimente durch
- Prüft, ob sich die Validierungs-Bits-pro-Byte-Metrik (
val_bpb) verbessert hat - Wiederholt diesen Zyklus, während Sie schlafen
Einrichtung und Konfiguration
Das Projekt hat einen super-minimalen Aufbau:
- Hardware: Eine GPU
- Dateien: Eine Hauptdatei
- Metriken: Eine primäre Metrik (
val_bpb)
Der Mensch schreibt die Forschungsorganisationsaufforderung in program.md, und der Agent übernimmt die Code-Iteration.
Experimentdurchsatz
Mit einem festen Budget von 5 Minuten pro Experiment kann das System ungefähr 12 Experimente pro Stunde durchführen.
Dieser Ansatz zeigt eine praktische Implementierung von automatisiertem Forschung, bei der KI-Agenten Parameterräume und Trainingskonfigurationen autonom erkunden können, was möglicherweise die Experimentierzyklen für Entwickler, die mit Sprachmodellen arbeiten, beschleunigt.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Wahre Kosten von KI-Codierungstools: 42 Stunden Overhead pro 60 Tage – Eine detaillierte Aufschlüsselung eines Solo-Entwicklers
Ein Solo-Entwickler hat 60 Tage lang jeden Dollar und jede Minute erfasst, die für KI-Codierungstools ausgegeben wurden. Abonnements (200 $/Monat) waren die geringsten Kosten; 42 Stunden Gemeinkosten durch schlechte Ergebnisse und Werkzeugwechsel waren die eigentliche Belastung. Der Nettoproduktivitätsgewinn betrug das 1,7- bis 2-fache, nicht das 10-fache. Überraschung: CodeRabbit, ein Überprüfungstool für 15 $/Monat, hatte den höchsten ROI.

Entwickler baut KI/ML-Jobportal mit Claude Code für Design und SEO
Ein Entwickler hat MOAIJobs.com erstellt, eine kostenlose Website, die KI-/ML-Jobs von führenden Laboren und Unternehmen kuratiert, mit Filterung nach Kategorie, Standort und Gehalt. Das Design der Website und die technische SEO-Implementierung wurden von Claude Code basierend auf Referenzen und Erklärungen des Entwicklers übernommen.

TechDebtMCP v2.0.0: MCP-Server für die Analyse technischer Schulden in 14 Sprachen
TechDebtMCP v2.0.0 ist ein MCP-Server, der Claude mit Codebasen verbindet, um technische Schulden in 14 Programmiersprachen zu finden, zu messen und zu priorisieren, darunter JS/TS, Python, Java, Swift, Kotlin, Go, Rust, C/C++, C#, Ruby und PHP.

Brainstorm MCP Server ermöglicht es Claude, andere LLMs zu konsultieren, um bessere Antworten zu erhalten
Ein Entwickler hat einen MCP-Server erstellt, der es Claude Code ermöglicht, andere KI-Modelle wie GPT-5.2 und DeepSeek zu konsultieren, bevor es Antworten liefert. Die Modelle führen mehrstufige Debatten, in denen sie die Antworten der anderen lesen, widersprechen und ihre Positionen verfeinern, um zu besseren Lösungen zu gelangen.