Cull: Open-Source Dataset Curation Engine für KI-Bildpipelines

Cull ist eine maschinelle Kuratierungs-Engine für KI-Bilddatensätze, entwickelt und gepflegt von u/Compunerd3. Sie automatisiert die gesamte Pipeline: Scraping, Klassifizierung, Beschriftung und Sortierung – und gibt einen Ordner mit priorisierten Bildern und SD-Prompts aus, die für LoRA- oder Feintuning-Training bereit sind.
End-to-End-Pipeline
- Scraping: Unterstützt Civitai (.com und .red), X/Twitter, Reddit, Discord und jede URL, die gallery-dl unterstützt – Pixiv, DeviantArt, Booru-Familie, ArtStation, Tumblr, FurAffinity/e621, Imgur, Flickr und etwa 340 weitere.
- Warteschlange: Jedes Bild plus Quell-Prompt wird in eine lokale Warteschlange eingereiht. Deduplizierung pro Quelle, keine Datenbank.
- Klassifizierung: Nutzt ein Vision-Language-Modell über mehrere LM Studio-Instanzen (lokal) oder Groq (Cloud) – jeder OpenAI-kompatible Endpunkt. Ein strenges 17-Feld-JSON-Schema gewährleistet strukturierte Ausgabe.
- Sortierung: Behaltene Bilder landen in Kategorie-Ordnern mit einer .txt-Prompt-Datei und einer .vision.json-Prüfdatei. Zwei Bewertungsschwellen (Qualität + Themenrelevanz) sind in der UI einstellbar.
- Dashboard: Flask + Alpine.js UI mit Start/Stopp, Quellschaltern, Galerie, Prompt-Editor, ZIP-Export und Quell-Statistiken.
Anwendungsfälle
Der Autor verwendete Cull für einen 300-Bilder-LoRA und einen 100.000-Bilder-Feintuning-Datensatz. Thema festlegen (z.B. "Female Influencer" oder {artist} style art), AUTO_CAPTION_ENABLED einschalten und laufen lassen. Für Archive ohne Prompts zeige man auf LOCAL_IMPORT_DIR einen Ordner mit JPEGs, schalte die Prompt-Anforderung aus und aktiviere die automatische Beschriftung – jedes Bild erhält einen SD-Prompt, Booru-Tags oder eine natürlichsprachliche Beschriftung.
Technische Details
- Vision-Worker austauschbar:
BaseVisionWorkerableiten, registrieren. Zwei LM Studio-Endpunkte laufen parallel; ein Keepalive-Worker pingt alle 15 Sekunden, um Leerlauf-Entladen zu vermeiden; optionaler Idle-Unloader gibt VRAM frei. - KI-Assistenten-Integration: Wird mit Claude Code Skill-Bundle in
.claude/skills/(cull-helper, lmstudio-vision, metadata-schema) und drei Sub-Agenten ausgeliefert – funktioniert mit Claude Code, Cursor, Aider, Codex. - Selbstaktualisierung: Toast im Dashboard, Klick auf Update, zieht von origin/main und startet neu.
- Stack: Python 3.10+, Flask, Alpine.js, Pillow, Playwright (X-Scraper), gallery-dl. Einzelne Maschine, kein Redis, keine DB, kein Docker.
- Lizenz: MIT.
Roadmap
Geplant: Weitere Vision-Worker-Backends, verbesserte Wiedereinreihungs-UI, kleine Headless-CLI, Video-Scraping und Klassifizierung.
Repository: https://github.com/tlennon-ie/cull | Screenshots: https://imgur.com/a/kSvsAW9
📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

Warum Codex für komplexe Python-Monolithen immer noch besser ist als Claude Code
Ein Senior-Entwickler vergleicht Codex mit Claude Code an einem Produktions-Python-Monolithen mit gemischten Architekturschichten. Codex gewinnt bei Backend-Arbeiten aufgrund besserer Planung, Code-Wiederverwendung und Einhaltung der Harness-Engineering-Prinzipien.

Lokale Qwen-Modelle erreichen Browser-Automatisierung mit schrittweiser Planung und kompakter DOM.
Ein Entwickler fand heraus, dass kleine lokale LLMs wie Qwen 8B und 4B bei der Browser-Automatisierung erfolgreich sind, indem sie schrittweise Planung anstelle von vorab erstellten Mehrschrittplänen verwenden, kombiniert mit einer kompakten semantischen DOM-Darstellung, die den Token-Verbrauch von 50-100K+ auf ~15K für vollständige Abläufe reduziert.

Toroidal Logit Bias: Einfacher Inferenz-Trick reduziert Halluzinationen um 40%
Eine neue Methode bildet Tokens auf einen Torus ab und verstaerkt nahe Logits, reduziert Fehler ohne Fine-Tuning oder RAG.

SlackClaw: Verwaltete OpenClaw-Instanz für Slack-Integration
SlackClaw ist ein kommerzielles Produkt, das auf OpenClaw aufbaut und eine verwaltete Instanz speziell für Slack bereitstellt. Es bietet Ein-Klick-Installation, OAuth-Tool-Verbindungen, dedizierte Server pro Workspace und persistenten Speicher.