Lokale-First Filmzusammenfassungspipeline mit Whisper + CLIP + Ollama

✍️ OpenClawRadar📅 Veröffentlicht: 3. Mai 2026🔗 Source
Lokale-First Filmzusammenfassungspipeline mit Whisper + CLIP + Ollama
Ad

Ein Entwickler hat eine automatisierte Pipeline gebaut, die jeden Film in ein erzähltes Zusammenfassungsvideo verwandelt. Der Stack ist vollständig lokal: Whisper für die Transkription, CLIP für die Szenenzuordnung, Ollama (oder OpenAI/Gemini/Anthropic) für die Skripterstellung, Edge TTS für die Sprachausgabe und FFmpeg für das Rendern.

So funktioniert es

  • Eingabe: Einfach eine Filmdatei über eine einfache Web-Oberfläche hochladen.
  • Transkription: Whisper extrahiert Dialoge und Zeitstempel.
  • Szenenzuordnung: CLIP identifiziert visuelle Szenen, die zur Erzählung passen.
  • Skripterstellung: Ollama (oder ein beliebiger API-Anbieter) schreibt ein prägnantes Zusammenfassungsskript.
  • Sprachausgabe + Rendern: Edge TTS erzeugt die Erzählung, FFmpeg setzt alles zu einem finalen Video zusammen.

Der gesamte Prozess läuft lokal mit Ollama, aber Sie können auch entfernte LLM-APIs (OpenAI, Gemini, Anthropic) anschließen. Die Gesamtlaufzeit beträgt etwa 15 Minuten. Keine manuelle Bearbeitung erforderlich.

Ad

Für wen es gedacht ist

Entwickler, die automatisierte Videogenerierungs-Pipelines bauen, oder alle, die in großem Umfang Filmzusammenfassungen ohne Cloud-Abhängigkeiten produzieren möchten.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch