Pipeline de récapitulation de films locale utilisant Whisper + CLIP + Ollama

Un développeur a construit un pipeline automatisé qui transforme n'importe quel film en une vidéo de résumé narrée. La pile est entièrement locale : Whisper pour la transcription, CLIP pour l'appariement des scènes, Ollama (ou OpenAI/Gemini/Anthropic) pour la génération du script, Edge TTS pour la voix off, et FFmpeg pour le rendu.
Comment ça marche
- Entrée : Déposez n'importe quel fichier film via une interface web simple.
- Transcription : Whisper extrait les dialogues et les horodatages.
- Appariement des scènes : CLIP identifie les scènes visuelles qui correspondent au récit.
- Génération du script : Ollama (ou n'importe quel fournisseur d'API) écrit un script de résumé concis.
- Voix off et rendu : Edge TTS génère la narration, FFmpeg compose le tout en une vidéo finale.
L'ensemble du processus s'exécute localement avec Ollama, mais vous pouvez aussi brancher des API LLM distantes (OpenAI, Gemini, Anthropic). La durée totale est d'environ 15 minutes. Aucune édition manuelle requise.
Pour qui c'est fait
Les développeurs qui construisent des pipelines de génération vidéo automatisés ou toute personne souhaitant produire en série des résumés de films sans dépendances cloud.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Compétence d'Audit SEO OpenClaw Lancée pour l'Analyse Technique de Sites Web
Une nouvelle compétence OpenClaw effectue des audits SEO complets avec la commande 'seo audit [url]', vérifiant le SEO technique, la qualité du contenu, les éléments on-page, les données structurées, les métriques de performance, les images et la préparation à la recherche IA, produisant un score de santé et un plan d'action priorisé.

Manifest Ajoute des Plans de Jetons MiniMax avec Prise en Charge du Modèle M2.7
Manifest, une couche de routage open source pour OpenClaw, prend désormais en charge les forfaits de tokens MiniMax à partir de 10 $/mois. Le nouveau modèle MiniMax M2.7 est spécialement conçu pour les flux de travail OpenClaw et obtient 62,7 sur MM-ClawBench et 56,2 sur SWE-Bench Pro.

Remplacer Kafka, Redis et RabbitMQ par NATS : l'expérience d'un développeur
Un développeur a remplacé Kafka, Redis et RabbitMQ par NATS dans son architecture, partageant des détails d'implémentation spécifiques et les leçons tirées de la consolidation de plusieurs systèmes de messagerie en un seul outil.

Utiliser un LLM local comme sous-agent de code Claude pour réduire l'utilisation du contexte
Un utilisateur de Reddit démontre comment Claude Code peut déléguer des tâches à un LLM local fonctionnant via LM Studio, en gardant le contenu des fichiers hors du contexte de Claude. La configuration utilise un script Python d'environ 120 lignes avec l'API d'appel d'outils de LM Studio pour gérer les opérations sur fichiers localement.