Claude-Real-Video : Extraction d'images adaptée à la scène + transcription pour tout LLM

Claude-real-video (GitHub) est un outil CLI Python qui permet à n'importe quel LLM de vraiment « regarder » une vidéo en extrayant des images clés par scène et une transcription, le tout en local, sans téléchargement vers des services externes. Contrairement à l'échantillonnage à intervalle fixe (par exemple 1 image/s) qui sur-échantillonne les plans statiques et rate les coupures rapides, cet outil utilise la détection de changements de scène avec un plancher de densité pour capturer chaque changement visuel significatif tout en éliminant les quasi-doublons.
Fonctionnalités clés
- Détection de changement de scène avec sensibilité configurable (
--scene 0.30) - Déduplication par fenêtre glissante (
--dedup-window 4,--dedup-threshold 8%) — évite de renvoyer le même plan après un cutaway - Plancher de densité (
--fps-floor 1.0) garantit au moins une image toutes les N secondes - Limite maximale d'images :
--max-frames 150 - Transcription Whisper avec détection de langue (
--lang autoou spécifiezen,zh) - Prend en charge les URL (YouTube, Instagram, TikTok, etc.) via yt-dlp et les fichiers locaux
- Génère un dossier propre :
crv-out/frames/*.jpg,crv-out/transcript.txt,crv-out/MANIFEST.txt— insérez-les dans Claude, ChatGPT ou Gemini - Option pour générer un rapport visuel des décisions de conservation/suppression (
--report)
Installation
pip install claude-real-video # cœur (images + déduplication)
pip install "claude-real-video[whisper]" # + transcription audio
Prérequis système : ffmpeg (installez via brew install ffmpeg, sudo apt install ffmpeg ou winget install Gyan.FFmpeg).
Exemples d'utilisation
# Lien YouTube/Instagram
crv "https://www.youtube.com/watch?v=..."
Fichier local avec transcription en anglais
crv lecture.mp4 -o out --lang en
Images uniquement, sans transcription
crv clip.mp4 --no-transcribe
Avec fichier cookie pour contenu protégé par connexion
crv "https://..." --cookies cookies.txt
Comment ça fonctionne
L'outil utilise yt-dlp pour récupérer les vidéos à partir d'URL (avec cookies optionnels), puis ffmpeg pour extraire les images à chaque changement de scène, avec un plancher de densité. Un détecteur de quasi-doublons par fenêtre glissante élimine les plans répétés. L'audio est transcrit via l'interface en ligne de commande Whisper. Tout reste en local — aucun téléchargement vers un service cloud.
📖 Lire la source complète : HN AI Agents
👀 See Also

OpenClaw Compétence de Nettoyage pour la Gestion Automatisée des Systèmes et le Renforcement de la Sécurité
Un développeur a créé une compétence qui utilise Claude Code pour se connecter en SSH aux machines OpenClaw et durcir les configurations, notamment en mettant en place un sandbox, en améliorant l'hygiène du système d'exploitation et en renforçant la sécurité des canaux, tout en maintenant un dossier de projet avec des instructions d'audit dans CLAUDE.md.

Claude-rank : Plugin Claude Code pour les audits de visibilité dans la recherche IA
Claude-rank est un plugin Claude Code gratuit et une interface en ligne de commande qui audite les fondations techniques pour la visibilité dans les moteurs de recherche IA, gérant le SEO technique, l'évaluation de la citabilité IA, les vérifications de crawlabilité pour les robots IA et les corrections automatisées des problèmes de découvrabilité.

OpenEvol : Pipeline d'auto-amélioration hors ligne pour LLMs utilisant l'historique des conversations
OpenEvol v0.1.1 est un pipeline hors ligne qui extrait automatiquement l'historique des conversations d'IA pour créer des ensembles de données de fine-tuning sans étiquetage manuel. Il fonctionne initialement sur CPU et prend en charge cinq backends d'enseignants, y compris les API compatibles OpenAI et HuggingFace Transformers.

Claude Sleuth : Un flux de travail d'investigation en 56 tâches pour Claude AI
Claude Sleuth est un flux de travail d'investigation structuré pour Claude AI avec 6 phases et 56 tâches, incluant un stockage d'état persistant via Cloudflare D1 et des conventions de sortie standardisées comprenant des horodatages ISO 8601, des enregistrements d'entités POLE et le langage de probabilité ICD 203.