Claude-Real-Video: Szenenbewusste Bildauswahl + Transkript für jedes LLM

Claude-real-video (GitHub) ist ein Python-CLI-Tool, das jedem LLM ermöglicht, ein Video tatsächlich zu „sehen", indem es szenenbewusste, deduplizierte Frames und ein Transkript extrahiert – alles lokal, ohne Upload zu externen Diensten. Im Gegensatz zur festen Frame-Intervall-Abtastung (z. B. 1 fps), die statische Inhalte überabtastet und schnelle Schnitte verpasst, verwendet dieses Tool eine Szenenwechselerkennung plus eine Dichteuntergrenze, um jede bedeutungsvolle visuelle Änderung zu erfassen und gleichzeitig nahezu identische Frames zu verwerfen.
Hauptfunktionen
- Szenenwechselerkennung mit konfigurierbarer Empfindlichkeit (
--scene 0.30) - Sliding-Window-Deduplizierung (
--dedup-window 4,--dedup-threshold 8%) – vermeidet das erneute Senden derselben Einstellung nach einem Schnitt - Dichteuntergrenze (
--fps-floor 1.0) stellt sicher, dass mindestens ein Frame pro N Sekunden vorhanden ist - Hartes Limit für die Gesamtanzahl der Frames:
--max-frames 150 - Whisper-Transkription mit Spracherkennung (
--lang autooder Angabe vonen,zh) - Unterstützt URLs (YouTube, Instagram, TikTok, etc.) über yt-dlp und lokale Dateien
- Ausgabe in einem sauberen Ordner:
crv-out/frames/*.jpg,crv-out/transcript.txt,crv-out/MANIFEST.txt– diese können in Claude, ChatGPT oder Gemini eingefügt werden - Option zum Generieren eines visuellen Berichts über Entscheidungen zu behalten/verwerfen (
--report)
Installation
pip install claude-real-video # Kern (Frames + Dedup)
pip install "claude-real-video[whisper]" # + Audiotranskription
Systemvoraussetzung: ffmpeg (Installation via brew install ffmpeg, sudo apt install ffmpeg oder winget install Gyan.FFmpeg).
Anwendungsbeispiele
# YouTube/Instagram-Link
crv "https://www.youtube.com/watch?v=..."
Lokale Datei mit englischem Transkript
crv lecture.mp4 -o out --lang en
Nur Frames, kein Transkript
crv clip.mp4 --no-transcribe
Mit Cookie-Datei für login-geschützte Inhalte
crv "https://..." --cookies cookies.txt
So funktioniert es
Das Tool verwendet yt-dlp, um URL-basierte Videos abzurufen (mit optionalen Cookies), dann ffmpeg zur Extraktion von Frames bei jedem Szenenwechsel plus einer Dichteuntergrenze. Ein Sliding-Window-Near-Duplicate-Detektor entfernt wiederholte Einstellungen. Audio wird über die Whisper-CLI transkribiert. Alles bleibt lokal – kein Upload in die Cloud.
📖 Vollständigen Quellcode lesen: HN AI Agents
👀 Siehe auch

RepoLens: Interaktiver lokaler Codebase-Packer und Token-Optimierer (TUI/CLI) in Go
RepoLens ist ein Go-Tool ohne Abhängigkeiten, das Repos für LLM-Kontext packt, mit TUI-Dateiexplorer, Live-Token-Zähler, Kommentarentfernung, Secret-Scanner und tokenbasiertem Dateisplitting.

Fünf kostenlose Claude Desktop-Erweiterungen veröffentlicht: Inspector Lite, Graph Lite, Bible Code, Word Graph und Fun Pack
Ein Entwickler hat fünf lokale Claude Desktop-Erweiterungen quelloffen gemacht: Inspector Lite für semantische Codesuche, Graph Lite für ein persönliches Wissensnetz, Fun Pack für Unterhaltungsfunktionen, Word Graph für Bibelstudium und Bible Code für Mustererkennung. Alle laufen lokal ohne externe Abhängigkeiten oder zusätzliche API-Schlüssel.

Entwickler baut Rust-Kompressionsbibliothek mit Claude Opus 4.6, stellt Nützlichkeit infrage
Ein Entwickler nutzte Claude Opus 4.6 zwei Wochen lang, um eine Rust-Kompressionsbibliothek mit 15.800 Zeilen Code, 449 bestandenen Tests, Python-Bindings und einer C-FFI-Schicht zu erstellen, stellt jedoch in Frage, ob eine weitere Kompressionsbibliothek überhaupt nötig war.

Benutzerdefinierte llama.cpp-Backend verlagert LLM-Matrixmultiplikation auf AMD XDNA2 NPU in Ryzen AI MAX 385
Ein Entwickler hat ein benutzerdefiniertes llama.cpp-Backend erstellt, das GEMM-Operationen direkt an den AMD XDNA2 NPU auf Ryzen AI MAX 385 (Strix Halo) weiterleitet und dabei 43,7 t/s Dekodierung bei 0,947 J/tok mit Meta-Llama-3.1-8B-Instruct Q4_K_M erreicht. Der NPU-Dekodierungspfad spart im Vergleich zu reinem Vulkan etwa 10W, während der Dekodierungsdurchsatz gleich bleibt.