Erstellung eines Discord-Katzenüberwachungsbots mit ESP32-S3, MiniClaw und multimodaler KI

Edge-Agent-Einrichtung zur Katzenüberwachung
Ein Entwickler hat einen Discord-Bot erstellt, der seine Katze mithilfe eines ESP32-S3 Sense als Edge-Agent überwacht. Das System macht Fotos oder nimmt Audio auf, wenn es über Discord-Erwähnungen ausgelöst wird, und sendet die Medien dann zur Analyse an ein multimodales LLM.
Hardware- und Software-Stack
Die Implementierung verwendet folgende Komponenten:
- Hardware: XIAO ESP32-S3 Sense (Vision-Version) – klein genug, um in einem Kratzbaum versteckt zu werden
- Kommunikation: Web-UI + WebSocket-Einrichtung für Latenzarmes Debugging
- KI-Modell: Zhipu AIs multimodales VLM-4V-Modell
- Plattform: Discord für die Bot-Interaktion
So funktioniert es
Der Ablauf ist einfach: Wenn jemand den Bot auf Discord @erwähnt, macht der ESP32-S3 entweder ein Foto oder nimmt Audio auf. Diese Medien werden an das VLM (Vision-Language Model) gesendet, das sie analysiert und natürliche Sprachbeschreibungen dessen zurückgibt, was passiert. Anstatt mit „Bewegung erkannt“-Spam überschüttet zu werden, erhalten die Nutzer spezifische Beschreibungen wie „Ihre Katze schläft auf dem Sofa“ oder „Die Katze spielt mit einem Spielzeug“.
Aktuelle Einschränkungen und Zukunftspläne
Der Entwickler hat mehrere Verbesserungsbereiche identifiziert:
- Bildqualität: Aktuelle Aufnahmen sind „ziemlich unscharf“ und „mittelmäßig“, aber funktionsfähig
- Feste Position: Das Gerät hat einen festen Blickwinkel – erwägt, Mobilität über Servobrackets oder Rover-Mechaniken hinzuzufügen
- Audio-Intelligenz: Plant, eine Vokalisierungsklassifizierung hinzuzufügen, um zwischen hungrigem Miauen, Zoomies oder allgemeinem Geschrei zu unterscheiden
Der Entwickler merkt an, dass die Implementierung „überraschend unkompliziert“ war und besser funktioniert als erwartet, wobei die VLM-Analyse trotz der unscharfen Bildqualität „überraschend treffsicher“ ist.
📖 Read the full source: r/openclaw
👀 Siehe auch

Praktische Lehren aus dem Aufbau eines 350.000-Zeilen-Codebases allein mit KI-Agenten
Ein Entwickler teilt konkrete Engineering-Erkenntnisse aus dem Aufbau einer 356.000-Zeilen-Produktionscodebasis in 52 Tagen mithilfe von KI-Agenten, einschließlich der Frage, wie die Codebasis-Struktur die Agentenausgabe beeinflusst und warum starke Typisierung unerlässlich ist.

Tanya: Ein auf OpenClaw basierender KI-Begleiter mit geschichtetem Gedächtnis und emotionalem Zustand
Tanya ist ein quelloffener KI-Begleiter, der auf OpenClaw basiert und auf Telegram läuft. Sie verfügt über zweischichtige Gedächtniskonsolidierung, dynamische emotionale Zustände und Sprachinteraktionen mit eingebetteten Ausdrucks-Tags. Das Projekt umfasst eine detaillierte SOUL.md-Charakteraufforderung und verarbeitet Textnachrichten, Sprachnachrichten, Anrufe und Bildaustausch.

OpenClaw-Benutzerberichte Workflow mit Minimax 2.7 für die Markdown-Bearbeitung
Ein Nutzer beschreibt die Nutzung von Minimax 2.7 über Openrouter als kostengünstigere Alternative zu Claude Cowork für Markdown-Recherche und -Verfassung, integriert mit OpenClaw, Telegram-Sprachnotizen, Obsidian und Syncthing für einen semi-live Bearbeitungs-Workflow.

Die Entkopplung der Erzählung von der Zustandsverfolgung behebt die Amnesie von KI-Textadventures.
Ein Entwickler hat eine zustandsbehaftete Simulations-Engine erstellt, bei der PostgreSQL den Spielzustand verfolgt und LLMs nur nach Zustandsänderungen narrativen Text generieren, wodurch Inventar-Halluzinationen und Handlungsverlust verhindert werden.