Sentinel AI de Homelab: Assistente de Monitoramento Autônomo com Integração LLM

O que Faz
O Homelab AI Sentinel recebe webhooks de monitoramento e os processa através de um LLM para gerar um diagnóstico em linguagem simples que inclui o que aconteceu, o que provavelmente causou o problema e o que verificar primeiro.
Principais Recursos
- Integração com IA: A integração com IA está contida em um único arquivo. Troque o provedor alterando apenas um arquivo, mantendo o restante da estrutura intacta.
- LLM Padrão: Vem com Gemini 2.5 Flash como padrão.
- Suporte a Inferência Local: Ollama e LM Studio funcionam imediatamente para inferência totalmente local, sem que nada saia da sua rede.
- Fontes de Alerta: Suporta 11 fontes de alerta, incluindo Uptime Kuma, Grafana, Prometheus, Zabbix e Docker Events.
- Plataformas de Notificação: Suporta 10 plataformas de notificação, incluindo Discord, Slack, Telegram, WhatsApp, Signal e Ntfy.
- Compatibilidade com API: Funciona com qualquer endpoint compatível com OpenAI — se ele entender a API, funciona.
Configuração
A implantação é feita via docker compose up. A ferramenta está disponível no GitHub.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

OpenClaw Guild: Servidor de agente de IA multiusuário para equipes
O OpenClaw Guild estende o OpenClaw de usuário único para um servidor de IA multiusuário com controle de acesso baseado em função, dados isolados por agente e um sistema de memória de 4 níveis. Inclui um painel de administração web e implantação via Docker-compose para configuração em 15 minutos.

Backend Personalizado do llama.cpp Descarrega Multiplicação de Matrizes LLM para NPU AMD XDNA2 no Ryzen AI MAX 385
Um desenvolvedor criou um backend personalizado para llama.cpp que despacha operações GEMM diretamente para o NPU AMD XDNA2 no Ryzen AI MAX 385 (Strix Halo), alcançando 43,7 t/s de decodificação com 0,947 J/tok usando o Meta-Llama-3.1-8B-Instruct Q4_K_M. O caminho de decodificação do NPU economiza cerca de 10W em comparação com apenas Vulkan, mantendo a mesma taxa de decodificação.

Claude 4.6 Opus Raciocínio Destilado para 14GB para Apple Silicon via Quantização MLX
Um desenvolvedor quantizou um modelo Qwen 3.5 27B destilado a partir de trajetórias de raciocínio do Claude 4.6 Opus, reduzindo-o de 55,6GB para 14GB usando MLX para Apple Silicon, alcançando ~16 tokens/seg em um M4 Pro enquanto mantém as capacidades de raciocínio analítico do modelo.

Servidor MCP do Pepper para Interação e Depuração do Simulador iOS
Pepper é um servidor MCP que injeta uma dylib em aplicativos do simulador iOS via DYLD_INSERT_LIBRARIES, permitindo interação em tempo real, leitura de tela, toque em botões, inspeção de variáveis e monitoramento de tráfego de rede através de uma ponte WebSocket.