SpruceChat Executa LLM de 0.5B Localmente em Handhelds Miyoo via llama.cpp

O Que É Isso
O SpruceChat é um projeto que executa o modelo de linguagem Qwen2.5-0.5B totalmente no dispositivo em vários consoles portáteis de jogos usando llama.cpp. Ele não requer conexão com a nuvem ou WiFi após a configuração inicial.
Detalhes Principais
O modelo fica na RAM após a primeira inicialização, e os tokens são transmitidos um por um durante a geração. Ele roda no Miyoo A30, Miyoo Flip, Trimui Brick e Trimui Smart Pro.
Desempenho no Miyoo A30 (que possui um processador quad-core Cortex-A7):
- Carregamento do modelo: ~60 segundos na primeira inicialização
- Velocidade de geração: ~1-2 tokens por segundo
- Avaliação do prompt: ~3 tokens por segundo
O desenvolvedor observa que não é rápido, mas transmite para que você possa vê-lo pensar. Eles mencionam que dispositivos de 64 bits são mais rápidos.
A IA é descrita como tendo "a personalidade de um pinheiro: paciente, sem pressa, silenciosamente maravilhada com tudo".
Se o dispositivo estiver no WiFi, você também pode acessar o llama-server de um navegador em um telefone ou laptop para conversar com um teclado real.
O repositório está em https://github.com/RED-BASE/SpruceChat. O projeto foi construído com ajuda do Claude, e já há um colaborador trabalhando na expansão do suporte a dispositivos. O primeiro lançamento está disponível com binários armhf e aarch64, e o modelo está incluído.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Habilidade do Agente de Recursos Modernos do CSS: Impor Práticas Modernas de CSS em Agentes de Codificação de IA
Uma habilidade de agente que impõe mais de 57 recursos modernos de CSS entre cor, layout, seletores, animação, tipografia, posicionamento e padrões de componentes, compatível com Claude Code, Cursor, Windsurf, Codex, Cline e GitHub Copilot.

O plano de codificação mensal de US$ 10 da Alibaba oferece acesso de alto volume a múltiplos modelos de IA para usuários do OpenClaw.
Por US$ 10 por mês, o plano da Alibaba oferece acesso aos modelos Qwen3.5-Plus, Kimi-K2.5, GLM-5 e MiniMax-M2.5 com cotas de 1.200 solicitações a cada 5 horas, 9.000 por semana e 18.000 por mês.

uimax-mcp: Servidor MCP Gratuito para Revisão e Correção Automatizada de Código Frontend com Claude Code
uimax-mcp é um servidor MCP gratuito que automatiza a revisão e correção de código frontend usando o Claude Code. Com um único comando, ele captura screenshots, executa auditorias do Lighthouse e de acessibilidade, verifica antipadrões e gera correções automatizadas.
Memória Multi-Agente: Sistema de Memória Compartilhada de Código Aberto para Agentes de IA
Multi-Agent Memory é um projeto de código aberto que fornece um sistema de memória compartilhada para agentes de IA em diferentes máquinas, ferramentas e frameworks. Ele suporta quatro tipos distintos de memória com comportamentos específicos e inclui recursos como limpeza de credenciais, isolamento de agentes e consolidação de LLM.