Qwen2-0.5B Ajustado para Automação de Tarefas Locais com llama.cpp

Um desenvolvedor ajustou o Qwen2-0.5B para automação de tarefas, criando um modelo que roda completamente localmente na CPU sem exigir GPU ou APIs em nuvem. O projeto, chamado ACE, está disponível no GitHub.
O Que Ele Faz
- Recebe tarefas em linguagem natural (ex.: "copiar logs para backup")
- Detecta o tipo de tarefa: atômica, repetitiva ou de esclarecimento
- Gera planos de execução compostos por comandos CLI e atalhos de teclado
- Roda completamente localmente na CPU (sem GPU, sem APIs em nuvem)
Detalhes Técnicos
- Modelo base: Qwen2-0.5B
- Treinamento: Ajuste fino com LoRA em aproximadamente 1000 exemplos de tarefas personalizadas
- Quantização: Formato GGUF Q4_K_M (tamanho do arquivo: 300MB)
- Inferência: llama.cpp
- Tempo de inferência: 3-10 segundos em processadores i3/i5
Principais Desafios Durante o Treinamento
- Qualidade dos dados: Teve que regenerar o conjunto de dados 2-3 vezes devido a exemplos ruins
- Sobreajuste: Foram necessárias várias iterações para estabilizar a perda de validação
- Tratamento do token EOS: O modelo não parava de gerar até que a configuração do tokenizer fosse corrigida
- Conversão GGUF: Exigiu dtype BF16 + quantização imatrix para obter saídas estáveis
Limitações (v0.1)
- Exige caminhos completos de arquivos (ainda não há busca inteligente de arquivos)
- Inferência apenas na CPU (mais lenta em hardware antigo)
- Execução básica (sem compreensão visual)
Benchmarks de Desempenho
- i5 (2018+) com SSD: 3-5 segundos
- i3 (2015+) com SSD: 5-10 segundos
- Hardware antigo (Pentium + HDD): 30-90 segundos
O desenvolvedor está buscando feedback sobre o desempenho em diferentes hardwares, casos extremos que quebram o modelo e solicitações de recursos para a v0.2.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Claude para Trabalho Criativo: Conectores MCP para Blender, Adobe, Ableton e Mais
A Anthropic lançou um conjunto de conectores MCP que permitem ao Claude interagir com ferramentas criativas como Blender, Autodesk Fusion, Adobe Creative Cloud, Ableton Live e Splice, possibilitando controle em linguagem natural, script e automação de pipelines.

Claude Sleuth: Um Fluxo de Trabalho de Investigação com 56 Tarefas para a Claude IA
Claude Sleuth é um fluxo de trabalho estruturado de investigação para a Claude AI com 6 fases e 56 tarefas, apresentando armazenamento de estado persistente via Cloudflare D1 e convenções de saída padronizadas incluindo timestamps ISO 8601, registros de entidades POLE e linguagem de probabilidade ICD 203.

Experiência do Usuário: Mudando do OpenClaw para o Agente Hermes em LLM Local
Um desenvolvedor relatou a mudança de OpenClaw para Hermes Agent usando Qwen3.5-9B em uma RX 9070 XT com 16 GB de VRAM. O Hermes completou uma tarefa complexa com 5 chamadas de ferramentas corretas, contra mais de 50 etapas do OpenClaw, executando 2:30 minutos mais rápido enquanto mantinha funcionalidades de RAG, chamada de ferramentas e memória persistente.

Noren AI: Ferramenta de Extração de Voz Identifica Padrões de Escrita a partir de Amostras
A Noren AI analisa de 5 a 10 amostras de escrita para gerar automaticamente um guia de voz baseado em padrões reais, correspondendo a 90% dos padrões identificados manualmente e descobrindo outros adicionais.