Ajuste Fino do Qwen 14B para Autocompletar do Discord

Um desenvolvedor compartilhou sua experiência sobre como ajustou o modelo Qwen 14B para funcionar como uma ferramenta de autocompletar usando suas mensagens do Discord. Esta configuração se assemelha bastante a ferramentas como o GitHub Copilot, onde sugestões são feitas enquanto você digita.
O desenvolvedor utilizou aproximadamente 250 conversas obtidas do Discord, através de uma ferramenta de scraping, como seu conjunto de dados. Cada conversa foi formatada como amostras de treinamento chat-ml, com foco particular em mensagens onde o usuário falou por último, sem blocos de código ou links. Esta escolha indica um foco no tom conversacional em vez de conteúdo técnico.
O modelo Qwen 14B foi ajustado usando a plataforma unsloth.ai e QLoRA em uma GPU do Kaggle, com todo o processo de treinamento durando aproximadamente 15 minutos devido ao pequeno tamanho do conjunto de dados. Eles então mesclaram o modelo ajustado em um formato .gguf para uso local via ollama.com.
A interface desta ferramenta de autocompletar é implementada como uma extensão do Chrome. Ela captura as últimas mensagens e a entrada em andamento do usuário para construir um prompt chat-ml com o contexto apropriado, que é então usado para gerar uma conclusão a partir do modelo fornecido pelo Ollama. Um caractere Unicode de largura zero é usado de forma inteligente para indicar onde a sugestão começa, enquanto pressionar shift+tab aceitará a sugestão.
A configuração atual está operacional no Discord, com possíveis expansões futuras para suportar outros sites. O desenvolvedor também sugere experimentar com diferentes tamanhos de modelo, já que o modelo atual de 14B quase maximiza a memória disponível. Eles propõem que modelos de 4B ou 8B podem ser alternativas viáveis, embora com possíveis limitações de dados.
O código-fonte e mais detalhes estão disponíveis no GitHub do desenvolvedor em github.com/b44ken/finetune.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Sistema de Memória MCP Local com Consolidação para Conversas de IA
Um desenvolvedor criou um servidor MCP que fornece memória local persistente para clientes de IA, usando Qwen 2.5-7B para consolidar conversas em documentos de conhecimento estruturados a cada 6 horas. O sistema roda completamente no seu hardware com deduplicação semântica, pontuação adaptativa e busca vetorial FAISS.

Audacity MCP Server Dá ao Claude AI Controle Total de Edição de Áudio
Um desenvolvedor criou um servidor MCP que conecta o Claude AI ao Audacity via mod-script-pipe, fornecendo 99 ferramentas para comandos de edição de áudio em linguagem natural. A ferramenta de código aberto funciona com Claude Desktop, Claude Code ou Cursor.

Habilidades de Claude Code em Código Aberto: Um Pipeline /do que Reduziu Acompanhamentos em 80%
Um desenvolvedor disponibilizou como open-source 15 habilidades do Claude Code criadas em mais de 100 projetos freelance. O comando /do executa um pipeline de 5 etapas (/todo → /dev → /verify-dev → /build → /test → push) com loops de correção automática, resultando em 80% menos follow-ups e 60-65% melhor qualidade de código em mais de 2000 commits.

agentcontract v0.0.1: Uma Camada de Permissão JSON Portátil para Agentes de Codificação de IA
agentcontract v0.0.1 introduz uma camada de permissão JSON portátil para agentes de IA, com uma interface de navegador local para editar, validar e simular chamadas de ferramentas.