Ajuste Fino do Qwen 14B para Autocompletar do Discord

Um desenvolvedor compartilhou sua experiência sobre como ajustou o modelo Qwen 14B para funcionar como uma ferramenta de autocompletar usando suas mensagens do Discord. Esta configuração se assemelha bastante a ferramentas como o GitHub Copilot, onde sugestões são feitas enquanto você digita.
O desenvolvedor utilizou aproximadamente 250 conversas obtidas do Discord, através de uma ferramenta de scraping, como seu conjunto de dados. Cada conversa foi formatada como amostras de treinamento chat-ml, com foco particular em mensagens onde o usuário falou por último, sem blocos de código ou links. Esta escolha indica um foco no tom conversacional em vez de conteúdo técnico.
O modelo Qwen 14B foi ajustado usando a plataforma unsloth.ai e QLoRA em uma GPU do Kaggle, com todo o processo de treinamento durando aproximadamente 15 minutos devido ao pequeno tamanho do conjunto de dados. Eles então mesclaram o modelo ajustado em um formato .gguf para uso local via ollama.com.
A interface desta ferramenta de autocompletar é implementada como uma extensão do Chrome. Ela captura as últimas mensagens e a entrada em andamento do usuário para construir um prompt chat-ml com o contexto apropriado, que é então usado para gerar uma conclusão a partir do modelo fornecido pelo Ollama. Um caractere Unicode de largura zero é usado de forma inteligente para indicar onde a sugestão começa, enquanto pressionar shift+tab aceitará a sugestão.
A configuração atual está operacional no Discord, com possíveis expansões futuras para suportar outros sites. O desenvolvedor também sugere experimentar com diferentes tamanhos de modelo, já que o modelo atual de 14B quase maximiza a memória disponível. Eles propõem que modelos de 4B ou 8B podem ser alternativas viáveis, embora com possíveis limitações de dados.
O código-fonte e mais detalhes estão disponíveis no GitHub do desenvolvedor em github.com/b44ken/finetune.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Pipeline de Tradução de Livros Locais Utiliza Qwen 32B e Mistral 24B com RAG Contextual
Um desenvolvedor criou um pipeline de tradução de livros totalmente local e automatizado que converte arquivos PDF para o formato ePub usando oito scripts Python. O sistema aborda problemas comuns de tradução, como perda de contexto e problemas de formatação, por meio de um fluxo de trabalho em várias etapas.

Vellium adiciona animais de estimação de desktop e agentes inspirados em CLI para LLMs locais
Vellium, um aplicativo multiplataforma de código aberto para LLMs locais, agora oferece suporte a animais de estimação virtuais que flutuam sobre janelas e agentes com integração MCP, comandos de terminal e edição de arquivos.

Implante Artefatos de Design Claude em Sites ao Vivo com Teenyapp
Teenyapp fornece um serviço de hospedagem que o Claude Design pode usar diretamente do chat através de um link de token de agente, permitindo a implantação autônoma de artefatos com suporte de backend.

Servidor MCP DAUB Permite que Claude Gere e Renderize UIs via Especificações JSON
DAUB é um servidor MCP que permite ao Claude gerar interfaces de usuário diretamente a partir de prompts em linguagem natural, produzindo especificações JSON estruturadas que são renderizadas como interfaces ao vivo sem geração de código ou compilação. Ele expõe quatro ferramentas incluindo generate_ui, render_spec, validate_spec e get_component_catalog.