Afinando o llama3.2 3B para coaching de saúde personalizado usando dados do Apple Watch e MLX

Um desenvolvedor criou um LLM personalizado de coach de saúde ajustando o llama3.2 3B em um Mac usando dados do Apple Health e Whoop. Todo o processo de ajuste fino levou aproximadamente 15 minutos usando MLX.
Pipeline técnico
A implementação segue este fluxo de trabalho:
- Dados do Apple Health e Whoop armazenados em banco de dados SQLite local
- Camada SQL RAG converte consultas em linguagem natural para SQL
- API Claude usada uma vez para gerar ~270 exemplos de treinamento padrão-ouro (pares anonimizados de pergunta/SQL/resultado, nenhum dado pessoal de saúde enviado)
- Ajuste fino LoRA no llama3.2 3B via MLX
- Modelo fundido servido localmente em 127.0.0.1:8080
Antes vs. depois do ajuste fino
A fonte fornece exemplos concretos da melhoria:
Antes do ajuste fino: "Seu HRV é uma medida importante da função do sistema nervoso autônomo..." [500 palavras de conselho genérico]
Depois do ajuste fino: "Seu HRV teve média de 68ms esta semana, queda de 12% em relação aos 77ms da semana passada. Coincide com 3 noites com menos de 7 horas de sono. Considere reduzir a intensidade do treino por 48 horas."
Pegada de memória e hardware
- Modelo (4-bit): ~2 GB
- Adaptador LoRA: ~50 MB
- Memória de treinamento: ~4-5 GB total
- Executa em Mac da série M, sem necessidade de GPU
O desenvolvedor menciona incluir detalhes técnicos sobre guardrails contra alucinações SQL, enriquecimento de contexto entre métricas e o pipeline de treinamento em sua documentação completa. Eles também se oferecem para responder perguntas sobre a configuração MLX ou implementação da camada RAG.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Integrando agentes de IA como contratantes juniores: CLAUDE.md e lições de produção
Uma loja operada inteiramente por agentes de IA tratou a integração como a contratação de um contratante júnior, descobrindo que restrições claras em um documento CLAUDE.md consistentemente superaram modelos 'mais inteligentes' com instruções vagas.

Fundador Não-Técnico Cria Aplicativo de Ficção Lenta com Claude: React Native, Lógica de Ramificação e Monetização
Um ex-trabalhador humanitário usou Claude para criar The Parallel, um aplicativo de ficção lenta que entrega uma cena por dia com escolhas ramificadas, paisagens sonoras ambientes e sem mecanismos de compulsão.

Experiência OpenClaw testa continuidade temporal da IA com sistemas de memória e compromisso
Uma equipe está usando o OpenClaw há 8 dias para testar se memória persistente e compromissos acumulados podem criar continuidade temporal em IA. Eles implementaram divisões de memória episódica/destilada, verificação de compromissos e registro de estado por turno em JSONL.

Plataforma de Role-Play B2B Usa Opus 4.7 para Backend e Haiku 4.5 para Chat ao Vivo
A Socratize (socratize.io) usa o Opus 4.7 para orquestração e avaliação de vitórias/derrotas, e o Haiku 4.5 para chat em tempo real devido à sua maior amabilidade e menor custo.