Construindo uma Recepcionista de IA para uma Oficina Mecânica: Pipeline RAG e Integração de Voz

Construindo o Pipeline RAG
O primeiro passo foi criar uma base de conhecimento precisa para evitar alucinações. O desenvolvedor extraiu as páginas de serviços e preços do site da oficina mecânica para arquivos markdown, criando uma base de conhecimento estruturada abrangendo 21+ documentos incluindo tipos de serviços, preços, prazos de entrega, horários, métodos de pagamento, políticas de cancelamento, informações de garantia, veículos de cortesia e marcas de carros especializadas.
Cada documento foi convertido em um vetor de 1024 dimensões usando Voyage AI (voyage-3-large) e armazenado no MongoDB Atlas junto com o texto original, com um índice Atlas Vector Search no campo de embedding.
Quando um cliente faz uma pergunta, a consulta é convertida em embedding usando o mesmo modelo Voyage AI e executada contra o índice Atlas Vector Search, retornando os 3 documentos semanticamente mais similares. Os documentos recuperados são passados como contexto para o Anthropic Claude (claude-sonnet-4-6) com uma instrução de sistema rigorosa: responda apenas com base na base de conhecimento, mantenha as respostas curtas e conversacionais, e se não souber — diga isso e ofereça-se para anotar uma mensagem.
Exemplo de resposta: "Quanto custa uma troca de óleo?" → "US$ 45 para convencional, US$ 75 para sintético. Inclui filtro de óleo, reposição de fluido e verificação da pressão dos pneus. Leva cerca de 30 minutos."
Conectando a uma Linha Telefônica Real
O desenvolvedor usou Vapi como plataforma de voz para lidar com a telefonia: adquirindo um número de telefone, conversão de fala em texto (via Deepgram), conversão de texto em fala (via ElevenLabs) e chamada de função em tempo real de volta ao servidor.
Um servidor webhook FastAPI foi construído com um endpoint /webhook. Quando um chamador faz uma pergunta, o Vapi envia uma solicitação de tool-calls para este endpoint com a consulta do chamador. O servidor encaminha isso para o pipeline RAG, obtém uma resposta do Claude e a envia de volta ao Vapi, que a lê em voz alta para o chamador.
Durante o desenvolvimento, o servidor é executado localmente na porta 8000 e é exposto usando Ngrok, que cria um túnel para uma URL HTTPS pública que é colada no painel do Vapi como o endpoint do webhook.
No painel do Vapi, o assistente foi configurado com uma saudação ("Olá, obrigado por ligar para a Dane's Motorsport, como posso ajudá-lo hoje?") e duas ferramentas: answerQuestion para respostas baseadas em RAG e saveCallback para coletar um nome e número quando uma pergunta não puder ser respondida.
O Vapi envia o histórico completo da conversa com cada solicitação, permitindo memória de conversação.
📖 Read the full source: HN AI Agents
👀 See Also

Limites Práticos de Estações de Trabalho de IA com Múltiplas GPUs: Lições de uma Configuração com 9× RTX 3090
Um desenvolvedor compartilha experiência executando 9 GPUs RTX 3090 para trabalho com IA, encontrando retornos decrescentes além de 6 GPUs e recomendando Proxmox para experimentação com LLMs. A RTX 3090 continua atraente a US$ 750 por 24GB de VRAM.

Fluxo de Trabalho de Teste de Gráficos Multiplataforma para Desenvolvimento Assistido por IA
Um desenvolvedor compartilha um fluxo de trabalho para testar código gráfico Windows D3D11/D3D12 em runners de CI Linux sem GPU, usando MinGW-w64, Wine, DXVK/VKD3D-Proton, Lavapipe e llvmpipe. A abordagem permite validação abrangente de código gerado por IA através de pipelines de CI.

Caso de Uso do OpenClaw: Construindo um Resumo Diário de Notícias Pessoal com IA
Um desenvolvedor compartilha sua configuração do OpenClaw para um resumo diário de notícias usando um cronjob com um prompt detalhado que especifica fontes de notícias, prioridades de interesse e formato de saída. O sistema busca feeds RSS de publicações holandesas confiáveis e entrega 5 histórias selecionadas todas as manhãs.

Construindo uma persona de CEO de IA para o mercado asiático da OpenClaw com pensamento chinês nativo
Um desenvolvedor criou a Eve, uma persona de CEO de IA projetada especificamente para os mercados de HK/TW/CN, abordando o problema de personas em inglês com tradução chinesa de baixa qualidade. A solução inclui três modos de voz separados, decaimento de memória específico para a Ásia, roteamento consciente da plataforma e monitoramento de concorrentes locais.