Construindo um servidor LLM local de $6,4k: Análise de TCO vs Custos de API

Um desenvolvedor no r/LocalLLaMA publicou uma análise de custos completa de seu servidor LLM local de $6.406,45, incluindo depreciação e eletricidade, comparando-o com preços de API. O servidor usa quatro GPUs AMD MI100 32GB usadas com llama.cpp rodando Qwen3.6 27B, processando 20,4M tokens de entrada e 1,32M tokens de saída por dia.
Especificações de Hardware
- 4x MI100 32GB usados: $4.234,82
- Placa-mãe ASRock EPYCD8-2T: $721,61
- Fonte 1600W 80+ Platinum: $497,95
- 8x8GB DDR4 ECC RDIMM (usados): $348,79
- CPU EPYC 7K62 48-core (usado): $254,28
- Cooler de CPU, gabinete, ventoinhas, cabos: ~$349
- Total: $6.406,45
Comparação de Desempenho e Custos
A $0,29/M entrada e $3,2/M saída no OpenRouter para Qwen3.6 27B, o custo diário equivalente da API é $10,14, ou $3.701,10/ano. O servidor local produz os mesmos tokens com um custo diário de eletricidade de $2,11 (630W a $0,14/kWh), ou $770,15/ano.
Contabilizando a Depreciação
O autor usa um modelo de depreciação realista: acessórios com perda de 100%, peças novas com perda de 50%, peças usadas com perda de 10%. Isso resulta em um custo único de depreciação de hardware de $1.442,57, que é praticamente o mesmo se vendido após 1 dia ou 5 anos.
Após um ano, o custo local total = $770 (eletricidade) + $1.443 (depreciação) = $2.213, comparado a $3.701 da API — uma economia de $1.488.
Comparação com Planos de Codificação
Para contexto, o principal plano de codificação da Z.AI ($144/mês) oferece cerca de 4,5M entrada/200k saída tokens/dia do GLM 4.7, que normalizado para a mesma capacidade do servidor local custaria $652,80/mês ou $7.833,60/ano — mais que o dobro do preço do OpenRouter para o mesmo modelo.
O autor observa que planos de codificação nem sempre são um bom custo-benefício e aconselha verificar o que você está realmente pagando em tokens.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Comparação de Quatro Provedores de Hospedagem Gerenciada OpenClaw para 2026
Um desenvolvedor testou quatro provedores de hospedagem gerenciada do OpenClaw ao longo de dois meses, classificando-os com base no tempo de configuração, tempo de atividade, confiabilidade de integração, roteamento de modelos, custo e capacidade de lidar com tarefas de múltiplas etapas. O LobsterTank custa US$ 2/mês com hospedagem básica de contêineres, o KiwiClaw é US$ 39/mês com melhor suporte, o xCloud é US$ 24/mês com tempo de atividade sólido e o RunLobster é US$ 49/mês com integração extensiva de ferramentas e preço fixo.

SigMap v8.9: Camada de Contexto Determinística Reduz Uso de Tokens em 97% para Agentes de Codificação de IA
SigMap v8.9 atinge redução de 97% no uso de tokens, 88% de precisão no hit@5 e 49% menos prompts por tarefa. Funciona com Copilot, Claude Code, Cursor, Windsurf, Codex, OpenCode, Gemini CLI. Zero dependências, totalmente offline.

SpruceChat Executa LLM de 0.5B Localmente em Handhelds Miyoo via llama.cpp
O SpruceChat executa o Qwen2.5-0.5B totalmente no dispositivo em consoles portáteis de jogos usando llama.cpp, sem necessidade de nuvem ou WiFi. Em um Miyoo A30 (quad-core Cortex-A7), ele carrega em ~60 segundos e gera a ~1-2 tokens/segundo.

OpenClaw-superpowers adiciona recursos de confiabilidade para modos de falha operacionais.
O repositório openclaw-superpowers foi expandido com oito novas habilidades focadas em confiabilidade, incluindo verificações prévias de implantação, prova de execução de cron, recuperação de redefinição de sessão e gerenciamento do ciclo de vida de autenticação MCP. Essas adições elevam o total para 60 habilidades, sendo 44 nativas do OpenClaw e 23 projetadas para agendamento cron.