Construindo um servidor LLM local de $6,4k: Análise de TCO vs Custos de API

✍️ OpenClawRadar📅 Publicado: May 31, 2026🔗 Source
Construindo um servidor LLM local de $6,4k: Análise de TCO vs Custos de API
Ad

Um desenvolvedor no r/LocalLLaMA publicou uma análise de custos completa de seu servidor LLM local de $6.406,45, incluindo depreciação e eletricidade, comparando-o com preços de API. O servidor usa quatro GPUs AMD MI100 32GB usadas com llama.cpp rodando Qwen3.6 27B, processando 20,4M tokens de entrada e 1,32M tokens de saída por dia.

Especificações de Hardware

  • 4x MI100 32GB usados: $4.234,82
  • Placa-mãe ASRock EPYCD8-2T: $721,61
  • Fonte 1600W 80+ Platinum: $497,95
  • 8x8GB DDR4 ECC RDIMM (usados): $348,79
  • CPU EPYC 7K62 48-core (usado): $254,28
  • Cooler de CPU, gabinete, ventoinhas, cabos: ~$349
  • Total: $6.406,45
Ad

Comparação de Desempenho e Custos

A $0,29/M entrada e $3,2/M saída no OpenRouter para Qwen3.6 27B, o custo diário equivalente da API é $10,14, ou $3.701,10/ano. O servidor local produz os mesmos tokens com um custo diário de eletricidade de $2,11 (630W a $0,14/kWh), ou $770,15/ano.

Contabilizando a Depreciação

O autor usa um modelo de depreciação realista: acessórios com perda de 100%, peças novas com perda de 50%, peças usadas com perda de 10%. Isso resulta em um custo único de depreciação de hardware de $1.442,57, que é praticamente o mesmo se vendido após 1 dia ou 5 anos.

Após um ano, o custo local total = $770 (eletricidade) + $1.443 (depreciação) = $2.213, comparado a $3.701 da API — uma economia de $1.488.

Comparação com Planos de Codificação

Para contexto, o principal plano de codificação da Z.AI ($144/mês) oferece cerca de 4,5M entrada/200k saída tokens/dia do GLM 4.7, que normalizado para a mesma capacidade do servidor local custaria $652,80/mês ou $7.833,60/ano — mais que o dobro do preço do OpenRouter para o mesmo modelo.

O autor observa que planos de codificação nem sempre são um bom custo-benefício e aconselha verificar o que você está realmente pagando em tokens.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Comparação de Quatro Provedores de Hospedagem Gerenciada OpenClaw para 2026
Tools

Comparação de Quatro Provedores de Hospedagem Gerenciada OpenClaw para 2026

Um desenvolvedor testou quatro provedores de hospedagem gerenciada do OpenClaw ao longo de dois meses, classificando-os com base no tempo de configuração, tempo de atividade, confiabilidade de integração, roteamento de modelos, custo e capacidade de lidar com tarefas de múltiplas etapas. O LobsterTank custa US$ 2/mês com hospedagem básica de contêineres, o KiwiClaw é US$ 39/mês com melhor suporte, o xCloud é US$ 24/mês com tempo de atividade sólido e o RunLobster é US$ 49/mês com integração extensiva de ferramentas e preço fixo.

OpenClawRadar
SigMap v8.9: Camada de Contexto Determinística Reduz Uso de Tokens em 97% para Agentes de Codificação de IA
Tools

SigMap v8.9: Camada de Contexto Determinística Reduz Uso de Tokens em 97% para Agentes de Codificação de IA

SigMap v8.9 atinge redução de 97% no uso de tokens, 88% de precisão no hit@5 e 49% menos prompts por tarefa. Funciona com Copilot, Claude Code, Cursor, Windsurf, Codex, OpenCode, Gemini CLI. Zero dependências, totalmente offline.

OpenClawRadar
SpruceChat Executa LLM de 0.5B Localmente em Handhelds Miyoo via llama.cpp
Tools

SpruceChat Executa LLM de 0.5B Localmente em Handhelds Miyoo via llama.cpp

O SpruceChat executa o Qwen2.5-0.5B totalmente no dispositivo em consoles portáteis de jogos usando llama.cpp, sem necessidade de nuvem ou WiFi. Em um Miyoo A30 (quad-core Cortex-A7), ele carrega em ~60 segundos e gera a ~1-2 tokens/segundo.

OpenClawRadar
OpenClaw-superpowers adiciona recursos de confiabilidade para modos de falha operacionais.
Tools

OpenClaw-superpowers adiciona recursos de confiabilidade para modos de falha operacionais.

O repositório openclaw-superpowers foi expandido com oito novas habilidades focadas em confiabilidade, incluindo verificações prévias de implantação, prova de execução de cron, recuperação de redefinição de sessão e gerenciamento do ciclo de vida de autenticação MCP. Essas adições elevam o total para 60 habilidades, sendo 44 nativas do OpenClaw e 23 projetadas para agendamento cron.

OpenClawRadar