Construcción de un Servidor LLM Local de $6.4k: Desglose de TCO vs Costos de API

Un desarrollador en r/LocalLLaMA publicó un minucioso análisis de costos de su servidor local LLM de $6,406.45, incluyendo depreciación y electricidad, comparándolo con precios de API. El servidor utiliza cuatro GPU AMD MI100 de 32 GB usadas con llama.cpp ejecutando Qwen3.6 27B, procesando 20.4M tokens de entrada y 1.32M tokens de salida por día.
Especificaciones del hardware
- 4x MI100 32GB usadas: $4,234.82
- Placa base ASRock EPYCD8-2T: $721.61
- Fuente de poder 1600W 80+ Platinum: $497.95
- 8x8GB DDR4 ECC RDIMMs (usadas): $348.79
- CPU EPYC 7K62 48 núcleos (usada): $254.28
- Disipador, chasis, ventiladores, cables: ~$349
- Total: $6,406.45
Rendimiento y comparación de costos
A $0.29/M token de entrada y $3.2/M token de salida en OpenRouter para Qwen3.6 27B, el costo diario equivalente de API es $10.14, o $3,701.10/año. El servidor local produce los mismos tokens con un costo diario de electricidad de $2.11 (630W a $0.14/kWh), o $770.15/año.
Contabilización de la depreciación
El autor utiliza un modelo de depreciación realista: accesorios pérdida del 100%, piezas nuevas pérdida del 50%, piezas usadas pérdida del 10%. Esto produce un costo único de depreciación del hardware de $1,442.57, que es aproximadamente el mismo si se vende después de 1 día o 5 años.
Después de un año, el costo local total = $770 (electricidad) + $1,443 (depreciación) = $2,213, en comparación con $3,701 para API, un ahorro de $1,488.
Comparación con planes de codificación
Para contexto, el mejor plan de codificación de Z.AI ($144/mes) proporciona aproximadamente 4.5M tokens de entrada/200k tokens de salida al día de GLM 4.7, que normalizado a la misma capacidad que el servidor local costaría $652.80/mes o $7,833.60/año, más del doble que el precio de OpenRouter para el mismo modelo.
El autor señala que los planes de codificación no siempre son una buena relación calidad-precio, y aconseja verificar qué estás pagando realmente en tokens.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

El Sistema de Auto-Corrección Utiliza Claude Code Headless para Detectar y Corregir Errores en Producción.
Un desarrollador construyó un sistema automatizado de corrección de errores en producción utilizando Claude Code CLI en modo sin interfaz. El sistema detecta errores de los registros, crea espacios de trabajo git aislados para cada problema, solicita a Claude que escriba correcciones y requiere aprobación manual a través de Telegram antes de crear solicitudes de extracción.

Rails está construido para IA: Convenciones, eficiencia de tokens y resultados de benchmarks
Las convenciones de Rails les dan a los agentes de IA un mapa, reduciendo tokens y aumentando precisión. El benchmark muestra OPUS-5 con 92.1% de precisión, 47k tokens por ejecución.

ModelFitAI: Implementa Agentes de IA Sin Configuración de VPS, Desarrollado con Claude Code
ModelFitAI es una plataforma que permite a los desarrolladores desplegar agentes de IA directamente en su infraestructura, eliminando la configuración de VPS, la configuración de Docker y las sesiones SSH. Toda la plataforma fue construida usando Claude Code por un fundador en solitario.

Claude IDE Bridge: Herramienta WebSocket para Acceso en Tiempo Real al IDE
claude-ide-bridge es un puente WebSocket que conecta Claude Code directamente al estado interno del IDE, permitiendo diagnósticos en vivo, ir a definición, encontrar referencias, desplazamiento de tipos, apertura de archivos, gestión de puntos de interrupción y transmisión del estado del depurador.