La Inferencia de IA es Obviamente Rentable: Desglosando la Economía

Sean Goedecke argumenta que la inferencia de IA es obviamente rentable, contrario a las afirmaciones de que está subsidiada por capital de riesgo. Desglosa las matemáticas y los precios de modelos abiertos para mostrar que servir LLMs puede ser un negocio sostenible.
Desglose de costos para un modelo denso de 70B
Usando cuatro GPUs Nvidia A100 (400W cada una, ~2M tokens/hora):
- Energía: ~13¢/hora a tarifas industriales, más ~13¢/hora de refrigeración → 26¢/hora en total
- Amortización de GPU: $20k por A100 en 5 años → $16k/año o $1.80/hora
- Total: aproximadamente $1 por millón de tokens de salida
OpenAI cobra $4.50 por millón de tokens con GPT-5.4-mini, y los modelos más potentes son de 3 a 6 veces más caros. Esto hace que el margen bruto del 70-80% sea plausible.
Los modelos abiertos confirman la rentabilidad
DeepSeek afirma un margen superior al 80% en inferencia de R1 mientras cobra menos de la mitad que OpenAI/Anthropic. Su API DeepSeek-V4-Pro cuesta alrededor de 87¢ por millón de tokens de salida, cerca del costo real, lo que sugiere que los márgenes para los modelos de frontera son aún mayores.
Por qué existen márgenes altos
Los laboratorios de IA como OpenAI y Anthropic necesitan las ganancias de inferencia para subsidiar los costos de entrenamiento, por lo que mantienen los precios de API altos. Pero un proveedor solo de inferencia, sin costos de entrenamiento, podría obtener ganancias incluso a precios más bajos. Incluso si los laboratorios de frontera quiebran, quien adquiera los derechos de sus modelos puede seguir vendiendo inferencia de manera rentable.
📖 Leer la fuente completa: HN AI Agents
👀 Ver también

Cuando el Código se Vuelve Barato, la Comprensión se Vuelve Cara
Markus Poppastring establece paralelismos entre la ola de subcontratación de los 2000 y la generación de código mediante IA actual: el costo pasa de escribir código a entenderlo, y con la IA, la intención puede no existir en ningún lado.
Claude Code v2.1.274 corrige los tiempos de espera de MCP, autorrepara transcripciones dañadas y añade control de espera de inicio
Claude Code v2.1.274 añade CLAUDE_CODE_MCP_STARTUP_WAIT_MS para limitar la espera del servidor MCP en el primer turno no interactivo, corrige las llamadas de herramientas HTTP Streamable que expiraban a los ~5 minutos y permite que las transcripciones corruptas se autorreparen.

Harmonic-9B: Ajuste fino en dos etapas de Qwen3.5-9B para agentes de IA
El desarrollador DJLougen ha lanzado Harmonic-9B, un ajuste fino de Qwen3.5-9B optimizado para uso de agentes con un enfoque de entrenamiento en dos etapas. La Etapa 1 (razonamiento intensivo) está completa, mientras que la Etapa 2 (llamadas a herramientas ligeras) aún está en entrenamiento. Ya están disponibles versiones cuantizadas GGUF.

DeepSeek, Qwen y Moonshot de China: modelos de IA asequibles amenazan el dominio de EE. UU.
Bloomberg informa que los modelos chinos de IA DeepSeek, Qwen y Moonshot están ganando terreno debido a sus menores costos, desafiando a los líderes estadounidenses en IA.