Comparación Actual de Costos de LLM: Deepseek, Qwen, MiniMax vs OpenAI

Desglose de Precios por Proveedor
Aquí está la comparación de costos actual entre los principales proveedores de LLM según un análisis reciente de Reddit. Todos los precios están en USD por 1 millón de tokens y se obtuvieron a partir de la fecha del análisis.
- Deepseek-V3.2: $0.26 entrada / $0.38 salida. Esto es aproximadamente 10 veces más económico que GPT-4, mientras ofrece lo que los puntos de referencia sugieren que es un rendimiento de clase GPT-5.
- Serie Qwen3.5: El modelo 27B cuesta $0.26 entrada / $2.60 salida, ofreciendo una calidad comparable a Claude a una fracción del costo. La serie proporciona flexibilidad que abarca desde 0.8B hasta 397TB de parámetros, con cada variante admitiendo ventanas de contexto de 262k ampliables a 1M+ y un modo de pensamiento incorporado.
- MiniMax-M2.5: $0.27 entrada / $0.95 salida. Destaca en flujos de trabajo de codificación con un 80.2% en SWE bench verificado, lo que lo hace excepcional para tareas de codificación agentica.
- OpenAI GPT-4.1: $2.00 entrada / $8.00 salida. Aunque ciertamente es capaz, la prima de precio es difícil de justificar para casos de uso de producción de alto volumen cuando las alternativas funcionan de manera comparable.
Contexto Técnico Clave
El análisis incluye puntajes LMSYS ELO cuando están disponibles, ya que la mayoría de los otros puntos de referencia parecen estar optimizados en este momento. La capacidad de la ventana de contexto se ha vuelto cada vez más importante, con la mayoría de los modelos actuales admitiendo 200k+ tokens como estándar, lo que cambia fundamentalmente cómo puedes estructurar aplicaciones en torno a documentos largos y conversaciones extendidas.
Para desarrolladores que utilizan agentes de codificación con IA, estas disparidades de precios son significativas al considerar los costos de implementación en producción. Los datos sugieren que las alternativas a modelos de precio premium como GPT-4 pueden ofrecer un rendimiento comparable a costos sustancialmente más bajos, particularmente para casos de uso de alto volumen.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Claude Code v2.1.191: /rewind, correcciones de CPU, mejoras de fiabilidad de MCP
Claude Code v2.1.191 añade /rewind para reanudar conversaciones borradas, reduce el uso de CPU en streaming un 37%, corrige la resurrección de agentes y mejora la fiabilidad de MCP con reintentos.

NVIDIA anuncia NemoClaw con funciones de seguridad OpenShell.
NVIDIA anunció NemoClaw en GTC, basándose en OpenClaw para añadir seguridad de nivel empresarial a través de OpenShell, que aplica barreras de privacidad y seguridad basadas en políticas para agentes de IA.
Qwen3 27B supera a Gemma 4 26B en uso real de herramientas para un pipeline local de video con IA
Un experimento local de pipeline de video con IA muestra que Qwen3 27B maneja la llamada a herramientas limpiamente, mientras que Gemma 4 26B se quedó atascada en bucles. También cubre Said Image Turbo para generación local de imágenes y la orquestación OpenCode alcanzando 174K de contexto.

Comparación de rendimiento entre Qwen3-30B-A3B y Qwen3.5-35B-A3B en RTX 5090
Una comparación directa de Qwen3-30B-A3B y Qwen3.5-35B-A3B en una RTX 5090 muestra que el modelo de 30B es un 35% más rápido en generación, mientras que el modelo 3.5 maneja mejor el contexto largo con escalado plano de tokens frente a la degradación del 21% del modelo de 30B.