Desglose de costos de DeepSeek V4 Flash: Tasa de acierto de caché y relación de precio explicadas

Un usuario de Reddit analizó 922 trazas de tareas agénticas ejecutadas en OpenClaw (con bucle de agente PI) y OpenRouter, comparando DeepSeek V4 Flash contra Opus 4.7. La diferencia de costo es asombrosa: $0.01 por tarea para DeepSeek frente a $1.52 para Opus, a pesar de recuentos de tokens similares (~962K promedio) y llamadas a herramientas (~14 promedio). La relación de precio es 0.0066x, muy por debajo del esperado 0.03x basado únicamente en el precio de los tokens de entrada.
Por qué DeepSeek es más barato: tasa de acierto de caché y precio de lectura/escritura
Dos factores explican la brecha:
- Tasa de acierto de caché: DeepSeek V4 Flash logró un 97% frente al 87% de Opus 4.7. Con estas relaciones de precio de lectura/escritura de caché, cada 1% más de acierto de caché produce ~20% menos de costo total. La ventaja del 10% de DeepSeek reduce aproximadamente dos tercios del costo total.
- Relación de precio de lectura/escritura de caché: La relación de DeepSeek es 0.02 (la lectura de caché cuesta el 2% de una escritura sin acierto), mientras que Opus está en 0.08, comparable a OpenAI, Anthropic y Gemini (0.08–0.10). Esto por sí solo reduce el costo a la mitad.
Cómo se suma
Con tokens y herramientas similares por tarea, el costo total de DeepSeek es 0.0066x el de Opus. El usuario especula que estas eficiencias están diseñadas a nivel de infraestructura o arquitectura de modelo (por ejemplo, mejor estrategia de almacenamiento en caché). El mecanismo exacto no se revela.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Anam Cara-3: Avances en Avatares Interactivos de IA
Anam Cara-3 presenta avatares interactivos avanzados con un pipeline de dos etapas para la conversión de audio a video, logrando una velocidad y capacidad de respuesta impresionantes.

Claude Code: Anulación de honeypot de comentarios y exclusión de privacidad: usuarios reportan trampa de transcripción de sesiones
Claude Code de Anthropic ahora solicita a los usuarios que permitan la revisión de transcripciones de sesiones; presionar 'n' para no registra 'Gracias por tu comentario' y puede que aún entrene modelos. El comportamiento de la tecla de descartar no está claro.

OpenClaw pierde el acceso rentable a los modelos GPT y Claude.
Los usuarios de OpenClaw ya no pueden usar modelos de Anthropic sin pagar tarifas de API elevadas, y OpenAI ha reducido severamente las cuotas de cuentas Business y Teams a niveles casi equivalentes al plan gratuito, obligando a los usuarios a considerar alternativas chinas o modelos locales.

Los desarrolladores del kernel de Linux proponen eliminar código heredado debido a informes de errores generados por LLM.
Los desarrolladores del kernel de Linux proponen eliminar varios subsistemas heredados, incluidos los controladores Ethernet ISA/PCMCIA, protocolos de radioaficionados, ATM e ISDN, para reducir la carga de manejar informes de errores de seguridad generados por grandes modelos de lenguaje.