Análisis de Precios de Modelos de OpenRouter e Inteligencia por Dólar

Comparación de Inteligencia y Precios de Modelos
Un desarrollador analizó los precios de la API de OpenRouter para 16 modelos de IA y calculó los valores de inteligencia por dólar para ayudar a seleccionar modelos para tareas específicas. La métrica de inteligencia combina siete puntos de referencia: Índice de Inteligencia de Análisis Artificial, Índice Agéntico, Índice de Codificación, Índice de Omnisciencia de Análisis Artificial (reescalado a 0-100), GPDval-AA, Terminal-Bench Hard y t2-Bench Telecom.
Hallazgos Clave
El análisis identificó varios modelos destacados:
- Mayor inteligencia: GPT-5.4 (58.8 de inteligencia, $2.50/M de tokens) y Gemini 3.1 Pro (58.6 de inteligencia, $2.00/M de tokens)
- Mejor valor: MiMo-V2-Flash (39.9 de inteligencia, $0.09/M de tokens, puntuación de valor 443)
- Modelos equilibrados: GLM-5, Kimi K2.5 y Gemini 3 Flash
Detalles y Capacidades de los Modelos
El conjunto de datos completo incluye:
- MiMo-V2-Flash: 39.9 de inteligencia, $0.09/M de tokens, valor 443, solo texto
- Step 3.5 Flash: 34.8 de inteligencia, $0.10/M de tokens, valor 348, tareas de texto rápido general
- Grok 4.1 Fast: 41.2 de inteligencia, $0.20/M de tokens, valor 205, ventana de contexto de 2M, enrutamiento y extracción de alta velocidad
- MiniMax M2.5: 40.3 de inteligencia, $0.27/M de tokens, valor 149, código abierto, excelente rendimiento en tareas de codificación real
- DeepSeek V3.2: 34.6 de inteligencia, $0.25/M de tokens, valor 138, fuertes capacidades de codificación y lógica, admite aciertos de caché de API
- Kimi K2.5: 45.8 de inteligencia, $0.45/M de tokens, valor 101, ventana de contexto de 262K, amplio conocimiento general
- Gemini 3 Flash: 47.7 de inteligencia, $0.50/M de tokens, valor 95, multimodal con soporte de entrada de audio
- GLM-4.7: 31.6 de inteligencia, $0.38/M de tokens, valor 83, generación de texto general
- Qwen 3.5: 41.1 de inteligencia, $0.60/M de tokens, valor 68, fuerte rendimiento general, propósito general
- GLM-5: 49.5 de inteligencia, $0.80/M de tokens, valor 61, ventana de contexto de 200K, conocimiento general
- Claude Haiku 4.5: 36.5 de inteligencia, $1.00/M de tokens, valor 36, rápido y económico, soporte de pensamiento extendido
- GPT-5.3: 55.9 de inteligencia, $1.75/M de tokens, valor 32, razonamiento general y procesamiento de texto
- GPT-5.2: 50.8 de inteligencia, $1.75/M de tokens, valor 29, excelente para tareas de codificación + agénticas
- Gemini 3.1 Pro: 58.6 de inteligencia, $2.00/M de tokens, valor 29, análisis multimodal, soporte de salida de imagen
- Grok 4.2 Beta: 49.6 de inteligencia, $2.00/M de tokens, valor 25, razonamiento pesado, amplia base de conocimientos
- GPT-5.4: 58.8 de inteligencia, $2.50/M de tokens, valor 24, niveles de contexto variables (<272K / >272K), razonamiento de primer nivel
- Claude Sonnet 4.6: 52.3 de inteligencia, $3.00/M de tokens, valor 17, modelo de trabajo, entrenado hasta enero de 2026
- Claude Opus 4.6: 51.9 de inteligencia, $5.00/M de tokens, valor 10, razonamiento de primer nivel, más fuerte para codificación e ingeniería de software
Observaciones Notables
El análisis señala que los modelos más inteligentes suelen tener peores puntuaciones de valor, pero esto puede no reflejar la eficiencia real. Por ejemplo, si Qwen 3.5 usa 500,000 tokens y 30 minutos para resolver un problema incorrectamente mientras que Sonnet lo resuelve correctamente en una décima parte del tiempo, Sonnet podría ser mejor valor a pesar de su puntuación más baja de inteligencia por dólar.
La ventana de contexto de 2M de Grok 4.1 le da un impulso de inteligencia que no aparecerá en la mayoría de los casos de uso. MiniMax 2.5 lo supera en todas las métricas excepto en la ventana de contexto.
GLM-5 marca el último modelo antes de una caída significativa en el valor (de 61 a 36 con Claude Haiku 4.5) y, según se informa, es casi tan inteligente como GPT-5.2.
📖 Read the full source: r/openclaw
👀 Ver también

Punto de referencia: Gemma4 12B frente a Qwen3 8B cuantizado en Mac Mini de 24GB
Un desarrollador probó Gemma4 12B contra Qwen3:8b-q4_K_M en una Mac Mini de 24GB usando dos indicaciones. Qwen3 procesó las indicaciones 4-5 veces más rápido, mientras que Gemma4 generó la salida ligeramente más rápido.

El formato WCY reduce la sobrecarga de tokens en LLM entre un 50 y 71% e incorpora marcadores estructurales de "no lo sé".
WCY (Observar → Computar → Producir) es un formato orientado a líneas que reduce la sobrecarga de tokens JSON en un 50-71% e introduce marcadores estructurales '?' para que los LLM indiquen incertidumbre durante el razonamiento. El formato no requiere ajuste fino—solo tres ejemplos de pocas muestras.

Sistema de Monitoreo de Comportamiento Local con Tubería MCP y Código Claude
Un desarrollador creó un sistema de monitoreo conductual local llamado BRAIN que rastrea cambios de aplicaciones, operaciones de archivos y sesiones de desarrollo, canalizando datos a través de un servidor MCP personalizado hacia Claude Code. El sistema funciona 100% localmente sin ninguna dependencia de la nube.

Jaula de Langosta: Entorno de Seguridad Dockerizado para Autoalojar OpenClaw en Raspberry Pi
Un desarrollador creó Lobster Cage, un entorno Docker Compose con acceso saliente restringido y enrutamiento basado en proxy para ejecutar OpenClaw de forma segura en una Raspberry Pi para experimentación.