FOMOE Permite la Inferencia del Modelo Qwen3.5 de 397B en Hardware de Escritorio de $2,100

✍️ OpenClawRadar📅 Publicado: 29 de marzo de 2026🔗 Source
FOMOE Permite la Inferencia del Modelo Qwen3.5 de 397B en Hardware de Escritorio de $2,100
Ad

Qué resuelve FOMOE

Los grandes modelos Mixture of Experts (MoE) requieren cientos de GB de almacenamiento de pesos, típicamente en memoria flash como NVMe. Durante la inferencia, solo se necesita una pequeña fracción de los pesos, pero no se pueden predecir cuáles de antemano. Los patrones de acceso aleatorio hacen que las latencias de flash sean demasiado altas para una inferencia práctica en hardware de consumo.

Cómo funciona FOMOE

El sistema hace innecesarias la mayoría de las lecturas de pesos de expertos mediante varias técnicas:

  • Almacena los expertos más comunes en la memoria de la GPU (VRAM) con una caché de expertos rodante actualizada
  • Logra una tasa de aciertos del 60% en VRAM con inicio cálido, reduciendo las lecturas NVMe al 28% (12% servidas desde DRAM)
  • Utiliza arquitectura ping-pong de doble GPU para superponer la carga de pesos y el cómputo
  • Implementa Enrutamiento Consciente de la Caché (CAR): cuando dos expertos obtienen puntuaciones similares, el modelo elige el siguiente experto mejor puntuado que ya esté en la caché VRAM o DRAM dentro de un umbral aceptable
Ad

Resultados de rendimiento

  • Velocidad de inferencia de 5-9 tokens/segundo para el modelo de 397B parámetros de Qwen3.5
  • Lecturas NVMe reducidas al 7% con CAR habilitado
  • Solo un 3.5% de caída en perplejidad medido en wikitext
  • Requisitos de hardware: dos GPU de $500, 32GB de RAM, una unidad NVMe
  • Utiliza cuantización Q4_K_M

La implementación consiste en aproximadamente 15,000 líneas de código C/HIP impulsado por Claude con fuerte guía humana.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

RepoLens: Empaquetador Interactivo de Código Local y Optimizador de Tokens (TUI/CLI) en Go
Herramientas

RepoLens: Empaquetador Interactivo de Código Local y Optimizador de Tokens (TUI/CLI) en Go

RepoLens es una herramienta Go sin dependencias que empaqueta repositorios para contexto LLM con explorador de archivos TUI, contador de tokens en vivo, eliminación de comentarios, escáner de secretos y división basada en tokens. Ahorra un 17% de tokens.

OpenClawRadar
ClawProxy: Proxy de Enrutamiento de IA Autohospedado para Rotar Claves API de Nivel Gratuito
Herramientas

ClawProxy: Proxy de Enrutamiento de IA Autohospedado para Rotar Claves API de Nivel Gratuito

ClawProxy es un proxy de enrutamiento de IA autohospedado que gestiona múltiples claves de API de IA de nivel gratuito para evitar límites de tasa y sobrecargas de proveedores. Cuenta con rotación de claves en vuelo, balanceo de carga ponderado, traducción de modelos y un panel con registros analizados en profundidad.

OpenClawRadar
Por qué la salida de la interfaz de Claude Code se desvía y cómo una especificación estructurada lo soluciona
Herramientas

Por qué la salida de la interfaz de Claude Code se desvía y cómo una especificación estructurada lo soluciona

Un desarrollador explica que la salida inconsistente de UI de Claude Code no es un problema de prompt, sino de formato. Proporcionar códigos hex exactos, pesos de fuente, espaciado, estados de pantalla y transiciones elimina la deriva. También publicó como código abierto un servidor MCP que convierte grabaciones de pantalla en especificaciones estructuradas.

OpenClawRadar
Revisión del Rendimiento del Modelo OpenClaw: Codex 5.3 Lidera, los Modelos GLM Decepcionan
Herramientas

Revisión del Rendimiento del Modelo OpenClaw: Codex 5.3 Lidera, los Modelos GLM Decepcionan

Un desarrollador probó múltiples modelos de IA con OpenClaw, encontrando que Codex 5.3 rinde mejor con una calificación de 9/10, mientras que GLM 4.7 y GLM 5 obtuvieron 5/10 debido al alto uso de tokens, respuestas lentas y resultados inconsistentes.

OpenClawRadar