FOMOE Permite la Inferencia del Modelo Qwen3.5 de 397B en Hardware de Escritorio de $2,100

✍️ OpenClawRadar📅 Publicado: 29 de marzo de 2026🔗 Source
FOMOE Permite la Inferencia del Modelo Qwen3.5 de 397B en Hardware de Escritorio de $2,100
Ad

Qué resuelve FOMOE

Los grandes modelos Mixture of Experts (MoE) requieren cientos de GB de almacenamiento de pesos, típicamente en memoria flash como NVMe. Durante la inferencia, solo se necesita una pequeña fracción de los pesos, pero no se pueden predecir cuáles de antemano. Los patrones de acceso aleatorio hacen que las latencias de flash sean demasiado altas para una inferencia práctica en hardware de consumo.

Cómo funciona FOMOE

El sistema hace innecesarias la mayoría de las lecturas de pesos de expertos mediante varias técnicas:

  • Almacena los expertos más comunes en la memoria de la GPU (VRAM) con una caché de expertos rodante actualizada
  • Logra una tasa de aciertos del 60% en VRAM con inicio cálido, reduciendo las lecturas NVMe al 28% (12% servidas desde DRAM)
  • Utiliza arquitectura ping-pong de doble GPU para superponer la carga de pesos y el cómputo
  • Implementa Enrutamiento Consciente de la Caché (CAR): cuando dos expertos obtienen puntuaciones similares, el modelo elige el siguiente experto mejor puntuado que ya esté en la caché VRAM o DRAM dentro de un umbral aceptable
Ad

Resultados de rendimiento

  • Velocidad de inferencia de 5-9 tokens/segundo para el modelo de 397B parámetros de Qwen3.5
  • Lecturas NVMe reducidas al 7% con CAR habilitado
  • Solo un 3.5% de caída en perplejidad medido en wikitext
  • Requisitos de hardware: dos GPU de $500, 32GB de RAM, una unidad NVMe
  • Utiliza cuantización Q4_K_M

La implementación consiste en aproximadamente 15,000 líneas de código C/HIP impulsado por Claude con fuerte guía humana.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Envía agentes OpenClaw como participantes de reuniones con voz, chat y pantalla compartida
Herramientas

Envía agentes OpenClaw como participantes de reuniones con voz, chat y pantalla compartida

Una nueva habilidad permite que los agentes OpenClaw se unan a Google Meet, Teams y Zoom como participantes completos con voz (STT/TTS), chat, avatar de video y compartir pantalla.

OpenClawRadar
Mike: IA legal de código abierto con autoalojamiento y soporte multimodelo
Herramientas

Mike: IA legal de código abierto con autoalojamiento y soporte multimodelo

Mike es una alternativa de código abierto a Harvey y Legora, que ofrece chat de documentos, extracción tabular y plantillas de flujo de trabajo, todo autogestionable con tus propias claves API de Claude o Gemini.

OpenClawRadar
ClankerRank: Un Punto de Referencia para las Habilidades de Codificación Asistida por IA con Claude Haiku
Herramientas

ClankerRank: Un Punto de Referencia para las Habilidades de Codificación Asistida por IA con Claude Haiku

Un desarrollador creó ClankerRank para medir la competencia en programación asistida por IA utilizando el modelo Haiku 4.5 de Claude. La plataforma presenta los mismos errores a los usuarios, califica las respuestas con suites de pruebas ocultas y ha revelado brechas claras de habilidad entre cientos de participantes.

OpenClawRadar
KANBAII: Un Tablero Kanban Visual Construido con Claude Code para Desarrollo Asistido por IA
Herramientas

KANBAII: Un Tablero Kanban Visual Construido con Claude Code para Desarrollo Asistido por IA

Un desarrollador construyó KANBAII, una herramienta local de tablero kanban completamente con Claude Code durante dos meses. Proporciona gestión visual de tareas, planificación con IA y modos de ejecución paralela para flujos de trabajo de Claude Code.

OpenClawRadar