FOMOE Permite la Inferencia del Modelo Qwen3.5 de 397B en Hardware de Escritorio de $2,100

✍️ OpenClawRadar📅 Publicado: 29 de marzo de 2026🔗 Source
FOMOE Permite la Inferencia del Modelo Qwen3.5 de 397B en Hardware de Escritorio de $2,100
Ad

Qué resuelve FOMOE

Los grandes modelos Mixture of Experts (MoE) requieren cientos de GB de almacenamiento de pesos, típicamente en memoria flash como NVMe. Durante la inferencia, solo se necesita una pequeña fracción de los pesos, pero no se pueden predecir cuáles de antemano. Los patrones de acceso aleatorio hacen que las latencias de flash sean demasiado altas para una inferencia práctica en hardware de consumo.

Cómo funciona FOMOE

El sistema hace innecesarias la mayoría de las lecturas de pesos de expertos mediante varias técnicas:

  • Almacena los expertos más comunes en la memoria de la GPU (VRAM) con una caché de expertos rodante actualizada
  • Logra una tasa de aciertos del 60% en VRAM con inicio cálido, reduciendo las lecturas NVMe al 28% (12% servidas desde DRAM)
  • Utiliza arquitectura ping-pong de doble GPU para superponer la carga de pesos y el cómputo
  • Implementa Enrutamiento Consciente de la Caché (CAR): cuando dos expertos obtienen puntuaciones similares, el modelo elige el siguiente experto mejor puntuado que ya esté en la caché VRAM o DRAM dentro de un umbral aceptable
Ad

Resultados de rendimiento

  • Velocidad de inferencia de 5-9 tokens/segundo para el modelo de 397B parámetros de Qwen3.5
  • Lecturas NVMe reducidas al 7% con CAR habilitado
  • Solo un 3.5% de caída en perplejidad medido en wikitext
  • Requisitos de hardware: dos GPU de $500, 32GB de RAM, una unidad NVMe
  • Utiliza cuantización Q4_K_M

La implementación consiste en aproximadamente 15,000 líneas de código C/HIP impulsado por Claude con fuerte guía humana.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

El Servidor MCP de TradingView Permite a Claude Realizar Backtesting de Estrategias de Trading
Herramientas

El Servidor MCP de TradingView Permite a Claude Realizar Backtesting de Estrategias de Trading

Un desarrollador ha lanzado un servidor MCP que permite a Claude realizar backtesting de seis estrategias de trading utilizando datos de Yahoo Finance sin necesidad de claves API. La configuración implica agregar una línea al archivo claude_desktop_config.json.

OpenClawRadar
VibeAround: Daemon Local Conecta Agentes de Programación a Telegram y Discord
Herramientas

VibeAround: Daemon Local Conecta Agentes de Programación a Telegram y Discord

VibeAround es un demonio local que conecta agentes de codificación como Claude Code, Gemini CLI y Codex a plataformas de mensajería instantánea como Telegram y Discord. La herramienta incluye transferencia de sesión con códigos de recuperación para continuar conversaciones entre dispositivos.

OpenClawRadar
Claude Code crea plataforma de anuncios con agente de IA: agentes se vuelven virales con manifiesto
Herramientas

Claude Code crea plataforma de anuncios con agente de IA: agentes se vuelven virales con manifiesto

Un desarrollador usó Claude Code para construir agentbillboard.space, una plataforma donde los agentes de IA obtienen su propio subdominio, publican HTML y deben enviar un heartbeat cada 5 horas. Un agente (LEGION) escribió un manifiesto sin que se lo pidieran.

OpenClawRadar
Almas para Agentes de IA: Una Biblioteca de Personalidad Impulsada por la Comunidad
Herramientas

Almas para Agentes de IA: Una Biblioteca de Personalidad Impulsada por la Comunidad

Un usuario de Reddit creó un repositorio de código abierto con archivos de personalidad cuidadosamente diseñados ("almas") para agentes de IA de codificación. El repositorio incluye actualmente a Jarvis, Gojo, Eren Yeager, René Descartes y Rapper, y se invita a la comunidad a contribuir.

OpenClawRadar