Gemma 4 Lanzada: Cuatro Tamaños de Modelo para Alojamiento Local de IA

✍️ OpenClawRadar📅 Publicado: 6 de abril de 2026🔗 Source
Gemma 4 Lanzada: Cuatro Tamaños de Modelo para Alojamiento Local de IA
Ad

Especificaciones del Modelo Gemma 4

Gemma 4 ya está disponible como un modelo de IA autoalojado con cuatro configuraciones distintas para diferentes escenarios de hardware. Según la fuente, no compite con Claude, Codex o Gemini, sino que se posiciona como una opción práctica para escenarios de enrutamiento múltiple donde un modelo autoalojado pequeño y capaz puede ahorrar tokens.

Variantes del Modelo y Requisitos de Hardware

  • E2B (2.3 mil millones de parámetros efectivos): Diseñado para dispositivos de borde como teléfonos y Raspberry Pi. Requiere ~4-8 GB de RAM y funciona bien en una CPU. Recomendado para alojar en VPS.
  • E4B (4.5 mil millones de parámetros efectivos): Diseñado para portátiles y hardware de gama baja. Mantiene una huella de memoria baja.
  • 26B MoE (25 mil millones totales, 3.8 mil millones activos): Diseñado para GPUs de consumo. Funciona a velocidades de inferencia similares a un modelo de 4B.
  • 31B Denso: Diseñado para GPUs de gama media y estaciones de trabajo. Requiere aproximadamente 16-20 GB de VRAM cuando se usa cuantización de 4 bits.
Ad

Capacidades y Disponibilidad

Todos los modelos Gemma 4 son multimodales con capacidades tanto de texto como de visión. Los modelos de borde E2B y E4B admiten específicamente audio en tiempo real. Los modelos están diseñados para razonamiento avanzado y flujos de trabajo agentes.

Gemma 4 está disponible en Google AI Studio, Hugging Face, Kaggle y Ollama.

📖 Read the full source: r/openclaw

Ad

👀 Ver también

NVIDIA anuncia NemoClaw con funciones de seguridad OpenShell.
Noticias

NVIDIA anuncia NemoClaw con funciones de seguridad OpenShell.

NVIDIA anunció NemoClaw en GTC, basándose en OpenClaw para añadir seguridad de nivel empresarial a través de OpenShell, que aplica barreras de privacidad y seguridad basadas en políticas para agentes de IA.

OpenClawRadar
llama.cpp con cuantización Q8_0 obtiene una aceleración de 3.1x en GPUs Intel Arc con la corrección de reordenamiento SYCL.
Noticias

llama.cpp con cuantización Q8_0 obtiene una aceleración de 3.1x en GPUs Intel Arc con la corrección de reordenamiento SYCL.

Una corrección para el backend SYCL de llama.cpp lleva la cuantización Q8_0 en GPUs Intel Arc del 21% al 66% del ancho de banda de memoria teórico, logrando 15,24 tokens/segundo frente a 4,88 tokens/segundo anteriormente en una Arc Pro B70 con Qwen3.5-27B.

OpenClawRadar
El benchmark IDP Leaderboard muestra que Claude Sonnet 4.6 iguala a Opus 4.6 en tareas de IA para documentos.
Noticias

El benchmark IDP Leaderboard muestra que Claude Sonnet 4.6 iguala a Opus 4.6 en tareas de IA para documentos.

El IDP Leaderboard evaluó 16 modelos de IA en más de 9,000 documentos en categorías como OCR, extracción de tablas, extracción de claves, preguntas y respuestas visuales, escritura a mano y documentos extensos. Claude Sonnet 4.6 obtuvo una puntuación general de 80.8, esencialmente igualando a Opus 4.6 con 80.3, mientras que Haiku 4.5 obtuvo 69.6.

OpenClawRadar
Autoresearch impulsa a Qwen3.5-397B a 20.34 tok/s en M5 Max mediante transmisión SSD
Noticias

Autoresearch impulsa a Qwen3.5-397B a 20.34 tok/s en M5 Max mediante transmisión SSD

Un desarrollador logró una velocidad de inferencia de 20.34 tokens/segundo para el modelo Qwen3.5-397B de 209GB en un MacBook Pro M5 Max con 128GB de RAM usando streaming SSD y 36 experimentos sistemáticos. El resultado representa una aceleración 2x sobre la línea base del M5 Max y 4.67x sobre el resultado original del M3 Max.

OpenClawRadar