Lightning MLX: Motor de AI local rápido para uso agente en Apple Silicon ofrece 220 tok/s en Qwen 35B-A3B

✍️ OpenClawRadar📅 Publicado: 8 de mayo de 2026🔗 Source
Lightning MLX: Motor de AI local rápido para uso agente en Apple Silicon ofrece 220 tok/s en Qwen 35B-A3B
Ad

Un nuevo motor de inferencia de código abierto para Apple Silicon llamado Lightning MLX afirma ser el motor de IA local más rápido, específicamente optimizado para flujos de trabajo agénticos — agentes de código, llamadas a herramientas y tareas de respuesta corta. El proyecto está disponible en GitHub en samuelfaj/lightning-mlx.

Resultados de Benchmark

El autor probó en un MacBook Max M5 con 128 GB de RAM e informó las siguientes velocidades de generación de tokens:

  • Qwen3.6-27B: 40.67 tok/s
  • Qwen3.6-35B-A3B: 220.86 tok/s

Estos resultados sugieren que el motor es particularmente eficiente para la arquitectura de mezcla de expertos utilizada en el modelo Qwen3.6-35B-A3B, que activa solo un subconjunto de parámetros por token.

Ad

Características Clave

  • Optimizado para casos de uso agénticos de respuesta corta — generación de código, llamadas a herramientas y bucles de inferencia rápida
  • Incluye una configuración preestablecida llamada MTPLX (valores predeterminados de muestreo personalizados); el autor busca comentarios sobre si estos valores predeterminados tienen sentido para uso en producción
  • Código abierto bajo la licencia MIT (probablemente) en GitHub

Solicitudes de Comentarios

El creador está pidiendo activamente a la comunidad:

  • Mejores diseños de benchmark para agentes de código locales
  • Opiniones sobre los valores predeterminados del preset MTPLX
  • Resultados de pruebas en otras configuraciones de Apple Silicon (por ejemplo, M1, M2, M3, M4, diferentes tamaños de RAM)

Para Quién Es

Desarrolladores que ejecutan LLMs locales en Apple Silicon para flujos de trabajo agénticos de codificación que necesitan máxima velocidad de inferencia.

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Mnemos: Capa de Memoria Local-Primero de Código Abierto para Agentes de Programación
Herramientas

Mnemos: Capa de Memoria Local-Primero de Código Abierto para Agentes de Programación

Mnemos es una capa de memoria local-first para flujos de trabajo de agentes de codificación en solitario que aborda fallos comunes en sistemas de memoria como la contaminación de alcance, hechos obsoletos y el crecimiento descontrolado de transcripciones. La beta pública incluye perfiles iniciales de SQLite, soporte MCP para Claude Code/Desktop y una canalización biomimética con componentes como SurprisalGate y MutableRAG.

OpenClawRadar
JobPilot: Complemento de Claude Code para Solicitudes de Empleo Automatizadas
Herramientas

JobPilot: Complemento de Claude Code para Solicitudes de Empleo Automatizadas

JobPilot es un complemento de Claude Code que automatiza la búsqueda de empleo y los procesos de solicitud utilizando la automatización del navegador Playwright. Incluye comandos para buscar en bolsas de trabajo, completar automáticamente solicitudes, generar cartas de presentación y realizar un seguimiento de las estadísticas de las solicitudes.

OpenClawRadar
SynapsCAD: Aplicación de escritorio de código abierto para OpenSCAD con integración de Claude AI
Herramientas

SynapsCAD: Aplicación de escritorio de código abierto para OpenSCAD con integración de Claude AI

SynapsCAD es una aplicación de escritorio de código abierto que combina un editor de código OpenSCAD, una ventana gráfica 3D en tiempo real y un asistente de IA. Construida completamente en Rust con Bevy 0.15 y egui, admite la integración de la API de Claude para la programación de CAD 3D mediante lenguaje natural.

OpenClawRadar
Mentor de Carreras Multi-Agente Desarrollado con Ollama y MCP para IA Local
Herramientas

Mentor de Carreras Multi-Agente Desarrollado con Ollama y MCP para IA Local

Un desarrollador construyó un sistema de IA de 5 agentes que analiza currículums y genera informes de inteligencia profesional usando Ollama con llama3 localmente. El sistema encadena las salidas de los agentes para que cada uno se base en el contexto anterior, con MCP manejando la integración de herramientas.

OpenClawRadar