Lightning MLX: Motor de AI local rápido para uso agente en Apple Silicon ofrece 220 tok/s en Qwen 35B-A3B

Un nuevo motor de inferencia de código abierto para Apple Silicon llamado Lightning MLX afirma ser el motor de IA local más rápido, específicamente optimizado para flujos de trabajo agénticos — agentes de código, llamadas a herramientas y tareas de respuesta corta. El proyecto está disponible en GitHub en samuelfaj/lightning-mlx.
Resultados de Benchmark
El autor probó en un MacBook Max M5 con 128 GB de RAM e informó las siguientes velocidades de generación de tokens:
- Qwen3.6-27B: 40.67 tok/s
- Qwen3.6-35B-A3B: 220.86 tok/s
Estos resultados sugieren que el motor es particularmente eficiente para la arquitectura de mezcla de expertos utilizada en el modelo Qwen3.6-35B-A3B, que activa solo un subconjunto de parámetros por token.
Características Clave
- Optimizado para casos de uso agénticos de respuesta corta — generación de código, llamadas a herramientas y bucles de inferencia rápida
- Incluye una configuración preestablecida llamada MTPLX (valores predeterminados de muestreo personalizados); el autor busca comentarios sobre si estos valores predeterminados tienen sentido para uso en producción
- Código abierto bajo la licencia MIT (probablemente) en GitHub
Solicitudes de Comentarios
El creador está pidiendo activamente a la comunidad:
- Mejores diseños de benchmark para agentes de código locales
- Opiniones sobre los valores predeterminados del preset MTPLX
- Resultados de pruebas en otras configuraciones de Apple Silicon (por ejemplo, M1, M2, M3, M4, diferentes tamaños de RAM)
Para Quién Es
Desarrolladores que ejecutan LLMs locales en Apple Silicon para flujos de trabajo agénticos de codificación que necesitan máxima velocidad de inferencia.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Mnemos: Capa de Memoria Local-Primero de Código Abierto para Agentes de Programación
Mnemos es una capa de memoria local-first para flujos de trabajo de agentes de codificación en solitario que aborda fallos comunes en sistemas de memoria como la contaminación de alcance, hechos obsoletos y el crecimiento descontrolado de transcripciones. La beta pública incluye perfiles iniciales de SQLite, soporte MCP para Claude Code/Desktop y una canalización biomimética con componentes como SurprisalGate y MutableRAG.

JobPilot: Complemento de Claude Code para Solicitudes de Empleo Automatizadas
JobPilot es un complemento de Claude Code que automatiza la búsqueda de empleo y los procesos de solicitud utilizando la automatización del navegador Playwright. Incluye comandos para buscar en bolsas de trabajo, completar automáticamente solicitudes, generar cartas de presentación y realizar un seguimiento de las estadísticas de las solicitudes.

SynapsCAD: Aplicación de escritorio de código abierto para OpenSCAD con integración de Claude AI
SynapsCAD es una aplicación de escritorio de código abierto que combina un editor de código OpenSCAD, una ventana gráfica 3D en tiempo real y un asistente de IA. Construida completamente en Rust con Bevy 0.15 y egui, admite la integración de la API de Claude para la programación de CAD 3D mediante lenguaje natural.

Mentor de Carreras Multi-Agente Desarrollado con Ollama y MCP para IA Local
Un desarrollador construyó un sistema de IA de 5 agentes que analiza currículums y genera informes de inteligencia profesional usando Ollama con llama3 localmente. El sistema encadena las salidas de los agentes para que cada uno se base en el contexto anterior, con MCP manejando la integración de herramientas.