Lightning MLX: Motor de IA Local Rápido para Uso Agêntico em Apple Silicon Entrega 220 tok/s no Qwen 35B-A3B

Um novo mecanismo de inferência de código aberto para Apple Silicon chamado Lightning MLX afirma ser o motor de IA local mais rápido, especificamente otimizado para fluxos de trabalho agentivos — agentes de codificação, chamadas de ferramentas e tarefas de curta duração. O projeto está disponível no GitHub em samuelfaj/lightning-mlx.
Resultados de Benchmark
O autor testou em um MacBook Max M5 com 128 GB de RAM e reportou as seguintes velocidades de geração de tokens:
- Qwen3.6-27B: 40,67 tok/s
- Qwen3.6-35B-A3B: 220,86 tok/s
Esses resultados sugerem que o motor é particularmente eficiente para a arquitetura de mistura de especialistas usada no modelo Qwen3.6-35B-A3B, que ativa apenas um subconjunto de parâmetros por token.
Principais Características
- Otimizado para casos de uso agentivos de curta duração — geração de código, chamadas de ferramentas e loops rápidos de inferência
- Inclui uma configuração predefinida chamada MTPLX (padrões de amostragem personalizados); o autor está buscando feedback sobre se esses padrões fazem sentido para uso em produção
- Código aberto sob licença MIT (provavelmente) no GitHub
Solicitações de Feedback
O criador está pedindo ativamente à comunidade:
- Melhores designs de benchmark para agentes de codificação locais
- Opiniões sobre os padrões predefinidos do MTPLX
- Resultados de testes em outras configurações de Apple Silicon (ex.: M1, M2, M3, M4, diferentes tamanhos de RAM)
Para Quem é
Desenvolvedores que executam LLMs locais em Apple Silicon para fluxos de trabalho agentivos de codificação que precisam de velocidade máxima de inferência.
📖 Leia a fonte original: r/LocalLLaMA
👀 See Also

Detector de Vazamentos Swarm: Ferramenta Gratuita para Verificar Chaves de API Expostas em Configurações do OpenClaw
Um desenvolvedor lançou swarm-leak-detector, uma ferramenta de código aberto MIT sem dependências que verifica mais de 21 padrões de credenciais (OpenAI, Anthropic, OpenRouter, Stripe, etc.) em arquivos de configuração JSON em texto simples. Execute com npx swarm-leak-detector scan ~/.clawdbot/ para verificar vazamentos em cerca de 30 segundos.

ATLAS: Pipeline de Computação em Tempo de Teste de Código Aberto para Qwen3-14B Alcança Desempenho de Codificação de Nível de Fronteira
Um estudante universitário desenvolveu o ATLAS, um pipeline de computação em tempo de teste de código aberto construído em torno do Qwen3-14B que alcança 74,6% de pass@1 nos problemas do LiveCodeBench v5 a um custo de aproximadamente US$ 0,004 por tarefa em eletricidade. O sistema é lento para problemas complexos, mas oferece desempenho comparável a modelos de ponta como o GPT-5 (84,6%) e o Claude 4.5 Sonnet (71,4%).

SecureContext: Um Plugin MCP para Memória Persistente e Redução de Tokens no Claude Code
SecureContext é um plugin MCP de código aberto que fornece persistência no estilo MemGPT entre sessões do Claude Code, reduz os tokens de entrada em aproximadamente 87% por meio de recuperação de contexto direcionada e isola credenciais por meio de um sandbox de segurança.

Revisão de Desempenho do Omnicoder-9B: Velocidade vs. Problemas de Chamada de Ferramentas
Omnicoder-9B, um modelo focado em programação ajustado no Qwen3.5 9B com saídas do Opus 4.6, GPT 5.4, GPT 5.3 Codex e Gemini 3.1 Pro, mostra desempenho forte em hardware de médio porte, mas tem problemas de chamada de ferramentas em IDEs.