Lightning MLX: Motor de IA Local Rápido para Uso Agêntico em Apple Silicon Entrega 220 tok/s no Qwen 35B-A3B

Um novo mecanismo de inferência de código aberto para Apple Silicon chamado Lightning MLX afirma ser o motor de IA local mais rápido, especificamente otimizado para fluxos de trabalho agentivos — agentes de codificação, chamadas de ferramentas e tarefas de curta duração. O projeto está disponível no GitHub em samuelfaj/lightning-mlx.
Resultados de Benchmark
O autor testou em um MacBook Max M5 com 128 GB de RAM e reportou as seguintes velocidades de geração de tokens:
- Qwen3.6-27B: 40,67 tok/s
- Qwen3.6-35B-A3B: 220,86 tok/s
Esses resultados sugerem que o motor é particularmente eficiente para a arquitetura de mistura de especialistas usada no modelo Qwen3.6-35B-A3B, que ativa apenas um subconjunto de parâmetros por token.
Principais Características
- Otimizado para casos de uso agentivos de curta duração — geração de código, chamadas de ferramentas e loops rápidos de inferência
- Inclui uma configuração predefinida chamada MTPLX (padrões de amostragem personalizados); o autor está buscando feedback sobre se esses padrões fazem sentido para uso em produção
- Código aberto sob licença MIT (provavelmente) no GitHub
Solicitações de Feedback
O criador está pedindo ativamente à comunidade:
- Melhores designs de benchmark para agentes de codificação locais
- Opiniões sobre os padrões predefinidos do MTPLX
- Resultados de testes em outras configurações de Apple Silicon (ex.: M1, M2, M3, M4, diferentes tamanhos de RAM)
Para Quem é
Desenvolvedores que executam LLMs locais em Apple Silicon para fluxos de trabalho agentivos de codificação que precisam de velocidade máxima de inferência.
📖 Leia a fonte original: r/LocalLLaMA
👀 See Also

Resultados de Benchmark: CLI do GitHub vs Abordagens MCP para Agentes de IA
Um benchmark independente comparou GitHub CLI, MCP, MCP com Busca de Ferramentas e MCP com Modo Código para tarefas de agentes de IA. GitHub CLI foi o mais custo-efetivo, enquanto as abordagens MCP mostraram compensações em custo, latência e modos de falha.
MartinLoop: Plano de Controle Open-Source para Agentes de Codificação de IA com Limites de Orçamento e Trilhas de Auditoria
MartinLoop é um painel de controle open-source que adiciona limites de orçamento rígidos, trilhas de auditoria em JSONL, classificação de falhas e verificações de conclusão testadas a agentes de codificação de IA.

Painel local monitora o uso do Claude Code com custos de tokens, chamadas de ferramentas e análises de sessão
Um desenvolvedor criou um painel local que lê os arquivos de sessão JSONL do Claude Code para visualizar o uso de tokens, custos estimados, detalhamento de chamadas de ferramentas e histórico de sessões. A ferramenta funciona inteiramente na sua máquina com uma API Express e um painel React.

SIDJUA V1.0: Plataforma de Governança Autônoma para Agentes de IA
SIDJUA V1.0 é uma plataforma de governança gratuita e auto-hospedada para agentes de IA que roda em Docker, incluindo Raspberry Pi. Ela fornece pontos de verificação obrigatórios para tarefas de agentes, armazenamento criptografado de credenciais, isolamento de rede e controles granulares de orçamento.