Lightning MLX: Motor de IA Local Rápido para Uso Agêntico em Apple Silicon Entrega 220 tok/s no Qwen 35B-A3B

✍️ OpenClawRadar📅 Publicado: May 8, 2026🔗 Source
Lightning MLX: Motor de IA Local Rápido para Uso Agêntico em Apple Silicon Entrega 220 tok/s no Qwen 35B-A3B
Ad

Um novo mecanismo de inferência de código aberto para Apple Silicon chamado Lightning MLX afirma ser o motor de IA local mais rápido, especificamente otimizado para fluxos de trabalho agentivos — agentes de codificação, chamadas de ferramentas e tarefas de curta duração. O projeto está disponível no GitHub em samuelfaj/lightning-mlx.

Resultados de Benchmark

O autor testou em um MacBook Max M5 com 128 GB de RAM e reportou as seguintes velocidades de geração de tokens:

  • Qwen3.6-27B: 40,67 tok/s
  • Qwen3.6-35B-A3B: 220,86 tok/s

Esses resultados sugerem que o motor é particularmente eficiente para a arquitetura de mistura de especialistas usada no modelo Qwen3.6-35B-A3B, que ativa apenas um subconjunto de parâmetros por token.

Ad

Principais Características

  • Otimizado para casos de uso agentivos de curta duração — geração de código, chamadas de ferramentas e loops rápidos de inferência
  • Inclui uma configuração predefinida chamada MTPLX (padrões de amostragem personalizados); o autor está buscando feedback sobre se esses padrões fazem sentido para uso em produção
  • Código aberto sob licença MIT (provavelmente) no GitHub

Solicitações de Feedback

O criador está pedindo ativamente à comunidade:

  • Melhores designs de benchmark para agentes de codificação locais
  • Opiniões sobre os padrões predefinidos do MTPLX
  • Resultados de testes em outras configurações de Apple Silicon (ex.: M1, M2, M3, M4, diferentes tamanhos de RAM)

Para Quem é

Desenvolvedores que executam LLMs locais em Apple Silicon para fluxos de trabalho agentivos de codificação que precisam de velocidade máxima de inferência.

📖 Leia a fonte original: r/LocalLLaMA

Ad

👀 See Also

Resultados de Benchmark: CLI do GitHub vs Abordagens MCP para Agentes de IA
Tools

Resultados de Benchmark: CLI do GitHub vs Abordagens MCP para Agentes de IA

Um benchmark independente comparou GitHub CLI, MCP, MCP com Busca de Ferramentas e MCP com Modo Código para tarefas de agentes de IA. GitHub CLI foi o mais custo-efetivo, enquanto as abordagens MCP mostraram compensações em custo, latência e modos de falha.

OpenClawRadar
🦀
Tools

MartinLoop: Plano de Controle Open-Source para Agentes de Codificação de IA com Limites de Orçamento e Trilhas de Auditoria

MartinLoop é um painel de controle open-source que adiciona limites de orçamento rígidos, trilhas de auditoria em JSONL, classificação de falhas e verificações de conclusão testadas a agentes de codificação de IA.

OpenClawRadar
Painel local monitora o uso do Claude Code com custos de tokens, chamadas de ferramentas e análises de sessão
Tools

Painel local monitora o uso do Claude Code com custos de tokens, chamadas de ferramentas e análises de sessão

Um desenvolvedor criou um painel local que lê os arquivos de sessão JSONL do Claude Code para visualizar o uso de tokens, custos estimados, detalhamento de chamadas de ferramentas e histórico de sessões. A ferramenta funciona inteiramente na sua máquina com uma API Express e um painel React.

OpenClawRadar
SIDJUA V1.0: Plataforma de Governança Autônoma para Agentes de IA
Tools

SIDJUA V1.0: Plataforma de Governança Autônoma para Agentes de IA

SIDJUA V1.0 é uma plataforma de governança gratuita e auto-hospedada para agentes de IA que roda em Docker, incluindo Raspberry Pi. Ela fornece pontos de verificação obrigatórios para tarefas de agentes, armazenamento criptografado de credenciais, isolamento de rede e controles granulares de orçamento.

OpenClawRadar