Orion: Contornando o CoreML para Executar e Treinar LLMs Diretamente no Apple Neural Engine

✍️ OpenClawRadar📅 Publicado: March 7, 2026🔗 Source
Orion: Contornando o CoreML para Executar e Treinar LLMs Diretamente no Apple Neural Engine
Ad

Acesso Direto ao ANE para Cargas de Trabalho de LLM

Orion fornece um sistema Objective-C completo que ignora completamente o CoreML para executar e treinar LLMs diretamente no Apple Neural Engine (ANE). Essa abordagem dá aos desenvolvedores controle direto sobre o ANE, que anteriormente era tratado como um agendador de caixa-preta pelo CoreML, removendo qualquer controle direto ou capacidade de treinamento.

Implementação Técnica e Restrições

O projeto se baseia em trabalhos de engenharia reversa que mapearam as APIs privadas ANEClient e ANECompiler. O ANE apresenta o que o desenvolvedor chama de "incompatibilidade de impedância de hardware" com 17 restrições de programação no total, 11 das quais eram completamente não documentadas. As principais restrições incluem:

  • A operação de concatenação causa uma falha imediata e silenciosa do compilador
  • Os pesos BLOBFILE exigem um deslocamento de 64 bytes do cabeçalho do bloco, ou você obtém corrupção numérica silenciosa
  • O ANE mantém um estado interno que tem um limite fixo de aproximadamente 119 compilações por processo antes de falhar silenciosamente
Ad

Soluções para Desafios de Treinamento

Tentativas anteriores de treinamento no ANE atingiram divergência NaN após uma única etapa. Orion resolve isso por:

  • Configurando um pipeline de compilação diferida
  • Implementando limitação estrita de ativação para impedir cascata de overflow fp16 (limitando ativações de -65504 a +65504)
  • Usando um loop de reinicialização de processo exec() após cada etapa de treinamento para contornar o limite de 119 compilações

Resultados de Desempenho

O compilador reduz um grafo IR de 27 operações através de cinco passos de otimização até o MIL nativo do ANE. O desempenho atual inclui:

  • Mais de 170 tokens/s para decodificação do GPT-2 124M
  • Treinamento mecanicamente estável em múltiplas etapas em um transformer de 110 milhões de parâmetros (o "teto de coerência" do hardware)
  • Em mais de 1.000 etapas, a perda caiu de 12,3 para 6,2 sem nenhum NaN

Limitações Atuais

O ANE incorpora pesos no momento da compilação, o que significa que cada atualização de treinamento requer uma penalidade de recompilação de aproximadamente 4,2 segundos. O ANE atinge aproximadamente 19 TFLOPS em fp16, mas a restrição fundamental para usá-lo não tem sido a capacidade de computação—tem sido a completa falta de uma camada de orquestração nativa.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Plataforma de IA da Cloudflare: Camada de Inferência Unificada para Agentes de IA
Tools

Plataforma de IA da Cloudflare: Camada de Inferência Unificada para Agentes de IA

A Plataforma de IA da Cloudflare oferece uma única API para acessar mais de 70 modelos de mais de 12 provedores, incluindo suporte multimodal para modelos de imagem, vídeo e fala. Ela permite alternar entre modelos com alterações de código de uma linha e oferece monitoramento centralizado de custos com metadados personalizados.

OpenClawRadar
Hospedagem Nativa para Agentes com MCP: Implante Aplicativos via Agentes de IA no ocl-nexus
Tools

Hospedagem Nativa para Agentes com MCP: Implante Aplicativos via Agentes de IA no ocl-nexus

ocl-nexus apresenta uma configuração de servidor MCP que permite que agentes de codificação de IA implantem aplicativos diretamente em um ambiente ativo protegido por SSO usando apenas uma chave de API.

OpenClawRadar
Brócolis: Plataforma de código aberto para executar agentes de IA de codificação a partir de tickets do Linear em sandboxes na nuvem
Tools

Brócolis: Plataforma de código aberto para executar agentes de IA de codificação a partir de tickets do Linear em sandboxes na nuvem

Broccoli é uma ferramenta de código aberto que recebe tarefas de codificação do Linear, as executa em sandboxes isoladas na nuvem usando Claude e Codex, e abre PRs para revisão humana. Ele é executado na sua própria infraestrutura do Google Cloud com implantação de nível de produção.

OpenClawRadar
Axe: Um CLI de 12MB para Agentes LLM de Propósito Único
Tools

Axe: Um CLI de 12MB para Agentes LLM de Propósito Único

Axe é um binário Go leve que executa agentes de IA focados definidos em arquivos TOML. Ele trata agentes como programas Unix, suportando pipe de stdin, delegação de subagentes e integração de LLMs de múltiplos provedores.

OpenClawRadar