Agulha: Um Modelo de Chamada de Ferramentas com 26M Parâmetros Construído Totalmente Sem FFNs
Needle é um modelo de 26M de parâmetros projetado especificamente para chamada de função de tiro único. Ele usa camadas de atenção cruzada e portas com zero FFNs, baseado na percepção de que chamada de ferramentas é recuperação-e-montagem (corresponder consulta ao nome da ferramenta, extrair valores de argumento, emitir JSON) em vez de raciocínio. O modelo roda a 6000 tok/s de preenchimento e 1200 tok/s de decodificação em dispositivos consumidores.
Detalhes de Treinamento
- Pré-treinado em 200B tokens através de 16 TPU v6e (27 horas)
- Pós-treinado em 2B tokens de dados sintetizados de chamada de função (45 minutos)
- Dados sintetizados via Gemini com 15 categorias de ferramentas (temporizadores, mensagens, navegação, casa inteligente, etc.)
Arquitetura: Redes de Atenção Simples
O modelo inteiro é apenas atenção e portas — sem MLPs em lugar nenhum. Os autores argumentam que parâmetros FFN são desperdiçados nesta escala para chamada de ferramentas, e que a descoberta 'sem FFN' se generaliza para qualquer tarefa onde o modelo tem acesso a conhecimento estruturado externo (RAG, uso de ferramentas, geração aumentada por recuperação). O modelo não precisa memorizar fatos em pesos FFN se os fatos são fornecidos na entrada.
Benchmarks
Needle supera FunctionGemma-270M, Qwen-0.6B, Granite-350M e LFM2.5-350M em chamada de função de tiro único, embora esses modelos tenham mais capacidade para configurações conversacionais.
Como Usar
# Teste o modelo via playground ou faça fine-tune no seu Mac/PC
git clone https://github.com/cactus-compute/needle
- GitHub: github.com/cactus-compute/needle
- Pesos: huggingface.co/Cactus-Compute/needle
- Documentação da arquitetura: Documentação Simple Attention Networks
- Motor de inferência para mobile/wearables (Cactus): github.com/cactus-compute/cactus
Tudo está sob licença MIT.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

NERF Plataforma de Engenharia de Segurança de IA de Código Aberto Entra em Beta Público
NERF é uma plataforma de engenharia de segurança de IA de código aberto e agente de codificação autônomo que abrange técnicas de segurança ofensiva, defensiva e de privacidade em 117 domínios. Ele apresenta 9 modos de operação auto-detectados, suporte a 26 provedores de LLM e automação de conformidade para 39 frameworks.

ATLAS: Pipeline de Computação em Tempo de Teste de Código Aberto para Qwen3-14B Alcança Desempenho de Codificação de Nível de Fronteira
Um estudante universitário desenvolveu o ATLAS, um pipeline de computação em tempo de teste de código aberto construído em torno do Qwen3-14B que alcança 74,6% de pass@1 nos problemas do LiveCodeBench v5 a um custo de aproximadamente US$ 0,004 por tarefa em eletricidade. O sistema é lento para problemas complexos, mas oferece desempenho comparável a modelos de ponta como o GPT-5 (84,6%) e o Claude 4.5 Sonnet (71,4%).

Verificador MCP de Habilidades Claude: Auditoría Determinista de Cambios Disruptivos del 2026-07-28
Uma Skill gratuita do Claude e uma demonstração web executam 7 regras determinísticas para identificar servidores MCP quebrados pelas mudanças de transporte sem estado e OAuth 2.1 de 28/07/2026. O autor detalha como uma regra estava errada e como corrigiu o erro.

Servidor de memória MCP de código aberto com grafo de conhecimento e recursos de aprendizado
Um servidor MCP de código aberto escrito em Rust oferece memória persistente para agentes de IA com arquitetura de grafo de conhecimento, aprendizado hebbiano e busca híbrida. Tem 7,6MB com latência submilissegundo e funciona com qualquer cliente compatível com MCP.