Agulha: Um Modelo de Chamada de Ferramentas com 26M Parâmetros Construído Totalmente Sem FFNs

✍️ OpenClawRadar📅 Publicado: May 12, 2026🔗 Source
Ad

Needle é um modelo de 26M de parâmetros projetado especificamente para chamada de função de tiro único. Ele usa camadas de atenção cruzada e portas com zero FFNs, baseado na percepção de que chamada de ferramentas é recuperação-e-montagem (corresponder consulta ao nome da ferramenta, extrair valores de argumento, emitir JSON) em vez de raciocínio. O modelo roda a 6000 tok/s de preenchimento e 1200 tok/s de decodificação em dispositivos consumidores.

Detalhes de Treinamento

  • Pré-treinado em 200B tokens através de 16 TPU v6e (27 horas)
  • Pós-treinado em 2B tokens de dados sintetizados de chamada de função (45 minutos)
  • Dados sintetizados via Gemini com 15 categorias de ferramentas (temporizadores, mensagens, navegação, casa inteligente, etc.)

Arquitetura: Redes de Atenção Simples

O modelo inteiro é apenas atenção e portas — sem MLPs em lugar nenhum. Os autores argumentam que parâmetros FFN são desperdiçados nesta escala para chamada de ferramentas, e que a descoberta 'sem FFN' se generaliza para qualquer tarefa onde o modelo tem acesso a conhecimento estruturado externo (RAG, uso de ferramentas, geração aumentada por recuperação). O modelo não precisa memorizar fatos em pesos FFN se os fatos são fornecidos na entrada.

Ad

Benchmarks

Needle supera FunctionGemma-270M, Qwen-0.6B, Granite-350M e LFM2.5-350M em chamada de função de tiro único, embora esses modelos tenham mais capacidade para configurações conversacionais.

Como Usar

# Teste o modelo via playground ou faça fine-tune no seu Mac/PC
git clone https://github.com/cactus-compute/needle

Tudo está sob licença MIT.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

NERF Plataforma de Engenharia de Segurança de IA de Código Aberto Entra em Beta Público
Tools

NERF Plataforma de Engenharia de Segurança de IA de Código Aberto Entra em Beta Público

NERF é uma plataforma de engenharia de segurança de IA de código aberto e agente de codificação autônomo que abrange técnicas de segurança ofensiva, defensiva e de privacidade em 117 domínios. Ele apresenta 9 modos de operação auto-detectados, suporte a 26 provedores de LLM e automação de conformidade para 39 frameworks.

OpenClawRadar
ATLAS: Pipeline de Computação em Tempo de Teste de Código Aberto para Qwen3-14B Alcança Desempenho de Codificação de Nível de Fronteira
Tools

ATLAS: Pipeline de Computação em Tempo de Teste de Código Aberto para Qwen3-14B Alcança Desempenho de Codificação de Nível de Fronteira

Um estudante universitário desenvolveu o ATLAS, um pipeline de computação em tempo de teste de código aberto construído em torno do Qwen3-14B que alcança 74,6% de pass@1 nos problemas do LiveCodeBench v5 a um custo de aproximadamente US$ 0,004 por tarefa em eletricidade. O sistema é lento para problemas complexos, mas oferece desempenho comparável a modelos de ponta como o GPT-5 (84,6%) e o Claude 4.5 Sonnet (71,4%).

OpenClawRadar
Verificador MCP de Habilidades Claude: Auditoría Determinista de Cambios Disruptivos del 2026-07-28
Tools

Verificador MCP de Habilidades Claude: Auditoría Determinista de Cambios Disruptivos del 2026-07-28

Uma Skill gratuita do Claude e uma demonstração web executam 7 regras determinísticas para identificar servidores MCP quebrados pelas mudanças de transporte sem estado e OAuth 2.1 de 28/07/2026. O autor detalha como uma regra estava errada e como corrigiu o erro.

OpenClawRadar
Servidor de memória MCP de código aberto com grafo de conhecimento e recursos de aprendizado
Tools

Servidor de memória MCP de código aberto com grafo de conhecimento e recursos de aprendizado

Um servidor MCP de código aberto escrito em Rust oferece memória persistente para agentes de IA com arquitetura de grafo de conhecimento, aprendizado hebbiano e busca híbrida. Tem 7,6MB com latência submilissegundo e funciona com qualquer cliente compatível com MCP.

OpenClawRadar