Needle: Um modelo de chamada de funções com 26 milhões de parâmetros que executa a 6000 tok/s em dispositivos móveis

✍️ OpenClawRadar📅 Publicado: May 12, 2026🔗 Source
Ad

A Cactus disponibilizou como código aberto o Needle, um modelo de chamada de funções com 26 milhões de parâmetros projetado para rodar em celulares de baixo custo, relógios e óculos. Ele alcança 6000 tok/s de preenchimento e 1200 tok/s de decodificação em dispositivos de consumo usando seu mecanismo de inferência personalizado, Cactus.

Arquitetura: Simple Attention Networks

O Needle usa uma Simple Attention Network — sem MLPs em lugar algum. O modelo inteiro consiste em camadas de atenção e gating. Design principal: d=512, 8H/4KV, BPE=8192, com estrutura encoder-decoder (12 camadas encoder, 8 camadas decoder) usando atenção cruzada, autoatenção mascarada com RoPE e embeddings compartilhados.

Detalhes do Treinamento

  • Pré-treinado em 200 bilhões de tokens em 16 TPU v6e (27 horas)
  • Pós-treinado em 2 bilhões de tokens de dados sintéticos de chamada de funções (45 minutos)
  • Dados sintetizados via Gemini com 15 categorias de ferramentas (temporizadores, mensagens, navegação, casa inteligente, etc.)

Resultados de Benchmark

O Needle supera FunctionGemma-270M, Qwen-0.6B, Granite-350M e LFM2.5-350M em chamada de funções em única etapa. No entanto, esses modelos têm mais escopo/capacidade e se destacam em contextos conversacionais.

Ad

Início Rápido

git clone https://github.com/cactus-compute/needle.git
cd needle && source ./setup
needle playground

Abre uma interface web em http://127.0.0.1:7860 para testar e ajustar com suas próprias ferramentas.

Uso (Python)

from needle import SimpleAttentionNetwork, load_checkpoint, generate, get_tokenizer

params, config = load_checkpoint("checkpoints/needle.pkl") model = SimpleAttentionNetwork(config) tokenizer = get_tokenizer()

result = generate( model, params, tokenizer, query="Como está o tempo em São Francisco?", tools='[{"name":"get_weather","parameters":{"location":"string"}}]', stream=False ) print(result)

[{"name":"get_weather","arguments":{"location":"São Francisco"}}]

Ajuste Fino Local

# via playground (gera dados automaticamente via Gemini)

needle playground

ou forneça seus próprios dados

needle finetune data.jsonl

Disponibilidade

Os pesos estão no Hugging Face: Cactus-Compute/needle. Tudo está licenciado sob MIT.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

Conduid: Camada de Infraestrutura de Confiança para Servidores MCP Construídos com Claude
Tools

Conduid: Camada de Infraestrutura de Confiança para Servidores MCP Construídos com Claude

O Conduid indexa mais de 25.000 servidores MCP no GitHub, npm, PyPI e diretórios principais, atribuindo uma pontuação de 0 a 100 com base na atividade no GitHub, postura de segurança, qualidade da documentação e sinais de manutenção. Todo o código foi escrito com o Claude por um fundador solo.

OpenClawRadar
Desenvolvedor Independente Lança Ferramenta CLI 'Ideanator' para Estruturar Ideias Vagas com LLMs Locais
Tools

Desenvolvedor Independente Lança Ferramenta CLI 'Ideanator' para Estruturar Ideias Vagas com LLMs Locais

Ideanator é uma ferramenta CLI desenvolvida por um desenvolvedor autodidata de 19 anos usando LLMs locais como Ollama/MLX. Ele estrutura ideias vagas em conceitos bem definidos, completamente offline.

OpenClawRadar
Orkestra: Camada de Roteamento de LLM com Consciência de Custos para OpenClaw Reduz Custos de API em 60-80%
Tools

Orkestra: Camada de Roteamento de LLM com Consciência de Custos para OpenClaw Reduz Custos de API em 60-80%

Orkestra é uma camada de roteamento modular que fica na frente das chamadas de LLM no OpenClaw, usando classificação semântica para direcionar prompts para níveis de modelo econômico, equilibrado ou premium. A abordagem reduziu os custos de API em 60-80% sem reescrita de prompts ou regras complexas.

OpenClawRadar
T9OS: Um Sistema de Orquestração de IA Construído Integralmente com Código Claude
Tools

T9OS: Um Sistema de Orquestração de IA Construído Integralmente com Código Claude

Um estudante de economia construiu o T9OS, uma camada completa de orquestração de IA usando Claude Code como única ferramenta de programação. O sistema inclui 18 pipelines de produção, um mecanismo de ciclo de vida com 12 estados e 7 'Guardiões' de IA que revisam cada saída.

OpenClawRadar