Needle: Um modelo de chamada de funções com 26 milhões de parâmetros que executa a 6000 tok/s em dispositivos móveis
A Cactus disponibilizou como código aberto o Needle, um modelo de chamada de funções com 26 milhões de parâmetros projetado para rodar em celulares de baixo custo, relógios e óculos. Ele alcança 6000 tok/s de preenchimento e 1200 tok/s de decodificação em dispositivos de consumo usando seu mecanismo de inferência personalizado, Cactus.
Arquitetura: Simple Attention Networks
O Needle usa uma Simple Attention Network — sem MLPs em lugar algum. O modelo inteiro consiste em camadas de atenção e gating. Design principal: d=512, 8H/4KV, BPE=8192, com estrutura encoder-decoder (12 camadas encoder, 8 camadas decoder) usando atenção cruzada, autoatenção mascarada com RoPE e embeddings compartilhados.
Detalhes do Treinamento
- Pré-treinado em 200 bilhões de tokens em 16 TPU v6e (27 horas)
- Pós-treinado em 2 bilhões de tokens de dados sintéticos de chamada de funções (45 minutos)
- Dados sintetizados via Gemini com 15 categorias de ferramentas (temporizadores, mensagens, navegação, casa inteligente, etc.)
Resultados de Benchmark
O Needle supera FunctionGemma-270M, Qwen-0.6B, Granite-350M e LFM2.5-350M em chamada de funções em única etapa. No entanto, esses modelos têm mais escopo/capacidade e se destacam em contextos conversacionais.
Início Rápido
git clone https://github.com/cactus-compute/needle.git
cd needle && source ./setup
needle playgroundAbre uma interface web em http://127.0.0.1:7860 para testar e ajustar com suas próprias ferramentas.
Uso (Python)
from needle import SimpleAttentionNetwork, load_checkpoint, generate, get_tokenizer
params, config = load_checkpoint("checkpoints/needle.pkl")
model = SimpleAttentionNetwork(config)
tokenizer = get_tokenizer()
result = generate(
model, params, tokenizer,
query="Como está o tempo em São Francisco?",
tools='[{"name":"get_weather","parameters":{"location":"string"}}]',
stream=False
)
print(result)
[{"name":"get_weather","arguments":{"location":"São Francisco"}}]
Ajuste Fino Local
# via playground (gera dados automaticamente via Gemini)
needle playground
ou forneça seus próprios dados
needle finetune data.jsonl
Disponibilidade
Os pesos estão no Hugging Face: Cactus-Compute/needle. Tudo está licenciado sob MIT.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

OpenGauge: Ferramenta de código aberto para monitorar custos de agentes de LLM localmente
OpenGauge é uma ferramenta de código aberto que monitora chamadas de API de agentes de LLM como OpenClaw, registrando o uso de tokens, custos e latência em um banco de dados SQLite local. Inclui modo proxy para registro automático, estatísticas detalhadas de custos e funcionalidade de disjuntor para evitar loops descontrolados.

O Plugin SLOP Adiciona Consciência do Estado do Aplicativo em Tempo Real aos Agentes OpenClaw
Um novo plugin OpenClaw integra-se ao SLOP (State Layer for Observable Programs), dando aos agentes de IA acesso estruturado ao estado do aplicativo e ações contextuais. O plugin descobre automaticamente aplicativos habilitados para SLOP via ~/.slop/providers/ e uma ponte de extensão do Chrome.

Claudraband: Envoltório de Terminal para Sessões Persistentes de Código Claude
O Claudraband envolve o TUI oficial do Claude Code em um terminal controlado para permitir fluxos de trabalho retomáveis, controle remoto de sessões via daemon HTTP e integração com servidor ACP para frontends alternativos como Zed ou Toad. Requer Node.js/Bun, Claude Code autenticado e tmux para fluxos de trabalho locais de primeira classe.

Delimitar a Camada de Governança para o Desenvolvimento de IA Multiagente
Delimit é uma camada de governança de código aberto que coordena múltiplos agentes de programação de IA para evitar conflitos. Ele fornece memória compartilhada, detecção de colisões e rastreamento de auditoria para agentes como Claude Code, Codex e Gemini.