Needle: Um modelo de chamada de funções com 26 milhões de parâmetros que executa a 6000 tok/s em dispositivos móveis
A Cactus disponibilizou como código aberto o Needle, um modelo de chamada de funções com 26 milhões de parâmetros projetado para rodar em celulares de baixo custo, relógios e óculos. Ele alcança 6000 tok/s de preenchimento e 1200 tok/s de decodificação em dispositivos de consumo usando seu mecanismo de inferência personalizado, Cactus.
Arquitetura: Simple Attention Networks
O Needle usa uma Simple Attention Network — sem MLPs em lugar algum. O modelo inteiro consiste em camadas de atenção e gating. Design principal: d=512, 8H/4KV, BPE=8192, com estrutura encoder-decoder (12 camadas encoder, 8 camadas decoder) usando atenção cruzada, autoatenção mascarada com RoPE e embeddings compartilhados.
Detalhes do Treinamento
- Pré-treinado em 200 bilhões de tokens em 16 TPU v6e (27 horas)
- Pós-treinado em 2 bilhões de tokens de dados sintéticos de chamada de funções (45 minutos)
- Dados sintetizados via Gemini com 15 categorias de ferramentas (temporizadores, mensagens, navegação, casa inteligente, etc.)
Resultados de Benchmark
O Needle supera FunctionGemma-270M, Qwen-0.6B, Granite-350M e LFM2.5-350M em chamada de funções em única etapa. No entanto, esses modelos têm mais escopo/capacidade e se destacam em contextos conversacionais.
Início Rápido
git clone https://github.com/cactus-compute/needle.git
cd needle && source ./setup
needle playgroundAbre uma interface web em http://127.0.0.1:7860 para testar e ajustar com suas próprias ferramentas.
Uso (Python)
from needle import SimpleAttentionNetwork, load_checkpoint, generate, get_tokenizer
params, config = load_checkpoint("checkpoints/needle.pkl")
model = SimpleAttentionNetwork(config)
tokenizer = get_tokenizer()
result = generate(
model, params, tokenizer,
query="Como está o tempo em São Francisco?",
tools='[{"name":"get_weather","parameters":{"location":"string"}}]',
stream=False
)
print(result)
[{"name":"get_weather","arguments":{"location":"São Francisco"}}]
Ajuste Fino Local
# via playground (gera dados automaticamente via Gemini)
needle playground
ou forneça seus próprios dados
needle finetune data.jsonl
Disponibilidade
Os pesos estão no Hugging Face: Cactus-Compute/needle. Tudo está licenciado sob MIT.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Conduid: Camada de Infraestrutura de Confiança para Servidores MCP Construídos com Claude
O Conduid indexa mais de 25.000 servidores MCP no GitHub, npm, PyPI e diretórios principais, atribuindo uma pontuação de 0 a 100 com base na atividade no GitHub, postura de segurança, qualidade da documentação e sinais de manutenção. Todo o código foi escrito com o Claude por um fundador solo.

Desenvolvedor Independente Lança Ferramenta CLI 'Ideanator' para Estruturar Ideias Vagas com LLMs Locais
Ideanator é uma ferramenta CLI desenvolvida por um desenvolvedor autodidata de 19 anos usando LLMs locais como Ollama/MLX. Ele estrutura ideias vagas em conceitos bem definidos, completamente offline.

Orkestra: Camada de Roteamento de LLM com Consciência de Custos para OpenClaw Reduz Custos de API em 60-80%
Orkestra é uma camada de roteamento modular que fica na frente das chamadas de LLM no OpenClaw, usando classificação semântica para direcionar prompts para níveis de modelo econômico, equilibrado ou premium. A abordagem reduziu os custos de API em 60-80% sem reescrita de prompts ou regras complexas.

T9OS: Um Sistema de Orquestração de IA Construído Integralmente com Código Claude
Um estudante de economia construiu o T9OS, uma camada completa de orquestração de IA usando Claude Code como única ferramenta de programação. O sistema inclui 18 pipelines de produção, um mecanismo de ciclo de vida com 12 estados e 7 'Guardiões' de IA que revisam cada saída.