Needle: Un modelo de llamada a funciones de 26 millones de parámetros que funciona a 6000 tokens/segundo en móvil

✍️ OpenClawRadar📅 Publicado: 12 de mayo de 2026🔗 Source
Ad

Cactus ha publicado como código abierto Needle, un modelo de llamada a funciones de 26 millones de parámetros diseñado para ejecutarse en teléfonos económicos, relojes y gafas. Alcanza 6000 tok/s de prefill y 1200 tok/s de decodificación en dispositivos de consumo utilizando su motor de inferencia personalizado, Cactus.

Arquitectura: Redes de Atención Simple

Needle utiliza una Red de Atención Simple — sin MLPs en ningún lado. El modelo completo consiste en capas de atención y compuerta. Diseño clave: d=512, 8H/4KV, BPE=8192, con una estructura codificador-decodificador (12 capas de codificador, 8 capas de decodificador) que usa atención cruzada, autoatención enmascarada con RoPE y embeddings compartidos.

Detalles de entrenamiento

  • Preentrenado en 200 mil millones de tokens en 16 TPU v6e (27 horas)
  • Post-entrenado en 2 mil millones de tokens de datos sintetizados de llamadas a funciones (45 minutos)
  • Datos sintetizados vía Gemini con 15 categorías de herramientas (temporizadores, mensajería, navegación, hogar inteligente, etc.)

Resultados de benchmark

Needle supera a FunctionGemma-270M, Qwen-0.6B, Granite-350M y LFM2.5-350M en llamadas a funciones de un solo paso. Sin embargo, esos modelos tienen más alcance/capacidad y destacan en entornos conversacionales.

Ad

Inicio rápido

git clone https://github.com/cactus-compute/needle.git
cd needle && source ./setup
needle playground

Abre una interfaz web en http://127.0.0.1:7860 para probar y ajustar el modelo con tus propias herramientas.

Uso (Python)

from needle import SimpleAttentionNetwork, load_checkpoint, generate, get_tokenizer

params, config = load_checkpoint("checkpoints/needle.pkl") model = SimpleAttentionNetwork(config) tokenizer = get_tokenizer()

result = generate( model, params, tokenizer, query="¿Cómo está el clima en San Francisco?", tools='[{"name":"get_weather","parameters":{"location":"string"}}]', stream=False ) print(result)

[{"name":"get_weather","arguments":{"location":"San Francisco"}}]

Ajuste fino local

# vía playground (genera datos automáticamente con Gemini)

needle playground

o proporciona tus propios datos

needle finetune data.jsonl

Disponibilidad

Los pesos están en Hugging Face: Cactus-Compute/needle. Todo tiene licencia MIT.

📖 Lee la fuente completa: HN AI Agents

Ad

👀 Ver también

El Servidor MCP de TradingView Permite a Claude Realizar Backtesting de Estrategias de Trading
Herramientas

El Servidor MCP de TradingView Permite a Claude Realizar Backtesting de Estrategias de Trading

Un desarrollador ha lanzado un servidor MCP que permite a Claude realizar backtesting de seis estrategias de trading utilizando datos de Yahoo Finance sin necesidad de claves API. La configuración implica agregar una línea al archivo claude_desktop_config.json.

OpenClawRadar
Adam CAD Harness se integra con Fusion y Onshape para edición CAD agentiva
Herramientas

Adam CAD Harness se integra con Fusion y Onshape para edición CAD agentiva

El arnés CAD agéntico de Adam ahora se integra con Autodesk Fusion y PTC Onshape, leyendo y editando árboles de características mediante lenguaje natural. Instálalo con comandos de una sola línea para macOS/Windows.

OpenClawRadar
TrustLog Dynamics: Daemon de Python Usa Matemática de Bonos para Eliminar Agentes de IA Descontrolados
Herramientas

TrustLog Dynamics: Daemon de Python Usa Matemática de Bonos para Eliminar Agentes de IA Descontrolados

TrustLog Dynamics es un demonio de Python que monitorea los costos de API de agentes de IA en tiempo real y termina procesos utilizando dos métodos de finanzas cuantitativas: detección de convexidad para costos acelerados y detección de varianza cero para bucles mecánicos.

OpenClawRadar
FlowBoard v5: Espacio de trabajo de proyectos basado en eventos para equipos multiagente
Herramientas

FlowBoard v5: Espacio de trabajo de proyectos basado en eventos para equipos multiagente

FlowBoard v5 reconstruye la capa de contexto del proyecto en React con un almacén de tareas basado en eventos, permite la coordinación multiagente entre OpenClaw, Claude Code y Cursor, e introduce un pipeline de Ideas a Especificaciones.

OpenClawRadar