Aguja: Un modelo de invocación de herramientas de 26 millones de parámetros construido completamente sin FFN
Needle es un modelo de 26M de parámetros diseñado específicamente para llamadas a funciones de un solo disparo. Utiliza capas de atención cruzada y compuertas sin FFNs, basándose en la idea de que la llamada a herramientas es recuperación y ensamblaje (coincidir consulta con nombre de herramienta, extraer valores de argumentos, emitir JSON) en lugar de razonamiento. El modelo funciona a 6000 tok/s de prefill y 1200 tok/s de decode en dispositivos de consumo.
Detalles de entrenamiento
- Preentrenado en 200B tokens en 16 TPU v6e (27 horas)
- Post-entrenado en 2B tokens de datos sintetizados de llamadas a funciones (45 minutos)
- Datos sintetizados mediante Gemini con 15 categorías de herramientas (temporizadores, mensajería, navegación, hogar inteligente, etc.)
Arquitectura: Redes de Atención Simple
Todo el modelo es solo atención y compuertas, sin MLPs en ninguna parte. Los autores argumentan que los parámetros FFN se desperdician a esta escala para llamadas a herramientas, y que el hallazgo de 'sin FFN' se generaliza a cualquier tarea donde el modelo tenga acceso a conocimiento estructurado externo (RAG, uso de herramientas, generación aumentada por recuperación). El modelo no necesita memorizar hechos en los pesos FFN si los hechos se proporcionan en la entrada.
Evaluaciones comparativas
Needle supera a FunctionGemma-270M, Qwen-0.6B, Granite-350M y LFM2.5-350M en llamadas a funciones de un solo disparo, aunque esos modelos tienen más capacidad para entornos conversacionales.
Cómo usar
# Prueba el modelo mediante el playground o ajústalo en tu Mac/PC
git clone https://github.com/cactus-compute/needle
- GitHub: github.com/cactus-compute/needle
- Pesos: huggingface.co/Cactus-Compute/needle
- Documentación de arquitectura: Simple Attention Networks docs
- Motor de inferencia para móviles/dispositivos portátiles (Cactus): github.com/cactus-compute/cactus
Todo tiene licencia MIT.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

Puente IDE de Claude de Código Abierto Conecta Dispatch, Aplicación de Escritorio y Claude Code
El claude-ide-bridge es una herramienta de código abierto con licencia MIT que conecta Claude Code a tu IDE, proporcionando acceso a LSP, depurador, terminales, git y GitHub a través de 124 herramientas. Permite un flujo de trabajo donde las tareas enviadas mediante Dispatch desde un teléfono son manejadas por la aplicación de escritorio de Claude, que usa Claude Code para escribir código y ejecutar pruebas mientras interactúa con el IDE.

Explorando sandbox-exec de macOS para la ejecución segura de aplicaciones.
sandbox-exec es una herramienta de línea de comandos de macOS que permite a las aplicaciones ejecutarse en un entorno restringido. Aprende cómo utilizarla con perfiles de sandbox personalizados.

Comparación de Cuatro Proveedores de Alojamiento OpenClaw Gestionado para 2026
Un desarrollador evaluó cuatro proveedores de alojamiento gestionado de OpenClaw durante dos meses, clasificándolos según el tiempo de configuración, tiempo de actividad, confiabilidad de integración, enrutamiento de modelos, costo y manejo de tareas de múltiples pasos. LobsterTank cuesta $2/mes con alojamiento básico de contenedores, KiwiClaw es $39/mes con mejor soporte, xCloud es $24/mes con sólido tiempo de actividad, y RunLobster es $49/mes con amplia integración de herramientas y precio fijo.

MemAware Benchmark Prueba la Memoria de la IA Más Allá de la Búsqueda por Palabras Clave
MemAware es un punto de referencia con 900 preguntas en 3 niveles de dificultad que evalúa si los asistentes de IA con memoria pueden recuperar contexto relevante cuando las consultas no lo sugieren. Los resultados muestran que la búsqueda BM25 obtuvo un 2,8 % frente al 0,8 % sin memoria, mientras que la búsqueda vectorial cae al 0,7 % en conexiones entre dominios.