Aguja: Un modelo de invocación de herramientas de 26 millones de parámetros construido completamente sin FFN
Needle es un modelo de 26M de parámetros diseñado específicamente para llamadas a funciones de un solo disparo. Utiliza capas de atención cruzada y compuertas sin FFNs, basándose en la idea de que la llamada a herramientas es recuperación y ensamblaje (coincidir consulta con nombre de herramienta, extraer valores de argumentos, emitir JSON) en lugar de razonamiento. El modelo funciona a 6000 tok/s de prefill y 1200 tok/s de decode en dispositivos de consumo.
Detalles de entrenamiento
- Preentrenado en 200B tokens en 16 TPU v6e (27 horas)
- Post-entrenado en 2B tokens de datos sintetizados de llamadas a funciones (45 minutos)
- Datos sintetizados mediante Gemini con 15 categorías de herramientas (temporizadores, mensajería, navegación, hogar inteligente, etc.)
Arquitectura: Redes de Atención Simple
Todo el modelo es solo atención y compuertas, sin MLPs en ninguna parte. Los autores argumentan que los parámetros FFN se desperdician a esta escala para llamadas a herramientas, y que el hallazgo de 'sin FFN' se generaliza a cualquier tarea donde el modelo tenga acceso a conocimiento estructurado externo (RAG, uso de herramientas, generación aumentada por recuperación). El modelo no necesita memorizar hechos en los pesos FFN si los hechos se proporcionan en la entrada.
Evaluaciones comparativas
Needle supera a FunctionGemma-270M, Qwen-0.6B, Granite-350M y LFM2.5-350M en llamadas a funciones de un solo disparo, aunque esos modelos tienen más capacidad para entornos conversacionales.
Cómo usar
# Prueba el modelo mediante el playground o ajústalo en tu Mac/PC
git clone https://github.com/cactus-compute/needle
- GitHub: github.com/cactus-compute/needle
- Pesos: huggingface.co/Cactus-Compute/needle
- Documentación de arquitectura: Simple Attention Networks docs
- Motor de inferencia para móviles/dispositivos portátiles (Cactus): github.com/cactus-compute/cactus
Todo tiene licencia MIT.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

Configuración de OpenClaw sin Interfaz Gráfica con Discord mediante Scripts Docker
Un repositorio de GitHub proporciona scripts para ejecutar OpenClaw con Discord en un contenedor Docker sin interfaz gráfica, evitando la TUI/WebUI. Incluye un script de gestión con comandos como claw init, start y stop, además de soporte preconfigurado para OpenAI Responses API, Chromium y varias herramientas.

Capa de Identidad y Reputación para Agentes OpenClaw
Un equipo de desarrolladores construyó MCP-I e IdentiClaw para resolver la pérdida de identidad en flujos de trabajo de agentes de múltiples pasos, además de knowthat.ai como un registro de reputación. Donaron la especificación MCP-I a la Decentralized Identity Foundation.

Extensión de Visual Studio 2022 Agrega Integración Nativa de Ollama para LLMs Locales
Una extensión gratuita para Visual Studio 2022 se conecta directamente a endpoints locales de Ollama, permitiendo asistencia de IA privada para programación sin cambiar entre herramientas. Soporta modelos como DeepSeek y Llama 3 con opciones de respaldo en la nube.

El Análisis del Consejo de LLM Revela Estrategias Prácticas de Optimización de Tokens de Código Claude
Un desarrollador utilizó la herramienta LLM Council con 5 personajes para analizar los patrones de uso de Claude Code, identificando que el modo de pensamiento extendido por defecto era el mayor consumidor de tokens. El manual resultante logró una reducción del 60-70% en tokens con la misma o mejor calidad de salida.