Игла: 26-миллионная модель вызова инструментов, построенная полностью без FFN
Needle — это модель с 26 миллионами параметров, специально разработанная для одношагового вызова функций. Она использует кросс-внимание и стробирующие слои без FFN, исходя из идеи, что вызов инструментов — это поиск и сборка (сопоставление запроса с именем инструмента, извлечение значений аргументов, вывод JSON), а не рассуждение. Модель работает со скоростью 6000 токенов/с на префилле и 1200 токенов/с на декоде на потребительских устройствах.
Детали обучения
- Предварительное обучение на 200 миллиардах токенов на 16 TPU v6e (27 часов)
- Пост-обучение на 2 миллиардах токенов синтезированных данных вызова функций (45 минут)
- Данные синтезированы с помощью Gemini по 15 категориям инструментов (таймеры, обмен сообщениями, навигация, умный дом и т.д.)
Архитектура: Простые сети внимания
Вся модель состоит только из внимания и стробирования — без MLP нигде. Авторы утверждают, что параметры FFN тратятся впустую при таком масштабе для вызова инструментов, и что вывод «без FFN» обобщается на любые задачи, где модель имеет доступ к внешним структурированным знаниям (RAG, использование инструментов, генерация с дополнением извлечением). Модели не нужно запоминать факты в весах FFN, если факты предоставлены на входе.
Бенчмарки
Needle превосходит FunctionGemma-270M, Qwen-0.6B, Granite-350M и LFM2.5-350M в одношаговом вызове функций, хотя эти модели имеют больший потенциал для диалоговых сценариев.
Как использовать
# Протестируйте модель через playground или дообучите на своем Mac/PC
git clone https://github.com/cactus-compute/needle
- GitHub: github.com/cactus-compute/needle
- Веса: huggingface.co/Cactus-Compute/needle
- Описание архитектуры: Документация Simple Attention Networks
- Инференс-движок для мобильных устройств/носимой электроники (Cactus): github.com/cactus-compute/cactus
Все лицензировано по MIT.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

bareguard: Легковесная система безопасности для AI-агентов — теперь в npm
bareguard v1.0 — это слой безопасности для AI-агентов, состоящий из ~1000 строк кода с одной зависимостью, который блокирует деструктивные действия (rm -rf, DROP TABLE) и обеспечивает контроль бюджета с возможностью эскалации человеку. Входит в состав bare suite, доступен на npm.

SymDex: Открытый MCP-индексатор кода сокращает потребление токенов ИИ-агентами
SymDex — это инструмент с открытым исходным кодом для индексирования кода по протоколу MCP. Он предварительно индексирует базы кода, чтобы помочь AI-агентам для программирования находить функции и классы без чтения целых файлов, что, согласно тестам разработчика, сокращает использование токенов примерно на 97% за один поиск.

HN SOTA: Отслеживание популярности моделей кодирования через комментарии на Hacker News
HN SOTA — это ежедневно обновляемый конвейер, который собирает комментарии Hacker News, использует Gemini для идентификации моделей кодирования из списка OpenRouter и записывает тональность упоминаний в публичную Google Таблицу. Отображаются топ-10 моделей по количеству упоминаний за скользящие 10 дней.

Claude IDE Bridge: инструмент с открытым исходным кодом, который предоставляет ИИ Claude прямой доступ к вашему редактору кода
Claude IDE Bridge — это инструмент с открытым исходным кодом и лицензией MIT, который напрямую подключает Claude AI к вашему редактору кода, позволяя ему видеть открытые файлы, несохранённые изменения и ошибки в реальном времени, а не через вставленные фрагменты кода. В настоящее время инструмент работает с VS Code и Windsurf.