Needle: 26-миллионная параметрическая модель вызова функций, работающая со скоростью 6000 токенов/с на мобильных устройствах
Cactus выпустила с открытым исходным кодом Needle — модель вызова функций с 26 млн параметров, предназначенную для работы на бюджетных телефонах, часах и очках. Она достигает 6000 ток/с префилла и 1200 ток/с декодинга на пользовательских устройствах с помощью собственного инференс-движка Cactus.
Архитектура: Simple Attention Networks
Needle использует Simple Attention Network — без MLP. Вся модель состоит из слоев внимания и гейтинга. Ключевые характеристики: d=512, 8H/4KV, BPE=8192, структура кодировщик-декодировщик (12 слоев кодировщика, 8 слоев декодировщика) с перекрестным вниманием, маскированным самовниманием с RoPE и связанными эмбеддингами.
Детали обучения
- Предобучение на 200 млрд токенов на 16 TPU v6e (27 часов)
- Пост-обучение на 2 млрд токенов синтезированных данных вызова функций (45 минут)
- Данные синтезированы с помощью Gemini по 15 категориям инструментов (таймеры, мессенджеры, навигация, умный дом и т.д.)
Результаты бенчмарков
Needle превосходит FunctionGemma-270M, Qwen-0.6B, Granite-350M и LFM2.5-350M в однократном вызове функций. Однако эти модели имеют больший объем/емкость и превосходят в диалоговых сценариях.
Быстрый старт
git clone https://github.com/cactus-compute/needle.git
cd needle && source ./setup
needle playgroundОткроет веб-интерфейс по адресу http://127.0.0.1:7860 для тестирования и дообучения на ваших инструментах.
Использование (Python)
from needle import SimpleAttentionNetwork, load_checkpoint, generate, get_tokenizer
params, config = load_checkpoint("checkpoints/needle.pkl")
model = SimpleAttentionNetwork(config)
tokenizer = get_tokenizer()
result = generate(
model, params, tokenizer,
query="Какая погода в Сан-Франциско?",
tools='[{"name":"get_weather","parameters":{"location":"string"}}]',
stream=False
)
print(result)
[{"name":"get_weather","arguments":{"location":"San Francisco"}}]
Локальное дообучение
# через playground (автоматически генерирует данные через Gemini)
needle playground
или предоставьте свои данные
needle finetune data.jsonl
Доступность
Веса на Hugging Face: Cactus-Compute/needle. Всё под лицензией MIT.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Скрипт и процесс слияния моделей GGUF для вариантов Qwen3.5-35B
Пользователь Reddit поделился скриптом на Python для объединения файлов моделей GGUF с минимальными потерями, в частности для комбинирования модели Qwen3.5-35B-A3B-Uncensored от HauhauCS с версией Claude-4.6-Opus-Reasoning-Distilled от samuelcardillo. Скрипт работает на бесплатном тарифе Google Colab и включает поддержку квантования через llama-quantize.
Cocall.ai MCP: Исходящие телефонные звонки с подключением реального человека
Cocall.ai — это MCP для Claude, который позволяет совершать исходящие телефонные звонки с использованием полнодуплексной модели «речь-в-речь». Он может приостановить разговор, чтобы задать вам конкретный вопрос вместо того, чтобы гадать, ориентироваться в IVR и передавать звонки вам при необходимости.

OpenUtter: Запрашивайте транскрипты Google Meet в реальном времени через OpenClaw
OpenUtter — это навык, который присоединяется к Google Meet в качестве гостя через безголовый браузер, захватывает живые субтитры и транслирует их в вашу шину событий OpenClaw. Вы можете запрашивать живую расшифровку во время звонка через Telegram, WhatsApp, Slack или Discord.

NervMap: Инструмент для обнаружения сервисов и диагностики серверов с помощью одной команды
NervMap — это инструмент для Linux, который обнаруживает контейнеры Docker, службы systemd и обычные процессы менее чем за 1 секунду, отображает зависимости между ними и диагностирует проблемы с анализом серьёзности и предложениями по исправлению.