Strands Decider 2B: модель принятия решений с 2 млрд параметров для агентных рабочих процессов
Strands Labs (AWS) выпустила Strands Decider 2B — открытую модель принятия решений на 2 миллиарда параметров, оптимизированную для быстрых локальных экспериментов и агентных рабочих процессов. В отличие от универсальных LLM, модели принятия решений предназначены для выбора из фиксированного набора вариантов (например, «Относится ли „включи свет“ к кофемашине? Да или нет.») или для присвоения простых числовых оценок (например, тональность от 0 до 1).
Что это и почему это важно
Модели принятия решений жертвуют гибкостью ради скорости и надёжности. Они всегда возвращают ответ из предложенных вариантов, работают с очень низкой задержкой и выдают оценку калибровки («насколько я уверена, что это правильно?»), которую API передовых LLM не предоставляют. Компромисс: они хуже справляются со сложными рассуждениями и не умеют генерировать текст, поэтому не подходят для программирования, чат-ботов или суммаризации.
Strands позиционирует это как новый класс моделей «системы один», вслед за запуском Jev от TypeSafe AI в начале этого месяца. Цель — управлять шагами принятия агентных решений в SDK Strands Harness.
Архитектура
Модель берёт предобученный торс Qwen3.5-2B, удаляет LM-голову (убирая генерацию текста) и заменяет её на указательную голову, которая оценивает каждый предложенный вариант. Голова сравнивает скрытое состояние в позиции каждого варианта со скрытым состоянием в позиции <answer>. Голова небольшая — чуть больше 1 млн параметров — а торс дообучен с помощью LoRA-адаптера ранга 16.
Это v19 архитектуры. В первой итерации использовалась слотовая голова, которая показала значительно худшие результаты; все заметки об итерациях есть в репозитории.
Бенчмарки
Strands измерила точность на публичном наборе JevBench и калибровку через Brier score на том же наборе:
- Точность: 3-е место из 33 в классе 2B
- Точность без учёта моделей чуть больше 2B: 1-е место из 30
- Задержка (медиана): ~115 мс на Nvidia RTX 3090, ~153 мс для небольших задач на M3 MacBook
- Задержка масштабируется примерно линейно с размером задачи
Доступность
- Код на GitHub:
strands-decider-2b - Веса на Hugging Face
- Включает все данные и скрипты обучения
- Работает на локальном CPU или GPU — вызовы API не требуются
Для кого это
Для разработчиков, создающих агентные рабочие процессы, которым нужны быстрые, калиброванные решения «да/нет» или классификация на периферии, и для исследователей, которым нужна небольшая, удобная для модификации база для экспериментов с моделями принятия решений.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Устранение неполадок с доступом к электронной почте и Google Drive для AI-агентов
Настройка доступа к электронной почте и Google Drive для ИИ-ботов на AWS может привести к блокировкам аккаунтов. Вот решение с использованием Gmail и доменов Workspace.

Элодин публикует с открытым исходным кодом ИИ-гоночную упряжь с симуляцией Betaflight в реальном времени для участников AI Grand Prix
Elodin выпустил симуляционный харнас с открытым исходным кодом для виртуального квалификационного этапа AI Grand Prix, соответствующий условиям соревнований и работающий с реальным Betaflight. Инструмент на Rust/Bevy генерирует сэмплы камеры напрямую в цикле, избегая излишней нагрузки от игрового движка.

Локальный инструмент визуализирует данные сессии кода Claude
Скрипт на Python считывает данные сессий Claude Code, хранящиеся локально в ~/.claude/, и создаёт визуализацию с прокруткой с помощью диаграмм D3.js, показывающую ежедневную активность, распределение по проектам, использование инструментов и тепловые карты ритма программирования.

Круглый стол по ИИ: Инструмент для сравнения 200+ моделей ИИ на структурированных вопросах
AI Roundtable — это бесплатный инструмент, который позволяет пользователям задавать вопросы с определенными вариантами ответов, выбирать до 50 моделей из пула более чем 200+ и получать структурированные ответы в идентичных условиях. Он также включает функцию дебатов, где модели могут видеть рассуждения друг друга, и модель-рецензента, которая суммирует транскрипты.