SenseNova-U1-8B-MoT: открытая исходная мультимодальная модель с архитектурой NEO-Unify

SenseNova выпустила SenseNova-U1-8B-MoT в последний день апреля, и она получает меньше внимания, чем заслуживает. Это не очередная гибридная модель на адаптерах. Согласно странице на Hugging Face, модель устраняет как визуальный энкодер (VE), так и вариационный автоэнкодер (VAE), рассматривая пиксели и слова как единое целое. Основой является NEO-Unify — архитектура, созданная с нуля для мультимодального ИИ.
Ключевые особенности
- Нативное мультимодальное понимание и генерация в одной модели без адаптеров.
- Нативная перемежающаяся генерация изображений и текста: создает связные последовательности текста и изображений в одном потоке, полезные для руководств, туристических дневников и инфографики.
- Визуализация информации высокой плотности: генерирует макеты для постеров, презентаций, резюме и иллюстраций знаний.
- Передовые показатели среди открытых моделей в задачах понимания, рассуждения и генерации.
- Нативный MoT (Смешение мыслей) для эффективного кросс-модального рассуждения с минимальными конфликтами.
Особенности архитектуры
SenseNova U1 описывается как смена парадигмы от интеграции модальностей (с использованием адаптеров) к истинной унификации. Модель мыслит и действует нативно на языке и визуальной информации. Проект также нацелен на обучение агентов и моделирование мира (действия на основе зрения и языка, моделирование мира).
Навыки агента
SenseNova также выпустила репозиторий навыков для подключения модели к агентам, таким как Hermes. Хотя навыки, вероятно, указывают на хостинговые API, в источнике отмечается, что их можно модифицировать для указания локальных эндпоинтов.
Для кого это
Разработчики, работающие с мультимодальными конвейерами ИИ, особенно те, кому нужна одна модель как для понимания (например, визуальные вопросы и ответы), так и для генерации (например, текст-в-изображение, инфографика) без сборки отдельных энкодеров и декодеров.
📖 Источник: r/LocalLLaMA
👀 Смотрите также

$500K AI-фильм 'Hell Grind' компании Higgsfield на самом деле не показывали в Каннах
Higgsfield утверждал, что его фильм за $500 000, созданный ИИ, был показан в Каннах, но организаторы фестиваля подтвердили, что он не входил в официальную программу.

Anthropic убирает доступ к коду Claude из подписки Pro для новых пользователей в рамках теста.
Anthropic временно убрала доступ к Claude Code из своего плана подписки Pro за $20 в месяц для новых пользователей, изменив страницы с ценами на сайте и справочные документы, а затем отменив изменения. Компания описала это как 'небольшой тест для 2% новых подписок просьюмеров'.

Claude Code v2.1.197: Claude Sonnet 5 по умолчанию, 1 млн токенов, акционная цена
Версия Claude Code v2.1.197 делает Claude Sonnet 5 моделью по умолчанию с родным контекстом в 1 млн токенов и акционной ценой $2/$10 за млн токенов до 31 августа.

Anthropic ограничивает использование подписки на Claude в сторонних инструментах, таких как OpenClaw.
Anthropic меняет политику подписки на Claude, блокируя использование в сторонних оболочках, включая OpenClaw, и с 4 апреля требует отдельной оплаты по мере использования для этих инструментов. Компания предлагает единовременный кредит, равный ежемесячной стоимости подписки, и скидки до 30% при предварительной покупке.