SenseNova-U1-8B-MoT: открытая исходная мультимодальная модель с архитектурой NEO-Unify

✍️ OpenClawRadar📅 Опубликовано: 5 мая 2026 г.🔗 Source
SenseNova-U1-8B-MoT: открытая исходная мультимодальная модель с архитектурой NEO-Unify
Ad

SenseNova выпустила SenseNova-U1-8B-MoT в последний день апреля, и она получает меньше внимания, чем заслуживает. Это не очередная гибридная модель на адаптерах. Согласно странице на Hugging Face, модель устраняет как визуальный энкодер (VE), так и вариационный автоэнкодер (VAE), рассматривая пиксели и слова как единое целое. Основой является NEO-Unify — архитектура, созданная с нуля для мультимодального ИИ.

Ключевые особенности

  • Нативное мультимодальное понимание и генерация в одной модели без адаптеров.
  • Нативная перемежающаяся генерация изображений и текста: создает связные последовательности текста и изображений в одном потоке, полезные для руководств, туристических дневников и инфографики.
  • Визуализация информации высокой плотности: генерирует макеты для постеров, презентаций, резюме и иллюстраций знаний.
  • Передовые показатели среди открытых моделей в задачах понимания, рассуждения и генерации.
  • Нативный MoT (Смешение мыслей) для эффективного кросс-модального рассуждения с минимальными конфликтами.
Ad

Особенности архитектуры

SenseNova U1 описывается как смена парадигмы от интеграции модальностей (с использованием адаптеров) к истинной унификации. Модель мыслит и действует нативно на языке и визуальной информации. Проект также нацелен на обучение агентов и моделирование мира (действия на основе зрения и языка, моделирование мира).

Навыки агента

SenseNova также выпустила репозиторий навыков для подключения модели к агентам, таким как Hermes. Хотя навыки, вероятно, указывают на хостинговые API, в источнике отмечается, что их можно модифицировать для указания локальных эндпоинтов.

Для кого это

Разработчики, работающие с мультимодальными конвейерами ИИ, особенно те, кому нужна одна модель как для понимания (например, визуальные вопросы и ответы), так и для генерации (например, текст-в-изображение, инфографика) без сборки отдельных энкодеров и декодеров.

📖 Источник: r/LocalLLaMA

Ad

👀 Смотрите также

Еженедельный обзор мультимодального ИИ: Holotron-12B, Nemotron Omni, GlyphPrinter и другие
Новости

Еженедельный обзор мультимодального ИИ: Holotron-12B, Nemotron Omni, GlyphPrinter и другие

В этой неделе среди основных достижений в области мультимодального ИИ можно выделить Holotron-12B для задач компьютерного использования, модели NVIDIA Nemotron Omni, объединяющие язык, зрение и голос, GlyphPrinter для точного рендеринга текста при генерации изображений, а также несколько проектов с открытым исходным кодом для улучшения видео, 3D-сегментации и многоагентных систем.

OpenClawRadar
Результаты AIME 2026: открытые и закрытые модели набирают выше 90%
Новости

Результаты AIME 2026: открытые и закрытые модели набирают выше 90%

ИИ-модели достигают 90%+ на AIME 2026, при этом DeepSeek V3.2 проходит весь тест всего за bash.09.

OpenClaw Radar
Merlin Research выпускает модель Qwen3.5-4B-Safety-Thinking для структурированного рассуждения.
Новости

Merlin Research выпускает модель Qwen3.5-4B-Safety-Thinking для структурированного рассуждения.

Исследовательская группа Merlin Research представила Qwen3.5-4B-Safety-Thinking — модель рассуждений с 4 миллиардами параметров, ориентированную на безопасность и построенную на основе Qwen3.5. Модель предназначена для структурированного «мышления» и обеспечения безопасности в реальных сценариях, включая агентные системы.

OpenClawRadar
Claude Code v2.1.161: Атрибуты OTEL, исправления параллельных инструментов и редактирование секретов MCP
Новости

Claude Code v2.1.161: Атрибуты OTEL, исправления параллельных инструментов и редактирование секретов MCP

v2.1.161 включает атрибуты ресурсов OTEL в качестве метрик, независимые результаты параллельных вызовов инструментов, редактирование секретов MCP и множество исправлений ошибок для субагентов, хуков Windows и событий журнала OpenTelemetry.

OpenClawRadar