На OpenRouter появились две новые модели, возможно, варианты DeepSeek V4.

На OpenRouter появились две новые модели, которые могут быть пробными версиями DeepSeek V4. Модели называются healer-alpha и hunter-alpha, и их описания указывают на то, что одна из них — облегчённая версия, а другая, по-видимому, полнофункциональная модель.
Характеристики моделей
Полная версия, по сообщениям, имеет 1 ТБ параметров и 1 млн контекста, что соответствует утекшей информации о DeepSeek V4. Облегчённая версия описывается как более лёгкий вариант той же семейства моделей.
Результаты первоначального тестирования
Пользователь провёл ролевые тесты для оценки уровня фильтрации и производительности:
- Обе модели показали впечатляющие результаты в ролевых сценариях
- Ни одна из моделей не отклонила ни одного сообщения во время тестирования
- Облегчённая версия заметно быстрее полной версии
- Полная версия медленнее, но всё же отзывчива
- Обе модели генерируют одинаковое количество токенов менее чем за половину времени по сравнению с GLM 5.0
- Облегчённая версия немного слабее по производительности, но незначительно
- Обе модели сохраняют последовательность персонажей и хорошо справляются с «острым» контентом
Модели в настоящее время находятся в альфа-фазе, что может объяснять отсутствие фильтрации сообщений, наблюдавшееся во время тестирования. Сообщество обсуждает, действительно ли это варианты DeepSeek V4, и делится дополнительными результатами тестирования.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

DeepSeek v4 Flash на Mac Studio: локальная LLM находит реальные ошибки в коде компилятора
Разработчик сообщает, что DeepSeek v4 Flash, работающий на Mac Studio с 128 ГБ, успешно находит настоящие ошибки в кодовой базе компилятора — задача, которая была невозможна с локальными LLM 5 месяцев назад.

Тонкая настройка Phi-4-mini путем обучения только параметров LayerNorm не приводит к улучшению производительности.
Энтузиаст протестировал обучение только значений γ в LayerNorm на модели Phi-4-mini в Python и медицинской областях с разными скоростями обучения и форматами данных. Производительность незначительно снизилась на всех тестах по сравнению с базовым уровнем, и автор пришёл к выводу, что трансформеры уже динамически направляют информацию через механизм внимания.

Обновление APEX MoE Quants: выпущено 25+ новых моделей и уровень I-Nano
APEX — MoE-адаптивная смешанная точность квантизации — теперь охватывает более 30 моделей из семейств Qwen, Mistral, Gemma и гибридных SSM, а также новое поколение I-Nano, достигающее 2,06 бит на параметр для экспертов средних слоёв.

Протестированы 1-битные модели Qwen от PrismML Bonsai: генерация 107 токенов в секунду на 8 ГБ видеопамяти.
Модели Bonsai от PrismML — это 1-битные квантованные версии Qwen3 8B, 4B и 1.7B, которые достигают скорости генерации 107 токенов в секунду и обработки промптов >1114 т/с на RTX 4060 с 8 ГБ видеопамяти, при значительно сниженных требованиях к памяти.