Модели с открытыми весами объемом менее 100 ГБ не превосходят Claude Haiku в тестах на программирование.

Недавний анализ открытых языковых моделей выявил значительный разрыв в производительности по сравнению с Claude Haiku от Anthropic на кодинговых бенчмарках. Сравнение проводилось с использованием определённых параметров тестирования и требований к памяти.
Методология бенчмаркинга
Оценка сравнивала модели на двух кодинговых бенчмарках: LiveBench (январь 2026) и Arena Code/WebDev. Тестирование проводилось против Claude Haiku 4.5 с включёнными возможностями мышления. Модели были отображены в соответствии с требованиями к памяти для локального развёртывания.
Технические характеристики
- Квантование: Q4_K_M
- Длина контекста: 32K
- KV-кэш: q8_0
- Оценка VRAM: Рассчитана с использованием пользовательского калькулятора автора
Ключевые выводы
Ни одна открытая модель размером менее 100 ГБ памяти не приближается к производительности Claude Haiku ни на одном из бенчмарков. Ближайший конкурент — Minimax M2.5, который требует примерно 136 ГБ памяти и примерно соответствует производительности Haiku на обоих бенчмарках.
Анализ подчёркивает текущий разрыв между проприетарными и открытыми моделями в категории менее 100 ГБ для кодинговых задач. Автор выражает разочарование этим ограничением и призывает к разработке более компактных моделей, которые могли бы хотя бы соответствовать возможностям Haiku.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Claude Code v2.1.216: Переключатель файловой системы в песочнице, исправление квадратичного замедления и более 30 исправлений ошибок
Claude Code v2.1.216 добавляет sandbox.filesystem.disabled для выборочной изоляции, исправляет квадратичное замедление нормализации сообщений в длительных сессиях и устраняет более 30 ошибок, включая проблемы с OAuth и изоляцией worktree.
Google DeepMind AI Pointer: Переосмысление мыши для взаимодействия с Gemini
Google DeepMind представляет AI-управляемый указатель мыши, который использует Gemini для понимания контекста, позволяя выполнять команды, такие как указание на изображение и произнесение «Покажи маршруты», интегрированный в Chrome и Googlebook.

SenseNova-U1-8B-MoT: открытая исходная мультимодальная модель с архитектурой NEO-Unify
SenseNova выпустила SenseNova-U1-8B-MoT — нативную мультимодальную модель, которая устраняет как визуальный энкодер, так и VAE, используя архитектуру NEO-Unify для унифицированного понимания, рассуждения и генерации. Она отлично справляется с созданием инфографики из текста, редактированием изображений и перемежающейся генерацией текста и изображений.

Инженеры ИИ не застрахованы от замены ИИ
По мере того как фундаментальные модели вроде DINO от Meta становятся универсальными, узкоспециализированные роли AI-инженеров оказываются под угрозой. Автор утверждает, что большинство рабочих мест AI-инженеров будут заменены раньше, чем другие должности разработчиков.