Модели с открытыми весами объемом менее 100 ГБ не превосходят Claude Haiku в тестах на программирование.

✍️ OpenClawRadar📅 Опубликовано: 26 февраля 2026 г.🔗 Source
Модели с открытыми весами объемом менее 100 ГБ не превосходят Claude Haiku в тестах на программирование.
Ad

Недавний анализ открытых языковых моделей выявил значительный разрыв в производительности по сравнению с Claude Haiku от Anthropic на кодинговых бенчмарках. Сравнение проводилось с использованием определённых параметров тестирования и требований к памяти.

Методология бенчмаркинга

Оценка сравнивала модели на двух кодинговых бенчмарках: LiveBench (январь 2026) и Arena Code/WebDev. Тестирование проводилось против Claude Haiku 4.5 с включёнными возможностями мышления. Модели были отображены в соответствии с требованиями к памяти для локального развёртывания.

Технические характеристики

  • Квантование: Q4_K_M
  • Длина контекста: 32K
  • KV-кэш: q8_0
  • Оценка VRAM: Рассчитана с использованием пользовательского калькулятора автора
Ad

Ключевые выводы

Ни одна открытая модель размером менее 100 ГБ памяти не приближается к производительности Claude Haiku ни на одном из бенчмарков. Ближайший конкурент — Minimax M2.5, который требует примерно 136 ГБ памяти и примерно соответствует производительности Haiku на обоих бенчмарках.

Анализ подчёркивает текущий разрыв между проприетарными и открытыми моделями в категории менее 100 ГБ для кодинговых задач. Автор выражает разочарование этим ограничением и призывает к разработке более компактных моделей, которые могли бы хотя бы соответствовать возможностям Haiku.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Claude Code v2.1.216: Переключатель файловой системы в песочнице, исправление квадратичного замедления и более 30 исправлений ошибок
Новости

Claude Code v2.1.216: Переключатель файловой системы в песочнице, исправление квадратичного замедления и более 30 исправлений ошибок

Claude Code v2.1.216 добавляет sandbox.filesystem.disabled для выборочной изоляции, исправляет квадратичное замедление нормализации сообщений в длительных сессиях и устраняет более 30 ошибок, включая проблемы с OAuth и изоляцией worktree.

OpenClawRadar
🦀
Новости

Google DeepMind AI Pointer: Переосмысление мыши для взаимодействия с Gemini

Google DeepMind представляет AI-управляемый указатель мыши, который использует Gemini для понимания контекста, позволяя выполнять команды, такие как указание на изображение и произнесение «Покажи маршруты», интегрированный в Chrome и Googlebook.

OpenClawRadar
SenseNova-U1-8B-MoT: открытая исходная мультимодальная модель с архитектурой NEO-Unify
Новости

SenseNova-U1-8B-MoT: открытая исходная мультимодальная модель с архитектурой NEO-Unify

SenseNova выпустила SenseNova-U1-8B-MoT — нативную мультимодальную модель, которая устраняет как визуальный энкодер, так и VAE, используя архитектуру NEO-Unify для унифицированного понимания, рассуждения и генерации. Она отлично справляется с созданием инфографики из текста, редактированием изображений и перемежающейся генерацией текста и изображений.

OpenClawRadar
Инженеры ИИ не застрахованы от замены ИИ
Новости

Инженеры ИИ не застрахованы от замены ИИ

По мере того как фундаментальные модели вроде DINO от Meta становятся универсальными, узкоспециализированные роли AI-инженеров оказываются под угрозой. Автор утверждает, что большинство рабочих мест AI-инженеров будут заменены раньше, чем другие должности разработчиков.

OpenClawRadar