Модели с открытыми весами объемом менее 100 ГБ не превосходят Claude Haiku в тестах на программирование.

✍️ OpenClawRadar📅 Опубликовано: 26 февраля 2026 г.🔗 Source
Модели с открытыми весами объемом менее 100 ГБ не превосходят Claude Haiku в тестах на программирование.
Ad

Недавний анализ открытых языковых моделей выявил значительный разрыв в производительности по сравнению с Claude Haiku от Anthropic на кодинговых бенчмарках. Сравнение проводилось с использованием определённых параметров тестирования и требований к памяти.

Методология бенчмаркинга

Оценка сравнивала модели на двух кодинговых бенчмарках: LiveBench (январь 2026) и Arena Code/WebDev. Тестирование проводилось против Claude Haiku 4.5 с включёнными возможностями мышления. Модели были отображены в соответствии с требованиями к памяти для локального развёртывания.

Технические характеристики

  • Квантование: Q4_K_M
  • Длина контекста: 32K
  • KV-кэш: q8_0
  • Оценка VRAM: Рассчитана с использованием пользовательского калькулятора автора
Ad

Ключевые выводы

Ни одна открытая модель размером менее 100 ГБ памяти не приближается к производительности Claude Haiku ни на одном из бенчмарков. Ближайший конкурент — Minimax M2.5, который требует примерно 136 ГБ памяти и примерно соответствует производительности Haiku на обоих бенчмарках.

Анализ подчёркивает текущий разрыв между проприетарными и открытыми моделями в категории менее 100 ГБ для кодинговых задач. Автор выражает разочарование этим ограничением и призывает к разработке более компактных моделей, которые могли бы хотя бы соответствовать возможностям Haiku.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

OpenClaw 2026.6.5: Бесплатный параллельный поиск, исправления стабильности повсеместно
Новости

OpenClaw 2026.6.5: Бесплатный параллельный поиск, исправления стабильности повсеместно

OpenClaw 2026.6.5 добавляет бесплатный встроенный Parallel Search без настройки, более безопасные ответы в каналах, улучшенное восстановление агентов и менее хрупкую настройку провайдеров/моделей.

OpenClawRadar
Исследование согласованности ИИ-агентов: ключевые выводы и практические рекомендации
Новости

Исследование согласованности ИИ-агентов: ключевые выводы и практические рекомендации

Исследование 3000 экспериментов с Claude, GPT-4o и Llama показывает, что согласованные агенты достигают точности 80–92%, тогда как несогласованные падают до 25–60%, причём 69% расхождений происходит при первом вызове инструмента.

OpenClawRadar
Клод Соннет 4.6 Открыт: Улучшенные возможности кодирования и использования компьютеров
Новости

Клод Соннет 4.6 Открыт: Улучшенные возможности кодирования и использования компьютеров

Claude Sonnet 4.6 представляет собой контекстное окно в 1 миллион токенов и улучшает навыки программирования и использования компьютера, что делает его серьезной альтернативой моделям класса Opus для более широкого круга задач.

OpenClawRadar
Claude.ai в настоящее время не работает, ошибки API участились — 28 апреля 2026 г.
Новости

Claude.ai в настоящее время не работает, ошибки API участились — 28 апреля 2026 г.

Автоматическое обновление статуса, запущенное с официальной страницы статуса Claude, сообщает, что Claude.ai недоступен, а API испытывает повышенный уровень ошибок по состоянию на 2026-04-28T17:51:36.000Z.

OpenClawRadar