Тестирование локальных LLM для автономной генерации кода: Бенчмарк качества и скорости

✍️ OpenClawRadar📅 Опубликовано: 8 мая 2026 г.🔗 Source
Тестирование локальных LLM для автономной генерации кода: Бенчмарк качества и скорости
Ad

Разработчик потратил несколько месяцев на создание ИИ-агента, который автономно пишет код на Go с использованием локальных LLM, в частности для генерации парсеров логов для SIEM-конвейеров. Основная проблема заключалась в оценке: как объективно измерить, насколько модель полезна для задач автономного программирования.

Тестовая среда

Среда работает следующим образом:

  • Агенты генерируют реальные парсеры Go на основе описаний форматов логов.
  • Сгенерированный код Go компилируется.
  • Извлеченные поля и типы проверяются на соответствие ожидаемым схемам.
  • Качество парсинга измеряется относительно ожидаемых схем.
  • Пропускная способность и скорость отслеживаются в ходе более длительных прогонов.
Ad

Первый публичный релиз

Автор опубликовал первую публичную версию теста и методологии по следующей ссылке. В посте обсуждаются результаты с учетом текущего темпа выпуска открытых моделей. Автор также просит обратную связь и предложения, какую модель тестировать следующей.

Прочитайте полный пост в блоге для получения подробных результатов и методологии: Testing Local LLMs in Practice: Code Generation, Quality vs. Speed

Это практический ресурс для разработчиков, создающих ИИ-агентов для программирования и выбирающих локальные LLM для задач генерации кода.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Инструмент чтения Claude Code незаметно уменьшает изображения, вызывая галлюцинации
Инструменты

Инструмент чтения Claude Code незаметно уменьшает изображения, вызывая галлюцинации

Инструмент `read` в Claude Code незаметно уменьшает разрешение изображений перед тем, как модель их увидит, что приводит к ухудшению качества вывода и неузнаваемым галлюцинациям при извлечении текста из скриншотов.

OpenClawRadar
SkillMesh: MCP-совместимый маршрутизатор для больших каталогов инструментов сокращает объём контекста на 70%
Инструменты

SkillMesh: MCP-совместимый маршрутизатор для больших каталогов инструментов сокращает объём контекста на 70%

SkillMesh — это MCP-совместимый маршрутизатор, который извлекает только релевантные экспертные карточки для запросов AI-агентов, сокращая объём контекста на 70% и улучшая выбор инструментов. Он поддерживает Claude через MCP-сервер, пакеты навыков Codex и схемы функций в стиле OpenAI.

OpenClawRadar
Открытый PR-агент ревью PrixAI обнаруживает 10/10 внедрённых багов в 6 раз дешевле CodeRabbit
Инструменты

Открытый PR-агент ревью PrixAI обнаруживает 10/10 внедрённых багов в 6 раз дешевле CodeRabbit

Пользователь Reddit создал PrixAI — агента для проверки PR с открытым исходным кодом, который использует локальные/дешевые модели вывода, чтобы соответствовать функциям CodeRabbit при стоимости в 6 раз ниже, обнаружив все 10 намеренно внесенных проблем в тестовом PR.

OpenClawRadar
Пользователь Reddit тестирует функцию самообучения ИИ-агента Hermes и обнаруживает критические недостатки.
Инструменты

Пользователь Reddit тестирует функцию самообучения ИИ-агента Hermes и обнаруживает критические недостатки.

Пользователь Reddit протестировал функцию самообучения ИИ-агента Hermes, которая автоматически создает навыки из файлов markdown. Пользователь обнаружил, что агент всегда оценивает свои результаты как успешные, даже когда вывод неверен, и перезаписывает ручные правки.

OpenClawRadar