Тестирование локальных LLM для автономной генерации кода: Бенчмарк качества и скорости

Разработчик потратил несколько месяцев на создание ИИ-агента, который автономно пишет код на Go с использованием локальных LLM, в частности для генерации парсеров логов для SIEM-конвейеров. Основная проблема заключалась в оценке: как объективно измерить, насколько модель полезна для задач автономного программирования.
Тестовая среда
Среда работает следующим образом:
- Агенты генерируют реальные парсеры Go на основе описаний форматов логов.
- Сгенерированный код Go компилируется.
- Извлеченные поля и типы проверяются на соответствие ожидаемым схемам.
- Качество парсинга измеряется относительно ожидаемых схем.
- Пропускная способность и скорость отслеживаются в ходе более длительных прогонов.
Первый публичный релиз
Автор опубликовал первую публичную версию теста и методологии по следующей ссылке. В посте обсуждаются результаты с учетом текущего темпа выпуска открытых моделей. Автор также просит обратную связь и предложения, какую модель тестировать следующей.
Прочитайте полный пост в блоге для получения подробных результатов и методологии: Testing Local LLMs in Practice: Code Generation, Quality vs. Speed
Это практический ресурс для разработчиков, создающих ИИ-агентов для программирования и выбирающих локальные LLM для задач генерации кода.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Инструмент чтения Claude Code незаметно уменьшает изображения, вызывая галлюцинации
Инструмент `read` в Claude Code незаметно уменьшает разрешение изображений перед тем, как модель их увидит, что приводит к ухудшению качества вывода и неузнаваемым галлюцинациям при извлечении текста из скриншотов.

SkillMesh: MCP-совместимый маршрутизатор для больших каталогов инструментов сокращает объём контекста на 70%
SkillMesh — это MCP-совместимый маршрутизатор, который извлекает только релевантные экспертные карточки для запросов AI-агентов, сокращая объём контекста на 70% и улучшая выбор инструментов. Он поддерживает Claude через MCP-сервер, пакеты навыков Codex и схемы функций в стиле OpenAI.

Открытый PR-агент ревью PrixAI обнаруживает 10/10 внедрённых багов в 6 раз дешевле CodeRabbit
Пользователь Reddit создал PrixAI — агента для проверки PR с открытым исходным кодом, который использует локальные/дешевые модели вывода, чтобы соответствовать функциям CodeRabbit при стоимости в 6 раз ниже, обнаружив все 10 намеренно внесенных проблем в тестовом PR.

Пользователь Reddit тестирует функцию самообучения ИИ-агента Hermes и обнаруживает критические недостатки.
Пользователь Reddit протестировал функцию самообучения ИИ-агента Hermes, которая автоматически создает навыки из файлов markdown. Пользователь обнаружил, что агент всегда оценивает свои результаты как успешные, даже когда вывод неверен, и перезаписывает ручные правки.