Тестирование локальных LLM для автономной генерации кода: Бенчмарк качества и скорости

Разработчик потратил несколько месяцев на создание ИИ-агента, который автономно пишет код на Go с использованием локальных LLM, в частности для генерации парсеров логов для SIEM-конвейеров. Основная проблема заключалась в оценке: как объективно измерить, насколько модель полезна для задач автономного программирования.
Тестовая среда
Среда работает следующим образом:
- Агенты генерируют реальные парсеры Go на основе описаний форматов логов.
- Сгенерированный код Go компилируется.
- Извлеченные поля и типы проверяются на соответствие ожидаемым схемам.
- Качество парсинга измеряется относительно ожидаемых схем.
- Пропускная способность и скорость отслеживаются в ходе более длительных прогонов.
Первый публичный релиз
Автор опубликовал первую публичную версию теста и методологии по следующей ссылке. В посте обсуждаются результаты с учетом текущего темпа выпуска открытых моделей. Автор также просит обратную связь и предложения, какую модель тестировать следующей.
Прочитайте полный пост в блоге для получения подробных результатов и методологии: Testing Local LLMs in Practice: Code Generation, Quality vs. Speed
Это практический ресурс для разработчиков, создающих ИИ-агентов для программирования и выбирающих локальные LLM для задач генерации кода.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Loom: Локальный исполнительный механизм для сложных задач искусственного интеллекта
Loom — это открытый локальный исполнительный фреймворк, предназначенный для управления сложными задачами. Он предоставляет структурированный процесс с примерно 50 инструментами, системой плагинов пользовательских пакетов для повторяющихся рабочих процессов, а также интерфейсы CLI и MCP-сервера.

Vibeyard добавляет доску Канбан для управления несколькими сессиями Claude Code
В открытой IDE Vibeyard теперь есть доска Канбан, позволяющая запускать сессии агента Claude Code прямо с карточек. Карточки автоматически перемещаются в раздел «Готово», когда агент завершает работу.

/compress-architecture: Умение агента по устранению избыточного проектирования
Новое умение агента под названием /compress-architecture проверяет кодовые базы на наличие спекулятивных слоев, транзитных модулей и дублирующихся концепций, защищая при этом реальные границы доменов и публичные API.

Проблемы с обязательствами: Инструмент, который анализирует и «хоронит» незавершённые репозитории GitHub
Разработчик создал инструмент под названием Commitment Issues, который анализирует репозитории GitHub, чтобы определить, заброшены ли они, генерирует 'свидетельство о смерти' и извлекает последнее сообщение коммита как 'последние слова'. Инструмент использует эвристики, такие как частота коммитов, последняя активность и соотношение звёзд к динамике, и был прототипирован с помощью Claude.