Тестирование локальных LLM для автономной генерации кода: Бенчмарк качества и скорости

✍️ OpenClawRadar📅 Опубликовано: 8 мая 2026 г.🔗 Source
Тестирование локальных LLM для автономной генерации кода: Бенчмарк качества и скорости
Ad

Разработчик потратил несколько месяцев на создание ИИ-агента, который автономно пишет код на Go с использованием локальных LLM, в частности для генерации парсеров логов для SIEM-конвейеров. Основная проблема заключалась в оценке: как объективно измерить, насколько модель полезна для задач автономного программирования.

Тестовая среда

Среда работает следующим образом:

  • Агенты генерируют реальные парсеры Go на основе описаний форматов логов.
  • Сгенерированный код Go компилируется.
  • Извлеченные поля и типы проверяются на соответствие ожидаемым схемам.
  • Качество парсинга измеряется относительно ожидаемых схем.
  • Пропускная способность и скорость отслеживаются в ходе более длительных прогонов.
Ad

Первый публичный релиз

Автор опубликовал первую публичную версию теста и методологии по следующей ссылке. В посте обсуждаются результаты с учетом текущего темпа выпуска открытых моделей. Автор также просит обратную связь и предложения, какую модель тестировать следующей.

Прочитайте полный пост в блоге для получения подробных результатов и методологии: Testing Local LLMs in Practice: Code Generation, Quality vs. Speed

Это практический ресурс для разработчиков, создающих ИИ-агентов для программирования и выбирающих локальные LLM для задач генерации кода.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Loom: Локальный исполнительный механизм для сложных задач искусственного интеллекта
Инструменты

Loom: Локальный исполнительный механизм для сложных задач искусственного интеллекта

Loom — это открытый локальный исполнительный фреймворк, предназначенный для управления сложными задачами. Он предоставляет структурированный процесс с примерно 50 инструментами, системой плагинов пользовательских пакетов для повторяющихся рабочих процессов, а также интерфейсы CLI и MCP-сервера.

OpenClawRadar
Vibeyard добавляет доску Канбан для управления несколькими сессиями Claude Code
Инструменты

Vibeyard добавляет доску Канбан для управления несколькими сессиями Claude Code

В открытой IDE Vibeyard теперь есть доска Канбан, позволяющая запускать сессии агента Claude Code прямо с карточек. Карточки автоматически перемещаются в раздел «Готово», когда агент завершает работу.

OpenClawRadar
/compress-architecture: Умение агента по устранению избыточного проектирования
Инструменты

/compress-architecture: Умение агента по устранению избыточного проектирования

Новое умение агента под названием /compress-architecture проверяет кодовые базы на наличие спекулятивных слоев, транзитных модулей и дублирующихся концепций, защищая при этом реальные границы доменов и публичные API.

OpenClawRadar
Проблемы с обязательствами: Инструмент, который анализирует и «хоронит» незавершённые репозитории GitHub
Инструменты

Проблемы с обязательствами: Инструмент, который анализирует и «хоронит» незавершённые репозитории GitHub

Разработчик создал инструмент под названием Commitment Issues, который анализирует репозитории GitHub, чтобы определить, заброшены ли они, генерирует 'свидетельство о смерти' и извлекает последнее сообщение коммита как 'последние слова'. Инструмент использует эвристики, такие как частота коммитов, последняя активность и соотношение звёзд к динамике, и был прототипирован с помощью Claude.

OpenClawRadar