Netlify тестирует 11 ИИ-моделей для программирования: какая лучше?

✍️ OpenClawRadar📅 Опубликовано: 14 августа 2026 г.🔗 Source
Ad

Netlify опубликовал реальное сравнение 11 ИИ-моделей, выполнивших одинаковые промпты для кодинга, с использованием своего нового инструмента оценки с открытым исходным кодом AXIS. Тесты охватывают типичные задачи веб-разработки, такие как создание сайта кофейни, приложения для списка дел и приложения для рецептов с ИИ, предоставляя конкретные данные о качестве моделей и стоимости кредитов.

Это сравнение появилось сразу после партнерства Netlify с OpenRouter, которое позволяет вашим проектам использовать любую модель на OpenRouter через их AI Gateway. Для их Agent Runners (окно чат-промптов в Netlify, которое создает или развивает проекты) они добавили агента с открытым исходным кодом OpenCode, чтобы вы могли управлять более широким спектром моделей, включая Kimi K3, GLM 5.2 и DeepSeek V4.

Что они тестировали

Netlify использовал свой внутренний фреймворк AXIS для запуска трех простых сценариев:

  • Сайт кофейни – простой статический сайт, плюс дополнительное задание добавить бронирование столиков.
  • Приложение списка дел – требует общую базу данных с самого начала, затем добавляет возможность загрузки фотографий.
  • Приложение "Что я могу приготовить" – пользователи вводят ингредиенты, а сайт использует AI Gateway для генерации рецептов.

Они оценивали функциональность (а не дизайн), проверяя такие вещи: использует ли базу данных, когда это необходимо? Правильно ли использует Netlify Database? Избегает ли излишней сложности? Модели, которые постоянно не проходят проверки, не предлагаются в Agent Runners.

Ad

Ключевые выводы

Полный отчет, доступный в их блоге, показывает сгенерированный сайт каждой модели, заметки о важных проблемах и стоимость кредитов. Хотя они не публиковали официальные оценки в этом посте, они подчеркивают большие различия в результатах. Например, они упоминают запуск GPT 5.6 Sol с низкими усилиями по умолчанию, предлагая более экономичную альтернативу Opus, которая по-прежнему дает "довольно хорошие результаты".

Они также отметили, что стоимость кредитов сильно варьируется между моделями для одной и той же задачи, поэтому вы можете платить больше за модель, которая не дает лучших результатов.

Вывод

Если вы выбираете модель для кодинга для своих собственных агентных проектов, это полезный источник данных. Тест фокусируется на реальных сценариях веб-разработки и включает модели с открытым исходным кодом, которые часто разрекламированы. Результаты субъективны (они это признают), но их стоит просмотреть, прежде чем выбрать модель по умолчанию или тратить кредиты.

Примечание: Это первая часть серии; последующие посты будут углубляться в другие сценарии использования.

📖 Читать полный источник: HN LLM Tools

Ad

👀 Смотрите также

Garry Tan's gstack: Открытая фреймворк-платформа для ИИ-агентов на основе Claude Code
Инструменты

Garry Tan's gstack: Открытая фреймворк-платформа для ИИ-агентов на основе Claude Code

gstack от Гарри Тана — это фабрика программного обеспечения с открытым исходным кодом, которая превращает Claude Code в виртуальную инженерную команду с 13 специализированными слеш-командами для планирования, проектирования, разработки, ревью, контроля качества и управления выпуском.

OpenClawRadar
TEMM1E v3.1.0: ИИ-агент, который самообучается с помощью взаимодействия с пользователями
Инструменты

TEMM1E v3.1.0: ИИ-агент, который самообучается с помощью взаимодействия с пользователями

TEMM1E v3.1.0 представляет Eigen-Tune — систему, которая фиксирует взаимодействия с LLM в качестве обучающих данных, оценивает качество на основе поведения пользователей и дообучает локальные модели через LoRA без дополнительных затрат на LLM. Протестировано на Apple M2: после 10 диалогов система исправила конвертацию температуры с 72°F = '150°C' на '21.2°C'.

OpenClawRadar
Mindwalk: Воспроизведение сессий Claude Code/Codex в виде световых следов на 3D карте кода
Инструменты

Mindwalk: Воспроизведение сессий Claude Code/Codex в виде световых следов на 3D карте кода

Mindwalk воспроизводит сессии агентов кодинга на 3D-карте вашей кодовой базы. Один Go-бинар локально парсит логи Claude Code и Codex. Наблюдайте, как файлы светятся при поиске/чтении/редактировании — нетронутые остаются темными.

OpenClawRadar
StarSteady: AI-управляемые ответы на отзывы Google и SMS-запросы для локального бизнеса
Инструменты

StarSteady: AI-управляемые ответы на отзывы Google и SMS-запросы для локального бизнеса

StarSteady — это созданный одним разработчиком SaaS-инструмент, который генерирует ответы на отзывы в Google/Yelp с помощью ИИ и отправляет SMS-запросы на отзывы клиентам. Цена начинается от $39 в месяц, доступен бесплатный пробный период на 5 ответов ИИ и 5 SMS.

OpenClawRadar