Netlify тестирует 11 ИИ-моделей для программирования: какая лучше?
Netlify опубликовал реальное сравнение 11 ИИ-моделей, выполнивших одинаковые промпты для кодинга, с использованием своего нового инструмента оценки с открытым исходным кодом AXIS. Тесты охватывают типичные задачи веб-разработки, такие как создание сайта кофейни, приложения для списка дел и приложения для рецептов с ИИ, предоставляя конкретные данные о качестве моделей и стоимости кредитов.
Это сравнение появилось сразу после партнерства Netlify с OpenRouter, которое позволяет вашим проектам использовать любую модель на OpenRouter через их AI Gateway. Для их Agent Runners (окно чат-промптов в Netlify, которое создает или развивает проекты) они добавили агента с открытым исходным кодом OpenCode, чтобы вы могли управлять более широким спектром моделей, включая Kimi K3, GLM 5.2 и DeepSeek V4.
Что они тестировали
Netlify использовал свой внутренний фреймворк AXIS для запуска трех простых сценариев:
- Сайт кофейни – простой статический сайт, плюс дополнительное задание добавить бронирование столиков.
- Приложение списка дел – требует общую базу данных с самого начала, затем добавляет возможность загрузки фотографий.
- Приложение "Что я могу приготовить" – пользователи вводят ингредиенты, а сайт использует AI Gateway для генерации рецептов.
Они оценивали функциональность (а не дизайн), проверяя такие вещи: использует ли базу данных, когда это необходимо? Правильно ли использует Netlify Database? Избегает ли излишней сложности? Модели, которые постоянно не проходят проверки, не предлагаются в Agent Runners.
Ключевые выводы
Полный отчет, доступный в их блоге, показывает сгенерированный сайт каждой модели, заметки о важных проблемах и стоимость кредитов. Хотя они не публиковали официальные оценки в этом посте, они подчеркивают большие различия в результатах. Например, они упоминают запуск GPT 5.6 Sol с низкими усилиями по умолчанию, предлагая более экономичную альтернативу Opus, которая по-прежнему дает "довольно хорошие результаты".
Они также отметили, что стоимость кредитов сильно варьируется между моделями для одной и той же задачи, поэтому вы можете платить больше за модель, которая не дает лучших результатов.
Вывод
Если вы выбираете модель для кодинга для своих собственных агентных проектов, это полезный источник данных. Тест фокусируется на реальных сценариях веб-разработки и включает модели с открытым исходным кодом, которые часто разрекламированы. Результаты субъективны (они это признают), но их стоит просмотреть, прежде чем выбрать модель по умолчанию или тратить кредиты.
Примечание: Это первая часть серии; последующие посты будут углубляться в другие сценарии использования.
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также

Сравнение RunLobster и размещенных решений OpenClaw
Разработчик тестировал RunLobster против KiwiClaw, xCloud и самостоятельно размещённого OpenClaw по 2 недели каждый. RunLobster принципиально отличается как продукт, а не просто хостинг, с 3000 интеграций в один клик и памятью, которая накапливается со временем.

Агентская рабочая память: Локальная система памяти для агентов ИИ, занимающихся программированием
AgentWorkingMemory (AWM) — это локальная система памяти, которая решает проблему амнезии между сессиями в AI-агентах для программирования. Она использует базу данных SQLite, три локальные ML-модели (всего ~124 МБ) и автоматически интегрируется через MCP, обеспечивая постоянную, контекстно-зависимую память между сессиями Claude Code.

Представляем Swarmcore: Масштабируемая многоагентная система на Python
Swarmcore — это библиотека с открытым исходным кодом для выполнения масштабируемых многопользовательских рабочих процессов на Python, предлагающая последовательное или параллельное выполнение и расширяемое управление контекстом.

Плагин Creative Excellence для Claude Code повышает качество анимации с помощью тезиса взаимодействия
Новый плагин с открытым исходным кодом для Claude Code решает проблему создания шаблонных анимаций, внедряя подход 'интерактивной концепции', при котором Claude должен сначала описать идею движения, прежде чем писать код. Плагин включает 8 поднавыков, охватывающих GSAP, Framer Motion, CSS-анимации и принципы дизайна из изученных репозиториев.