Netlify тестирует 11 ИИ-моделей для программирования: какая лучше?
Netlify опубликовал реальное сравнение 11 ИИ-моделей, выполнивших одинаковые промпты для кодинга, с использованием своего нового инструмента оценки с открытым исходным кодом AXIS. Тесты охватывают типичные задачи веб-разработки, такие как создание сайта кофейни, приложения для списка дел и приложения для рецептов с ИИ, предоставляя конкретные данные о качестве моделей и стоимости кредитов.
Это сравнение появилось сразу после партнерства Netlify с OpenRouter, которое позволяет вашим проектам использовать любую модель на OpenRouter через их AI Gateway. Для их Agent Runners (окно чат-промптов в Netlify, которое создает или развивает проекты) они добавили агента с открытым исходным кодом OpenCode, чтобы вы могли управлять более широким спектром моделей, включая Kimi K3, GLM 5.2 и DeepSeek V4.
Что они тестировали
Netlify использовал свой внутренний фреймворк AXIS для запуска трех простых сценариев:
- Сайт кофейни – простой статический сайт, плюс дополнительное задание добавить бронирование столиков.
- Приложение списка дел – требует общую базу данных с самого начала, затем добавляет возможность загрузки фотографий.
- Приложение "Что я могу приготовить" – пользователи вводят ингредиенты, а сайт использует AI Gateway для генерации рецептов.
Они оценивали функциональность (а не дизайн), проверяя такие вещи: использует ли базу данных, когда это необходимо? Правильно ли использует Netlify Database? Избегает ли излишней сложности? Модели, которые постоянно не проходят проверки, не предлагаются в Agent Runners.
Ключевые выводы
Полный отчет, доступный в их блоге, показывает сгенерированный сайт каждой модели, заметки о важных проблемах и стоимость кредитов. Хотя они не публиковали официальные оценки в этом посте, они подчеркивают большие различия в результатах. Например, они упоминают запуск GPT 5.6 Sol с низкими усилиями по умолчанию, предлагая более экономичную альтернативу Opus, которая по-прежнему дает "довольно хорошие результаты".
Они также отметили, что стоимость кредитов сильно варьируется между моделями для одной и той же задачи, поэтому вы можете платить больше за модель, которая не дает лучших результатов.
Вывод
Если вы выбираете модель для кодинга для своих собственных агентных проектов, это полезный источник данных. Тест фокусируется на реальных сценариях веб-разработки и включает модели с открытым исходным кодом, которые часто разрекламированы. Результаты субъективны (они это признают), но их стоит просмотреть, прежде чем выбрать модель по умолчанию или тратить кредиты.
Примечание: Это первая часть серии; последующие посты будут углубляться в другие сценарии использования.
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также
Claudy: Нативный macOS-обёртка для Claude Code с поддержкой множества сессий, автоматическим переключением аккаунтов и черновиками коммитов.
Claudy — это нативное приложение для macOS, созданное с использованием SwiftUI + SwiftData, которое оборачивает Claude Code, добавляя управление несколькими сессиями, автоматическое переключение учетных записей при превышении лимитов, черновики коммитов для контрольных точек внутри сессии и маркетплейс для Skills, MCP и Commands.

Homelab AI Sentinel: Самостоятельно размещаемый помощник для мониторинга с интеграцией LLM
Homelab AI Sentinel — это саморазмещаемый инструмент, который обрабатывает мониторинговые вебхуки через LLM для генерации диагнозов на простом английском языке. Он поддерживает 11 источников оповещений, 10 платформ уведомлений и работает с любыми OpenAI-совместимыми конечными точками, включая Ollama и LM Studio для локального вывода.

Управляемый сервис ClawCloud упрощает развертывание OpenClaw для команд в Slack.
ClawCloud предоставляет управляемый сервис развертывания для OpenClaw, который подключается к рабочим пространствам Slack, управляет инфраструктурой и снижает задержку ответа до менее 2 секунд. Пользователь сообщил о настройке за 20 минут против 3 дней при самостоятельном хостинге, со стоимостью около $30 в месяц для команды из 40 человек.

Среда выполнения Krasis LLM демонстрирует ускорение предзаполнения в 8,9 раза и ускорение декодирования в 4,7 раза по сравнению с Llama.cpp.
Среда выполнения Krasis LLM теперь полностью выполняет как предварительное заполнение, так и декодирование на GPU с различными стратегиями оптимизации, достигая ускорения предварительного заполнения в 8,9 раза и декодирования в 4,7 раза по сравнению с llama.cpp на Qwen3.5-122B с использованием одного GPU 5090.