Netlify testa 11 modelos de IA para codificação: Qual é o melhor?
A Netlify publicou uma comparação no mundo real de 11 modelos de IA executando prompts de codificação idênticos, usando sua ferramenta de avaliação recém-código aberto, AXIS. Os testes cobrem tarefas comuns de desenvolvimento web, como criar um site de cafeteria, um aplicativo de lista de tarefas e um aplicativo de receitas com IA, dando a você dados concretos sobre a qualidade dos modelos e custos de créditos.
Esta comparação vem logo após a parceria da Netlify com a OpenRouter, que permite que seus projetos usem qualquer modelo na OpenRouter através do AI Gateway. Para seus Agent Runners (a caixa de prompt de chat na Netlify que constrói ou itera em projetos), eles adicionaram o agente de código aberto OpenCode para que você possa usar uma gama mais ampla de modelos, incluindo Kimi K3, GLM 5.2 e DeepSeek V4.
O que eles testaram
A Netlify usou sua estrutura AXIS interna para executar três casos de uso simples:
- Site de cafeteria – site estático simples, com um acompanhamento para adicionar reservas de assentos.
- Aplicativo de lista de tarefas – requer um banco de dados compartilhado desde o início e depois adiciona uploads opcionais de fotos.
- Aplicativo "O que posso cozinhar" – os usuários inserem ingredientes, e o site usa o AI Gateway para gerar receitas.
Eles avaliaram a funcionalidade (não o design), verificando coisas como: Ele usa um banco de dados quando necessário? Ele usa o Netlify Database corretamente? Ele evita engenharia excessiva? Os modelos que falham consistentemente nas verificações não são oferecidos nos Agent Runners.
Principais descobertas
O relatório completo, disponível em seu blog, mostra o site gerado por cada modelo, notas sobre problemas notáveis e custos de créditos. Embora eles não tenham publicado pontuações oficiais neste post, eles destacam grandes diferenças nos resultados. Por exemplo, eles mencionam executar GPT 5.6 Sol com baixo esforço por padrão, oferecendo uma alternativa mais econômica ao Opus que ainda dá "resultados muito bons".
Eles também observaram que o custo de créditos varia muito entre os modelos para a mesma tarefa, então você pode estar pagando um prêmio por um modelo que não produz um resultado melhor.
Conclusão
Se você está escolhendo um modelo de codificação para seus próprios projetos baseados em agentes, este é um ponto de dados útil. O teste foca em cenários reais de desenvolvimento web e inclui modelos de código aberto que são frequentemente badalados. Os resultados são subjetivos (eles admitem), mas vale a pena revisar antes de se comprometer com um modelo padrão ou gastar créditos.
Nota: Este é o primeiro de uma série; posts de acompanhamento mergulharão nos outros casos de uso.
📖 Leia a fonte completa: HN LLM Tools
👀 See Also

BaseLayer: Pipeline de Compressão Comportamental de Código Aberto para Sistemas de Memória de IA
BaseLayer é um pipeline de código aberto que extrai crenças, comportamentos, tensões e contradições de conversas, diários e textos publicados, comprimindo-os em um resumo de identidade para modelos de IA. Foi testado em conjuntos de dados que variam de 8 entradas de diário pessoal a grandes corpora, como as cartas aos acionistas de Warren Buffett (350 mil palavras) e os memorandos de investimento de Howard Marks (600 mil palavras).

O Protocolo AVP Permite que Agentes LLM Compartilhem o Cache KV em vez de Texto para Eficiência de Tokens
AVP (Protocolo de Vetor de Agente) permite que agentes LLM passem o cache KV diretamente entre eles em vez de texto, reduzindo o processamento de tokens em 73-78% e alcançando acelerações de 2-4x nos modelos Qwen, Llama e DeepSeek. O protocolo funciona com conectores HuggingFace e vLLM e está disponível como um pacote Python.

Servidores MCP Hospedados Publicamente para Dados de Saúde, Acadêmicos e Governamentais
Um desenvolvedor criou e hospeda publicamente 14 servidores MCP que fornecem acesso a conjuntos de dados do CDC, ensaios clínicos, dados da FDA, publicações acadêmicas, informações do congresso, dados meteorológicos e outras utilidades. Esses servidores não exigem configuração, chaves de API ou instalação local.

O Modo de Plano de Código do Claude Reduz a Taxa de Retrabalho de 40% para Quase Zero
Um desenvolvedor monitorou mais de 30 sessões de codificação com o Claude Code e descobriu que pular o Modo Plano resultou em refazer tarefas do zero 40% das vezes. Com o Modo Plano, a taxa de refazer caiu para basicamente zero, com um recurso levando 17 minutos no total versus 35+ minutos sem planejamento.