Modelos de peso aberto com menos de 100GB não conseguem superar o Claude Haiku em benchmarks de codificação.

✍️ OpenClawRadar📅 Publicado: February 26, 2026🔗 Source
Modelos de peso aberto com menos de 100GB não conseguem superar o Claude Haiku em benchmarks de codificação.
Ad

Uma análise recente de modelos de linguagem de peso aberto revela uma lacuna significativa de desempenho em comparação com o Claude Haiku da Anthropic em benchmarks de programação. A comparação foi conduzida usando parâmetros de teste específicos e requisitos de memória.

Metodologia do benchmark

A avaliação comparou modelos em dois benchmarks de programação: LiveBench (janeiro de 2026) e Arena Code/WebDev. O teste foi realizado contra o Claude Haiku 4.5 com capacidades de pensamento habilitadas. Os modelos foram plotados de acordo com os requisitos de memória para implantação local.

Especificações técnicas

  • Quantização: Q4_K_M
  • Comprimento do contexto: 32K
  • Cache KV: q8_0
  • Estimativa de VRAM: Calculada usando a calculadora personalizada do autor
Ad

Principais descobertas

Nenhum modelo de peso aberto abaixo de 100GB de memória se aproxima do desempenho do Claude Haiku em nenhum dos benchmarks. O concorrente mais próximo é o Minimax M2.5, que requer aproximadamente 136GB de memória e corresponde aproximadamente ao desempenho do Haiku em ambos os benchmarks.

A análise destaca a lacuna atual entre modelos proprietários e de peso aberto na categoria abaixo de 100GB para tarefas de programação. O autor expressa frustração com essa limitação e pede o desenvolvimento de modelos menores que possam pelo menos igualar as capacidades do Haiku.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Claude Opus 4.1 marca 17,75% no conjunto de dados privado do SWE-Bench Pro, destacando a lacuna entre memorização e raciocínio.
News

Claude Opus 4.1 marca 17,75% no conjunto de dados privado do SWE-Bench Pro, destacando a lacuna entre memorização e raciocínio.

Claude Opus 4.1 obteve 80% no SWE-Bench Verified, mas caiu para 17,75% no conjunto de dados privado do SWE-Bench Pro, com 276 tarefas de 18 bases de código proprietárias de startups. A análise da Scale AI descobriu que os modelos estavam navegando por memória em vez de raciocinar em repositórios familiares.

OpenClawRadar
Anthropic pausa a alteração de crédito do Claude Agent SDK após feedback dos usuários
News

Anthropic pausa a alteração de crédito do Claude Agent SDK após feedback dos usuários

A Anthropic enviou um e-mail aos usuários hoje informando que está pausando a mudança planejada que transferiria o Agent SDK, claude-p e aplicativos de terceiros para um crédito mensal dedicado, em vez de utilizar os limites de taxa da assinatura.

OpenClawRadar
Hospitais de Nova York encerram contrato com Palantir enquanto expansão no Reino Unido enfrenta escrutínio
News

Hospitais de Nova York encerram contrato com Palantir enquanto expansão no Reino Unido enfrenta escrutínio

O sistema de hospitais públicos da cidade de Nova York não renovará seu contrato de US$ 4 milhões com a Palantir em outubro, fazendo a transição para sistemas internos. Enquanto isso, a Palantir enfrenta preocupações com a privacidade devido ao seu acordo de £ 330 milhões com o NHS e ao novo contrato de regulação financeira do Reino Unido.

OpenClawRadar
🦀
News

Debian vota sobre política de contribuição de IA/LLM: O que os desenvolvedores precisam saber

O projeto Debian iniciou uma votação sobre o futuro das contribuições de IA/LLM. O resultado definirá como o código gerado por IA será tratado nos pacotes Debian.

OpenClawRadar