Codeset melhora os agentes de codificação com contexto específico do repositório a partir do histórico do git.

✍️ OpenClawRadar📅 Publicado: April 17, 2026🔗 Source
Codeset melhora os agentes de codificação com contexto específico do repositório a partir do histórico do git.
Ad

O que o Codeset faz

O Codeset executa um pipeline sobre o seu histórico do git e gera arquivos que ficam diretamente no seu repositório. Esses arquivos incluem: bugs anteriores por arquivo com causas raiz, armadilhas conhecidas, relações de co-mudança e listas de verificação de testes. O agente de programação lê esses arquivos como parte de sua janela de contexto normal. Sem RAG, sem banco de dados vetorial no momento da consulta, sem infraestrutura de tempo de execução necessária—apenas arquivos estáticos que seu agente pega como qualquer outro arquivo no repositório.

Resultados de benchmark

A equipe testou o Codeset com dois benchmarks:

  • codeset-gym-python (150 tarefas, mesmo subconjunto da avaliação do Claude): 60,7% → 66% (+5,3 pontos percentuais)
  • SWE-Bench Pro (400 tarefas amostradas aleatoriamente): 56,5% → 58,5% (+2 pontos percentuais)

Isso mostra uma melhoria consistente em ambos os benchmarks, com ganhos menores no SWE-Bench Pro em comparação com o codeset-gym. O benchmark codeset-gym é público com lista completa de tarefas e verificadores disponíveis para verificação da metodologia.

Ad

Preços e disponibilidade

O Codeset custa US$ 5 por repositório, pagamento único. Use o código CODESETLAUNCH para um teste gratuito. Os artefatos completos de avaliação estão disponíveis em https://github.com/codeset-ai/codeset-release-evals.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

ETL-D MCP Server: Análise Determinística de CSV para Claude para Prevenir Alucinações Financeiras
Tools

ETL-D MCP Server: Análise Determinística de CSV para Claude para Prevenir Alucinações Financeiras

Um desenvolvedor criou o ETL-D, um servidor MCP de código aberto para o Claude Desktop que processa CSVs em três camadas determinísticas para prevenir alucinações de ponto decimal em dados financeiros. Ele usa analisadores Python para formatos conhecidos, alcança tempos de resposta de ~70ms com 0 chamadas LLM para 200 requisições paralelas, e usa LLMs apenas como fallback para texto de alta entropia.

OpenClawRadar
🦀
Tools

OpenClaw no Android: Computador de IA privado do tamanho de um polegar roda OpenClaw em uma VM

O PlugClaw da Trustkernel é um stick USB do tamanho de um polegar que roda Android e OpenClaw em uma VM dedicada, adicionando um agente de GUI para interagir com aplicativos Android em qualquer telefone ou laptop.

OpenClawRadar
Referência: MLX vs Ollama Executando Qwen3-Coder-Next 8-Bit no MacBook Pro M5 Max
Tools

Referência: MLX vs Ollama Executando Qwen3-Coder-Next 8-Bit no MacBook Pro M5 Max

Um benchmark comparando os backends MLX e Ollama executando a quantização de 8 bits do Qwen3-Coder-Next em um MacBook Pro M5 Max com 128 GB de RAM mostrou que o MLX atingiu aproximadamente 72 tokens por segundo, cerca do dobro da taxa de transferência do Ollama em várias tarefas de programação.

OpenClawRadar
Site Interativo Simula Estrutura de Projetos de Código Claude
Tools

Site Interativo Simula Estrutura de Projetos de Código Claude

Um desenvolvedor criou exploreclaudecode.com, uma simulação baseada em navegador de um projeto Claude Code com uma árvore de arquivos funcional, arquivos configuráveis e painel de terminal. O site explica como os diretórios .claude/, arquivos de configuração, habilidades, agentes, hooks e configurações MCP funcionam juntos.

OpenClawRadar