SWE-rebench-V2 Lançado: Maior Conjunto de Dados Multilíngue Aberto para Treinamento de Agentes de Código

Detalhes do Lançamento do SWE-rebench-V2
A equipe de P&D da Nebius, liderada por Ibragim, publicou o SWE-rebench-V2, que eles descrevem como "atualmente o maior conjunto de dados aberto do mundo para treinar agentes de codificação". O conjunto de dados é multilíngue e executável, projetado especificamente para treinamento de aprendizado por reforço em grande escala.
Principais Características Técnicas
A equipe construiu um pipeline automatizado para extrair ambientes de RL em escala. Este lançamento inclui:
- O conjunto de dados completo SWE-rebench-V2
- Um relatório técnico detalhado
- Artigo e conjunto de dados disponíveis em: https://huggingface.co/papers/2602.23866
Comunidade e Suporte
A equipe mantém suporte ativo no Discord tanto para o conjunto de dados quanto para sua Tabela de Classificação SWE-rebench em: https://discord.gg/wXYmWpMu. Eles observam que a comunidade LocalLLaMA forneceu "o feedback mais valioso" para seu trabalho com a Tabela de Classificação SWE-rebench e confirmam que continuam trabalhando na tabela de classificação com planos para "torná-la ainda mais legal".
Para colaborações de pesquisa ou perguntas, Ibragim pode ser contatado por DM no Reddit ou Twitter (X) em: https://x.com/ibragim_bad.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

IronBee: Camada de verificação de código aberto para Claude Code e Cursor
IronBee é uma camada de verificação de código aberto que força agentes de IA de codificação a testar alterações em um navegador real antes de concluir tarefas. Nos testes, ele detectou bugs em 82% das sessões do Claude Code que teriam sido enviados sem verificação.

Monarch v3: Paginação KV Inspirada no NES para Inferência de LLM 78% Mais Rápida
O Monarch v3 implementa paginação de memória inspirada no NES para transformers, alcançando inferência 78% mais rápida (17,01 para 30,42 tok/seg) em um modelo de 1,1B de parâmetros com sobrecarga de VRAM quase zero. O algoritmo de código aberto divide o cache KV em regiões quentes e frias com mecanismos de compressão e promoção.

Memória Tri-Node: Memória Persistente de Agente Open Source com Separação de Cofre Humano/Agente
Tri-Node Memory é uma arquitetura leve que separa a memória de um agente de IA de codificação do diário persistente do humano usando dois cofres Obsidian. O agente lê do cofre humano, mas escreve apenas no seu próprio, nunca cruzando fronteiras sem permissão explícita.

Transcrição local de voz para texto para OpenClaw usando Parakeet TDT 0.6b v3
Um desenvolvedor converteu o modelo Parakeet TDT 0.6b v3 da NVIDIA para rodar localmente via ONNX em CPU, suportando 25 idiomas europeus. O modelo fornece um endpoint de API compatível com OpenAI através de um contêiner Docker, permitindo integração com o OpenClaw para transcrição de arquivos de áudio.