SWE-rebench-V2 publié : le plus grand ensemble de données multilingues ouvert pour l'entraînement d'agents de code

Détails de la publication de SWE-rebench-V2
L'équipe de R&D de Nebius, dirigée par Ibragim, a publié SWE-rebench-V2, qu'ils décrivent comme "actuellement le plus grand ensemble de données ouvert au monde pour l'entraînement d'agents de codage". L'ensemble de données est multilingue et exécutable, conçu spécifiquement pour l'entraînement à grande échelle en apprentissage par renforcement.
Caractéristiques techniques clés
L'équipe a construit un pipeline automatisé pour extraire des environnements d'apprentissage par renforcement à grande échelle. Cette publication comprend :
- L'ensemble complet de données SWE-rebench-V2
- Un rapport technique détaillé
- L'article et l'ensemble de données disponibles à : https://huggingface.co/papers/2602.23866
Communauté et support
L'équipe maintient un support Discord actif pour l'ensemble de données et leur classement SWE-rebench à : https://discord.gg/wXYmWpMu. Ils notent que la communauté LocalLLaMA a fourni "les retours les plus précieux" pour leur travail avec le classement SWE-rebench et confirment qu'ils continuent à travailler sur le classement avec des plans pour "le rendre encore plus cool".
Pour des collaborations de recherche ou des questions, Ibragim peut être contacté par message privé sur Reddit ou Twitter (X) à : https://x.com/ibragim_bad.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Méthode d'Évolution du Code Triple les Performances des LLM sur le Benchmark ARC-AGI-2
Les chercheurs ont obtenu une amélioration de 2,8x sur le benchmark ARC-AGI-2 en utilisant l'évolution de code avec des modèles à poids ouvert, atteignant 34 % de précision à 2,67 $ par tâche. La même méthode a permis à Gemini 3.1 Pro d'atteindre 95 % de précision à 8,71 $ par tâche.

Serveur MCP pour les projets TypeScript remplace les motifs Grep de Claude Code par des recherches de symboles indexés
Un développeur a créé un serveur MCP qui remplace le modèle de recherche approximative de Claude Code par des recherches indexées de symboles pour les projets TypeScript. L'outil maintient un index SQLite en direct des symboles, des sites d'appel, des importations et de la hiérarchie des classes, réduisant l'utilisation de tokens de 63 à 79 % dans les tests.

AnyClaw : Ubuntu 24.04 avec accès au matériel Android et agent IA pour le développement en terminal
AnyClaw offre un environnement Ubuntu 24.04 complet fonctionnant dans proot sur Android avec un accès direct aux API matérielles Android depuis le terminal, y compris la caméra, le GPS, la batterie et les capteurs via des commandes bash et l'exécution Java. Il inclut un agent de codage IA capable d'orchestrer ces outils et une interface web accessible depuis n'importe quel navigateur sur le même réseau.

Deux outils MCP pour Claude Code : Validation d'idée et Mémoire d'agent de trading
Un développeur a créé deux outils MCP pour Claude Code : idea-reality-mcp vérifie GitHub et Hacker News avant de coder pour éviter les doublons, tandis que tradememory-protocol fournit une mémoire aux agents d'IA de trading pour stocker les transactions avec contexte et suivre la performance des stratégies. Les deux sont open source et disponibles sur PyPI.