SWE-rebench-V2 publié : le plus grand ensemble de données multilingues ouvert pour l'entraînement d'agents de code

Détails de la publication de SWE-rebench-V2
L'équipe de R&D de Nebius, dirigée par Ibragim, a publié SWE-rebench-V2, qu'ils décrivent comme "actuellement le plus grand ensemble de données ouvert au monde pour l'entraînement d'agents de codage". L'ensemble de données est multilingue et exécutable, conçu spécifiquement pour l'entraînement à grande échelle en apprentissage par renforcement.
Caractéristiques techniques clés
L'équipe a construit un pipeline automatisé pour extraire des environnements d'apprentissage par renforcement à grande échelle. Cette publication comprend :
- L'ensemble complet de données SWE-rebench-V2
- Un rapport technique détaillé
- L'article et l'ensemble de données disponibles à : https://huggingface.co/papers/2602.23866
Communauté et support
L'équipe maintient un support Discord actif pour l'ensemble de données et leur classement SWE-rebench à : https://discord.gg/wXYmWpMu. Ils notent que la communauté LocalLLaMA a fourni "les retours les plus précieux" pour leur travail avec le classement SWE-rebench et confirment qu'ils continuent à travailler sur le classement avec des plans pour "le rendre encore plus cool".
Pour des collaborations de recherche ou des questions, Ibragim peut être contacté par message privé sur Reddit ou Twitter (X) à : https://x.com/ibragim_bad.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

E2a : Passerelle de messagerie open source pour agents IA avec vérification SPF/DKIM et livraison par webhook/WebSocket
E2a est une passerelle e-mail authentifiée pour les agents IA qui vérifie SPF/DKIM sur les courriels entrants, délivre via webhook ou WebSocket, et prend en charge les courriels sortants avec approbation humaine dans la boucle.

cxt : Un outil CLI/TUI pour agréger des fichiers de code en un seul bloc de presse-papiers pour Claude
cxt agrège des répertoires et fichiers spécifiques en un bloc prêt pour le presse-papiers, avec des balises XML et des chemins de fichiers, facilitant la compréhension du contexte de votre codebase par Claude.

Test pratique du modèle de Tencent : performant pour les workflows agents, faible pour le codage complexe
Le modèle de Tencent obtient un 8/10 pour les tâches agentiques avec un faible taux d'hallucination, mais échoue sur le code complexe comme les schémas de l'API Notion. À éviter pour la logique backend.

Phaselock : Un système de contrôle d'agent IA inspiré des techniques parentales
Phaselock est une compétence d'agent open-source qui met en œuvre quatre mécanismes de contrôle pour les agents IA : des portes explicites avant l'action, un retour immédiat sur les erreurs, des choix contraints et l'application mécanique de règles. Il fonctionne avec Claude Code, Cursor, Windsurf et les outils prenant en charge les hooks.