Codeset améliore les agents de codage avec un contexte spécifique au dépôt provenant de l'historique git.

Ce que fait Codeset
Codeset exécute un pipeline sur votre historique git et génère des fichiers qui résident directement dans votre dépôt. Ces fichiers incluent : les bugs passés par fichier avec leurs causes racines, les pièges connus, les relations de co-changement et les listes de contrôle de tests. L'agent de codage lit ces fichiers dans le cadre de sa fenêtre de contexte normale. Pas de RAG, pas de base de données vectorielle au moment de la requête, pas d'infrastructure d'exécution requise—juste des fichiers statiques que votre agent récupère comme n'importe quel autre fichier du dépôt.
Résultats de référence
L'équipe a testé Codeset avec deux références :
- codeset-gym-python (150 tâches, même sous-ensemble que l'évaluation Claude) : 60,7 % → 66 % (+5,3 points de pourcentage)
- SWE-Bench Pro (400 tâches échantillonnées aléatoirement) : 56,5 % → 58,5 % (+2 points de pourcentage)
Cela montre une amélioration constante sur les deux références, avec des gains plus faibles sur SWE-Bench Pro par rapport à codeset-gym. La référence codeset-gym est publique avec la liste complète des tâches et des vérificateurs disponibles pour la vérification de la méthodologie.
Tarification et disponibilité
Codeset coûte 5 $ par dépôt, paiement unique. Utilisez le code CODESETLAUNCH pour un essai gratuit. Les artefacts d'évaluation complets sont disponibles sur https://github.com/codeset-ai/codeset-release-evals.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Compétence de balayage de sécurité pour les agents d'IA de codage vérifiant automatiquement les déploiements
Un développeur a créé un fichier de compétence qui permet aux agents d'IA de codage d'analyser automatiquement leurs propres déploiements pour détecter des problèmes de sécurité comme des secrets exposés, des ports ouverts, des en-têtes de sécurité manquants et du code source divulgué. L'analyse s'exécute après chaque déploiement et prend environ 30 secondes.

Terrarium : Bac à sable open-source pour environnements agentiques avec rembobinage temporel
Une solution de bac à sable polyvalente pour exécuter plusieurs agents IA de manière sécurisée sur n'importe quel VPS ou cloud. Dispose de mondes isolés, d'une gestion de proxy inverse, d'interfaces graphiques et d'une machine à remonter le temps pour restaurer l'état des conteneurs.

Google Research présente TurboQuant pour la compression de modèles d'IA.
Google Research a présenté TurboQuant, un algorithme de compression qui réduit la taille des modèles d'IA sans perte de précision. Il traite la surcharge mémoire dans la quantification vectorielle et améliore les performances du cache clé-valeur.

cc-lens : Tableau de bord local pour l'analyse des sessions de code Claude
Un développeur a créé cc-lens, un tableau de bord local qui lit les fichiers de session Claude Code depuis ~/.claude/ et fournit des analyses d'utilisation, un suivi des coûts et une relecture des sessions. Il fonctionne entièrement sur votre machine sans synchronisation cloud, inscription ou télémétrie.