SWE-rebench-V2 veröffentlicht: Größtes offenes mehrsprachiges Datenset für Code-Agenten-Training

✍️ OpenClawRadar📅 Veröffentlicht: 7. März 2026🔗 Source
SWE-rebench-V2 veröffentlicht: Größtes offenes mehrsprachiges Datenset für Code-Agenten-Training
Ad

Veröffentlichungsdetails von SWE-rebench-V2

Das Forschungsteam von Nebius unter der Leitung von Ibragim hat SWE-rebench-V2 veröffentlicht, den sie als "derzeit den größten offenen Datensatz der Welt zum Training von Coding-Agenten" beschreiben. Der Datensatz ist mehrsprachig und ausführbar und wurde speziell für das Training von Reinforcement Learning im großen Maßstab entwickelt.

Wichtige technische Merkmale

Das Team hat eine automatisierte Pipeline aufgebaut, um RL-Umgebungen in großem Maßstab zu extrahieren. Diese Veröffentlichung umfasst:

  • Den vollständigen SWE-rebench-V2-Datensatz
  • Einen detaillierten technischen Bericht
  • Paper und Datensatz verfügbar unter: https://huggingface.co/papers/2602.23866
Ad

Community und Unterstützung

Das Team bietet aktive Discord-Unterstützung sowohl für den Datensatz als auch für ihre SWE-rebench Bestenliste unter: https://discord.gg/wXYmWpMu. Sie merken an, dass die LocalLLaMA-Community "das wertvollste Feedback" für ihre Arbeit mit der SWE-rebench Bestenliste geliefert hat und bestätigen, dass sie weiter an der Bestenliste arbeiten mit Plänen, sie "noch cooler zu machen".

Für Forschungskooperationen oder Fragen kann Ibragim per DM auf Reddit oder Twitter (X) erreicht werden unter: https://x.com/ibragim_bad.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

🦀
Werkzeuge

Tokenloser API-Gateway leitet KI-Verkehr zwischen Modellen, um Kosten zu halbieren

Tokenless ist ein API-Gateway, das KI-Agenten-Anfragen dynamisch von Modell zu Modell weiterleitet. Es erreicht die Leistung von Claude Fable 5 zu halben Kosten, indem es mehrere Modelle gleichzeitig abfragt und das beste während der Generierung auswählt.

OpenClawRadar
LLM-Memory.net: Open-Source-Speichersystem mit Multi-Agenten-Infrastruktur
Werkzeuge

LLM-Memory.net: Open-Source-Speichersystem mit Multi-Agenten-Infrastruktur

LLM-Memory.net ist ein selbst-hostbares Speichersystem für KI-Agenten, das Notizenspeicherung mit semantischer Suche, Echtzeit-Chat-/Mail-Kommunikation zwischen Agenten, strukturierte Diskussionen mit Abstimmungen und MCP-Server-Integration bietet. Der vollständige Quellcode ist auf GitHub mit Installer und Ansible Playbooks verfügbar.

OpenClawRadar
Skillware fügt prompt_rewriter für deterministische Token-Kompression in Claude API-Agenten-Schleifen hinzu
Werkzeuge

Skillware fügt prompt_rewriter für deterministische Token-Kompression in Claude API-Agenten-Schleifen hinzu

Skillware hat eine neue prompt_rewriter-Funktion integriert, die Prompts vor dem Senden an die Claude-API um 50-80% komprimiert, wodurch Kosten in agentenbasierten Schleifen reduziert werden, während das deterministische Komprimieren ein stabiles Verhalten gewährleistet.

OpenClawRadar
Mia: Lokaler KI-Arbeitsbereich-Daemon mit nativer Android-App und P2P-Streaming
Werkzeuge

Mia: Lokaler KI-Arbeitsbereich-Daemon mit nativer Android-App und P2P-Streaming

Mia ist ein Daemon, der auf Ihrem Computer läuft und sich über P2P mit einer nativen Android-App verbindet, sodass Sie langlaufende KI-Codierungsaufgaben von Ihrem Handy aus starten und überwachen können. Er unterstützt OpenCode, Claude Code, Gemini CLI und Codex-Agenten und streamt die Ausgabe in Echtzeit direkt auf Ihr Gerät.

OpenClawRadar