Analyse von 2.181 Remote-MCP-Server-Endpunkten zeigt Zuverlässigkeitsprobleme

Eine kürzliche Analyse von 2.181 Remote-fähigen MCP-Server-Endpunkten zeigt erhebliche Zuverlässigkeitsprobleme im gesamten Ökosystem. Die automatisierten Gesundheitsprüfungen wurden an Servern aus dem offiziellen Registry, mcp.so, PulseMCP und Smithery durchgeführt.
Wichtige Ergebnisse
- 52 % der Endpunkte sind vollständig tot (Timeout, Verbindung abgelehnt, 404)
- 37 % antworten, erfordern jedoch Authentifizierung (401/403)
- 9 % sind als betriebsbereit und gesund bestätigt
- 1,5 % sind beeinträchtigt (langsam oder mit intermittierenden Fehlern)
- Unter den laufenden Servern halten 516 eine Verfügbarkeit von 99 %+
- 58 % der Server mit GitHub-Repos hatten in den letzten 30 Tagen keinen Commit
Kategorieaufschlüsselung
- Dev-Tools hat die meisten Server (1.238)
- Finance-Server haben die schlechteste durchschnittliche Latenz (2.558 ms)
- Security-Server haben die niedrigste durchschnittliche Verfügbarkeit mit 27 %
Schnellste gefundene Server
- GitHub MCP: 101 ms
- Timescale pg-aiguide: 104 ms
- Supabase: 109 ms
Der vollständige Datensatz steht für weitere Analysen zur Verfügung, und der Autor steht für Fragen zur Methodik oder zu bestimmten Servern offen.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Claude Code 2.1.63 fügt gebündelte Slash-Befehle, HTTP-Hooks und Speicherleck-Behebungen hinzu
Anthropic hat Claude Code 2.1.63 veröffentlicht mit 26 CLI-Änderungen, darunter neue /simplify- und /batch-Slash-Befehle, HTTP-Hooks, die JSON an URLs senden, und Behebungen für mehrere Speicherlecks in lang laufenden Sitzungen.

SPLICE-Benchmark zeigt: Visuell-sprachliche Modelle haben Schwierigkeiten mit zeitlichem Denken und verlassen sich auf Sprach-Priors
Auf der EMNLP 2025 vorgestellte Forschung zeigt, dass Vision-Language-Modelle bei einer Videosequenzierungsaufgabe, bei der Menschen hervorragend abschneiden, schlecht abschneiden. Modelle wie Gemini 2.0 Flash erreichen eine Genauigkeit von 51 %, während die menschliche Leistung bei 85 % liegt. Die Modelle verlassen sich häufig auf visuelle Abkürzungen und Sprachbeschreibungen anstatt auf ein echtes visuelles Verständnis.

Anthropics Claude-Mythos-KI-Modell durch Datenleck enthüllt, als "Quantensprung" in den Fähigkeiten beschrieben
Anthropic testet ein neues KI-Modell namens Claude Mythos (auch als Capybara bezeichnet), das einen 'Quantensprung' in der Leistung darstellt, mit deutlich höheren Punktzahlen bei Software-Codierung, akademischem Denken und Cybersicherheitstests im Vergleich zu Claude Opus 4.6. Die Existenz des Modells wurde durch ein Datenleck aus einem ungesicherten, öffentlich zugänglichen Datencache mit etwa 3.000 unveröffentlichten Assets aufgedeckt.

Claude Code v2.1.91 Updates: Agent-Design-Patterns, Speicherregeln und Tool-Verbesserungen
Claude Code v2.1.91 fügt einen Referenzleitfaden für Agent-Design-Patterns hinzu, der die Gestaltung von Werkzeugschnittstellen, Kontextmanagement und Caching-Strategien abdeckt. Das Update vereinfacht die Regeln für die Speicherauswahl, fügt Sicherheitsüberwachung für Memory Poisoning hinzu und verbessert die Werkzeugbeschreibungen für Edit-, ReadFile- und Write-Operationen.