Spec27: Spezifikationsgesteuerte Validierung für KI-Agenten – API-Level-Tests ohne internen Zugriff

Safe Intelligence hat Spec27 gestartet, ein spezifikationsgesteuertes Validierungstool für KI-Agenten. Im Gegensatz zu traditionellen LLM-Evaluierungs-Frameworks, die allgemeines Modellverhalten bewerten, ermöglicht Spec27 Teams, wiederverwendbare Spezifikationen für die spezifische Aufgabe zu definieren, die ein Agent erfüllen muss. Tests werden automatisch aus diesen Spezifikationen generiert und nur gegen die primären Schnittstellen des Agenten ausgeführt — ohne Annahmen über den internen Stack, ohne SDKs oder Gateways.
Hauptmerkmale
- Outside-in-Testing: Alle Tests werden gegen die exponierte API oder UI des Agenten ausgeführt. Es ist nicht nötig, die Interna des Agenten zu instrumentieren, was entscheidend für Agenten ist, die auf Vendor-Plattformen aufbauen, bei denen der Stack nicht kontrolliert wird.
- Spezifikationsgesteuerte Testgenerierung: Definiere Spezifikationen in Bezug auf erwartetes Verhalten (z. B. „wenn nach X gefragt, muss Y tun und Z nicht tun“). Spec27 generiert automatisch adversarielle und Robustheitsprüfungen und zeigt Empfindlichkeiten und Regressionen, wenn Modelle, Prompts oder Tools geändert werden.
- Früher Zugang: Derzeit am stärksten für Single-Turn-Agenten- und Anwendungsvalidierung. Multi-Turn-Interaktionen und umfangreichere Telemetrie-/Tool-Call-Integration sind in der Roadmap.
Für wen ist es gedacht
Teams, die interne Agenten, Vendor-Agenten oder KI-Systeme einsetzen, bei denen Zuverlässigkeit wichtiger ist als Benchmark-Ergebnisse. Wenn du Agenten auf Plattformen testest, die keine Interna preisgeben, adressiert Spec27s Black-Box-Ansatz direkt diese Lücke.
Erste Schritte
Spec27 ist offen für eine Testphase für HN-Leser. Die Startseite bietet einen Beispielworkflow, den du ohne Einrichtung erkunden kannst. Melde dich an unter spec27.ai/launch.
📖 Lese die vollständige Quelle: HN AI Agents
👀 Siehe auch

Krasis: Hybride CPU/GPU-Laufzeitumgebung für große MoE-Modelle erreicht 3.324 Tok/s Prefill auf RTX 5080
Krasis ist eine hybride CPU/GPU-Laufzeitumgebung, die große MoE-Modelle ausführt, indem sie die Vorausfüllung auf der GPU und die Dekodierung auf der CPU verarbeitet. Sie erreicht 3.324 Token/Sekunde bei der Vorausfüllung auf einer RTX 5080 mit Qwen3-Coder-Next 80B Q4. Sie benötigt etwa das 2,5-fache der Modellgröße im System-RAM, ermöglicht aber die Ausführung von Modellen, die für den VRAM zu groß sind.

MemAware-Benchmark testet KI-Gedächtnis über die Stichwortsuche hinaus
MemAware ist ein Benchmark mit 900 Fragen über 3 Schwierigkeitsgrade, der testet, ob KI-Assistenten mit Gedächtnis relevante Kontexte abrufen können, wenn Anfragen keine Hinweise darauf geben. Ergebnisse zeigen: BM25-Suche erzielte 2,8 % gegenüber 0,8 % ohne Gedächtnis, während Vektorsuche bei domänenübergreifenden Verbindungen auf 0,7 % sinkt.

GitHub Comic Bot: Verwandelt Commits in tägliche mittelalterliche Ritter-Comics
Ein Bot, der GitHub-Commits liest und 4-teilige Comicstrips mit einem todernsten mittelalterlichen Ritter erstellt, gebaut mit Claude Code und Gemini, läuft auf GitHub Actions mit kostenlosen Tarifen.

Spectral: Erfassen Sie App-Traffic, um MCP-Server für OpenClaw-Agenten zu generieren
Spectral ist ein Open-Source-Tool, das den Datenverkehr von jeder Anwendung erfasst, ihn mit einem LLM analysiert und einen funktionierenden MCP-Server generiert, wodurch OpenClaw-Agenten die echte API der App direkt aufrufen können, anstatt sich auf Browser-Automatisierung zu verlassen.