Spec27: Spezifikationsgesteuerte Validierung für KI-Agenten – API-Level-Tests ohne internen Zugriff

Safe Intelligence hat Spec27 gestartet, ein spezifikationsgesteuertes Validierungstool für KI-Agenten. Im Gegensatz zu traditionellen LLM-Evaluierungs-Frameworks, die allgemeines Modellverhalten bewerten, ermöglicht Spec27 Teams, wiederverwendbare Spezifikationen für die spezifische Aufgabe zu definieren, die ein Agent erfüllen muss. Tests werden automatisch aus diesen Spezifikationen generiert und nur gegen die primären Schnittstellen des Agenten ausgeführt — ohne Annahmen über den internen Stack, ohne SDKs oder Gateways.
Hauptmerkmale
- Outside-in-Testing: Alle Tests werden gegen die exponierte API oder UI des Agenten ausgeführt. Es ist nicht nötig, die Interna des Agenten zu instrumentieren, was entscheidend für Agenten ist, die auf Vendor-Plattformen aufbauen, bei denen der Stack nicht kontrolliert wird.
- Spezifikationsgesteuerte Testgenerierung: Definiere Spezifikationen in Bezug auf erwartetes Verhalten (z. B. „wenn nach X gefragt, muss Y tun und Z nicht tun“). Spec27 generiert automatisch adversarielle und Robustheitsprüfungen und zeigt Empfindlichkeiten und Regressionen, wenn Modelle, Prompts oder Tools geändert werden.
- Früher Zugang: Derzeit am stärksten für Single-Turn-Agenten- und Anwendungsvalidierung. Multi-Turn-Interaktionen und umfangreichere Telemetrie-/Tool-Call-Integration sind in der Roadmap.
Für wen ist es gedacht
Teams, die interne Agenten, Vendor-Agenten oder KI-Systeme einsetzen, bei denen Zuverlässigkeit wichtiger ist als Benchmark-Ergebnisse. Wenn du Agenten auf Plattformen testest, die keine Interna preisgeben, adressiert Spec27s Black-Box-Ansatz direkt diese Lücke.
Erste Schritte
Spec27 ist offen für eine Testphase für HN-Leser. Die Startseite bietet einen Beispielworkflow, den du ohne Einrichtung erkunden kannst. Melde dich an unter spec27.ai/launch.
📖 Lese die vollständige Quelle: HN AI Agents
👀 Siehe auch

MiniMax Music 2.5 KI-Musikgenerator veröffentlicht mit Studio-Qualität Audio-Kontrolle
MiniMax Music 2.5 ist ein KI-Musikgenerierungsmodell, das Studioqualitäts-Songs mit 44,1-kHz-Hi-Fi-Ausgabe, über 100 Instrumenten und präziser Absatzsteuerung erzeugt, wobei über 14 Struktur-Tags zur Lenkung der Songstruktur verwendet werden.

Antigravitation 2.0 führt OpenSCAD-Architektur-3D-Benchmark an – ModelRift testet 6 LLMs am Pantheon
ModelRift hat 6 LLMs getestet, die das Pantheon in OpenSCAD bauen. Antigravity erreichte 4,5/5 Punkte in architektonischer Qualität und schlug damit die Baseline Codex 5.5. Cursor 3.5 war am schnellsten, aber am schwächsten.

"Sitzungsspeicher-Funktion in Claude Code eingeführt"
Claude Code umfasst jetzt eine Funktion zur 'Sitzungsspeicherung', die Sitzung Zusammenfassungen in summary.md Dateien generiert und verwaltet. Schalte sie mit tweakcc für interaktive Sitzungen frei, die bestimmte Token- und Toolaufrufschwellen überschreiten.

Qure: Desktop-App zur Generierung von E2E-Tests aus aufgezeichneten Browser-Abläufen
Qure ist eine Desktop-Anwendung von JetBrains (derzeit in geschlossener Beta), die aus Aufnahmen im integrierten Browser vollständigen Web-Testcode generiert. Anstatt Testabläufe in Textform für KI-Agenten zu beschreiben, zeichnen Entwickler ihre manuellen QA-Szenarien durch Interaktion mit ihrem Produkt auf, und die KI erzeugt funktionierenden Testcode, der zu ihrer bestehenden Codebasis passt.