Voker lance sa plateforme d'analyse d'agents avec les primitives Intention/Correction/Résolution
Voker.ai, une startup YC S24, a lancé une plateforme d'analyse conçue spécifiquement pour les agents IA. Le produit principal est un SDK léger (Python & TypeScript) qui encapsule les appels LLM vers OpenAI, Anthropic et Gemini, collectant automatiquement les données de conversation et annotant trois primitives : Intentions, Corrections et Résolutions.
Ce qu'il fait
Voker traite les appels LLM en classifiant automatiquement les objectifs des utilisateurs (intentions), en détectant quand les utilisateurs corrigent l'agent (corrections) et en mesurant quand l'agent résout l'intention (résolutions). Il utilise ensuite une classification hiérarchique de texte (pas de LLM pour le data engineering) pour les agréger en catégories dynamiques, offrant aux équipes produit des insights en libre-service sans avoir à lire des traces individuelles.
Détails clés du lancement
- Intégration SDK : Deux lignes pour installer :
pip install vokeret encapsuler le fournisseur LLM (par ex.,from voker.ai.provider_openai import OpenAI). - Indépendant de la pile LLM : Fonctionne avec OpenAI, Anthropic, Gemini, Langchain, CrewAI et Vercel AI SDK.
- Tarification : Niveau gratuit — 2 000 événements/mois (inscription par email requise). Les plans payants commencent à 80 $/mois avec un essai gratuit de 30 jours.
- Philosophie du data engineering : Voker évite explicitement d'utiliser des LLM pour le traitement central des données afin de garantir des statistiques cohérentes, reproductibles et précises. Les co-fondateurs notent que le téléchargement de logs dans ChatGPT donne souvent des insights surajustés ou incohérents.
Pourquoi ça existe
Selon une enquête auprès des fondateurs YC, 90 %+ ont déclaré que la seule façon de savoir que les agents échouent est via les plaintes des clients. Les outils existants sont insuffisants : l'observabilité (par ex., Langfuse, Langsmith) est bonne pour le débogage de traces mais pas accessible aux non-ingénieurs ; les évaluations testent les problèmes connus mais manquent les tendances inattendues ; les analyses traditionnelles (PostHog, Mixpanel) ne sont pas conçues pour les données conversationnelles non structurées.
À qui ça s'adresse
Équipes gérant des agents conversationnels à fort volume (1 000+ sessions de chat par mois) avec des interactions complexes à plusieurs tours, ayant besoin d'insights que les équipes transverses (PMs, ingénieurs, analystes) peuvent utiliser en libre-service.
📖 Lire la source complète : HN AI Agents
👀 See Also

CC-Canary : Détectez les régressions dans Claude Code grâce à une analyse JSONL locale
CC-Canary lit les journaux de session de Claude Code et produit un rapport forensique sur la dérive du modèle, incluant le ratio lecture/édition, les boucles de raisonnement, les tendances de coûts et les dates d'inflexion détectées automatiquement.

Nyx : Harnais de test autonome pour agents IA
Nyx est un harnais de test en boîte noire qui sonde les agents d'IA pour détecter des modes de défaillance comme des bogues logiques, des échecs de raisonnement et des vulnérabilités de sécurité via des conversations adaptatives multi-tours. Il teste en moins de 10 minutes ce que les audits manuels mettent des heures à révéler.

Mnemos : un serveur MCP pour la mémoire persistante de Claude Code
Mnemos est un serveur MCP open-source qui offre à Claude Code une mémoire persistante entre les sessions, en enregistrant les corrections sous forme de motifs structurés et en poussant un contexte classé au démarrage. Un seul binaire Go de 15 Mo, pas besoin de Docker ni de base vectorielle.

Mímir : Un système de mémoire Python basé sur 21 mécanismes de neurosciences
Mímir est un système de mémoire Python pour agents IA qui implémente 21 mécanismes de sciences cognitives comme la mémoire flash et l'oubli induit par la récupération. Il utilise un index hybride BM25 + sémantique + date et montre des améliorations de référence, notamment une précision d'outil 13% supérieure sur Mem2ActBench par rapport à VividnessMem.