LLMock : Serveur de simulation basé sur HTTP pour des tests déterministes de LLM entre processus

✍️ OpenClawRadar📅 Publié: March 14, 2026🔗 Source
LLMock : Serveur de simulation basé sur HTTP pour des tests déterministes de LLM entre processus
Ad

LLMock est un serveur de simulation qui intercepte les appels d'API LLM en s'exécutant comme un véritable serveur HTTP sur un port spécifié, permettant des tests déterministes sur plusieurs processus sans solliciter les API payantes.

Ad

Détails clés

L'outil a été découvert après qu'un développeur ait dépensé 12 $ en exécutant des tests Playwright sur les véritables API OpenAI. Le problème est survenu lors de l'utilisation de MSW (Mock Service Worker), qui modifie le module HTTP à l'intérieur du processus Node.js qui appelle server.listen(), mais laisse les processus séparés (comme un agent Python) complètement aveugles à la simulation.

Avec LLMock, vous pointez la variable d'environnement OPENAI_BASE_URL vers le serveur de simulation depuis chaque processus, qu'il s'agisse de Node.js, Python ou tout autre langage :

const mock = new LLMock({ port: 5555 });
await mock.start();
process.env.OPENAI_BASE_URL = "http://localhost:5555/v1";

Les fixtures sont de simples fichiers JSON qui correspondent à des sous-chaînes de messages utilisateur ou à des motifs regex, éliminant le code passe-partout des gestionnaires :

{
  "fixtures": [
    {
      "match": { "userMessage": "stock price of AAPL" },
      "response": { "content": "The current stock price of Apple Inc. (AAPL) is $150.25." }
    }
  ]
}

Fonctionnalités clés de la source :

  • Utilise correctement le format SSE réel d'OpenAI/Claude/Gemini (se tromper sur les types d'événements perturbe subtilement le streaming)
  • Prise en charge complète des appels d'outils - les frameworks d'agents les exécutent normalement
  • Routage par prédicat pour inspecter l'état de l'invite système ou l'historique des messages pour les flux multi-agents
  • Journal des requêtes pour vérifier ce qui a réellement été appelé, pas seulement si le test a réussi
  • Zéro dépendance

Le développeur a fini avec 9 appels LLM sur 3 tests Playwright, coûtant 0 $ et produisant des résultats déterministes à chaque exécution.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Claude Octopus v8.48 : Plugin d'Orchestration Multi-IA pour les Flux de Travail de Développement
Tools

Claude Octopus v8.48 : Plugin d'Orchestration Multi-IA pour les Flux de Travail de Développement

Claude Octopus v8.48 est un plugin open-source qui orchestre les modèles d'IA Claude, Codex et Gemini en parallèle avec des rôles distincts à travers les phases de développement. Il inclut une porte de consensus à 75 % entre les phases, des fenêtres de contexte fraîches pour les tâches complexes, et des commandes spécifiques comme /octo:embrace pour le développement complet du cycle de vie.

OpenClawRadar
🦀
Tools

MTP + Mémoire Unifiée améliore l'inférence de llama.cpp de 30% sur RTX 5090

L'activation de la spéculation MTP avec GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 fait passer Qwen3.6-27B Q8_0 de 49 à 64 tok/s sur une RTX 5090 avec 128 Go de RAM système.

OpenClawRadar
Shipshots MCP Server : Claude conçoit des captures d'écran de l'App Store et des vidéos de prévisualisation
Tools

Shipshots MCP Server : Claude conçoit des captures d'écran de l'App Store et des vidéos de prévisualisation

Shipshots est un éditeur visuel doté d'un serveur MCP qui permet à Claude de concevoir des supports marketing via des appels d'outils. Il génère des captures d'écran pour les boutiques d'applications, des vidéos d'aperçu animées et des visuels pour les réseaux sociaux à partir de descriptions textuelles.

OpenClawRadar
Résultats de référence : L'Agent en essaim Claude avec système de mémoire permet des économies de coûts de tokens de 30 à 43 %
Tools

Résultats de référence : L'Agent en essaim Claude avec système de mémoire permet des économies de coûts de tokens de 30 à 43 %

Un développeur a testé un essaim de 6 agents Claude sur une tâche de codage de 40 points, avec et sans un système de mémoire personnalisé appelé Stompy. Les résultats montrent que Sonnet 4.6 avec mémoire a obtenu des scores parfaits à 3,98 $ contre 7,04 $ sans, tandis que Haiku 4.5 a complètement échoué sans mémoire mais a obtenu 39/40 avec.

OpenClawRadar