LLMock: HTTP-basierter Mocking-Server für deterministische LLM-Tests über Prozesse hinweg

✍️ OpenClawRadar📅 Veröffentlicht: 14. März 2026🔗 Source
LLMock: HTTP-basierter Mocking-Server für deterministische LLM-Tests über Prozesse hinweg
Ad

LLMock ist ein Mocking-Server, der LLM-API-Aufrufe abfängt, indem er als echter HTTP-Server auf einem bestimmten Port läuft, und ermöglicht so deterministisches Testen über mehrere Prozesse hinweg, ohne kostenpflichtige APIs anzusprechen.

Ad

Wichtige Details

Das Tool wurde entdeckt, nachdem ein Entwickler 12 US-Dollar für Playwright-Tests gegen echte OpenAI-APIs ausgegeben hatte. Das Problem trat auf, als MSW (Mock Service Worker) verwendet wurde, das das HTTP-Modul innerhalb des Node.js-Prozesses patcht, der server.listen() aufruft, aber separate Prozesse (wie einen Python-Agenten) völlig unberührt von der Simulation lässt.

Mit LLMock zeigen Sie die Umgebungsvariable OPENAI_BASE_URL von jedem Prozess aus auf den Mock-Server, unabhängig davon, ob es sich um Node.js, Python oder eine andere Sprache handelt:

const mock = new LLMock({ port: 5555 });
await mock.start();
process.env.OPENAI_BASE_URL = "http://localhost:5555/v1";

Fixtures sind einfache JSON-Dateien, die auf Teilzeichenketten von Benutzernachrichten oder Regex-Muster abgestimmt sind und Boilerplate-Code für Handler eliminieren:

{
  "fixtures": [
    {
      "match": { "userMessage": "stock price of AAPL" },
      "response": { "content": "The current stock price of Apple Inc. (AAPL) is $150.25." }
    }
  ]
}

Wichtige Funktionen aus der Source:

  • Spricht das tatsächliche OpenAI/Claude/Gemini SSE-Format korrekt (falsche Event-Typen brechen Streaming auf subtile Weise)
  • Vollständige Tool-Aufruf-Unterstützung – Agent-Frameworks führen sie normal aus
  • Prädikat-Routing zur Überprüfung des System-Prompt-Zustands oder Nachrichtenverlaufs für Multi-Agent-Flows
  • Request-Journal, um zu prüfen, was tatsächlich aufgerufen wurde, nicht nur ob der Test bestanden wurde
  • Keine Abhängigkeiten

Der Entwickler endete mit 9 LLM-Aufrufen über 3 Playwright-Tests hinweg, kostete 0 US-Dollar und erzielte bei jedem Durchlauf deterministische Ergebnisse.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

APEX-Testbenchmark-Ergebnisse: Qwen 3.5-Leistung bei echten Programmieraufgaben
Werkzeuge

APEX-Testbenchmark-Ergebnisse: Qwen 3.5-Leistung bei echten Programmieraufgaben

APEX-Testing-Benchmark-Ergebnisse zeigen die Leistung der Qwen-3.5-Modelle bei 70 echten GitHub-Coding-Aufgaben, wobei die 397B-Version bei Master-Level-Aufgaben auf 1194 ELO abfällt, während GLM-4.7 quantisiert mit 1572 ELO die lokalen Modelle anführt.

OpenClawRadar
Chrome-Erweiterung verbindet Google Messages über MCP mit Claude Code
Werkzeuge

Chrome-Erweiterung verbindet Google Messages über MCP mit Claude Code

Ein Entwickler hat eine Chrome-Erweiterung erstellt, die Google Messages Web mit Claude Code über MCP mit stdio und WebSocket-Transport verbindet. Die Erweiterung listet Chats auf, liest Nachrichten und verfasst Antworten, kann aber derzeit aufgrund der Angular zone.js-Isolation keine Nachrichten senden.

OpenClawRadar
Meta Ads MCP OAuth funktioniert, aber die meisten Werbekonten sind noch nicht aktiviert
Werkzeuge

Meta Ads MCP OAuth funktioniert, aber die meisten Werbekonten sind noch nicht aktiviert

Der Meta Ads MCP OAuth-Flow funktioniert und lädt 29 Tools, aber ads_get_ad_accounts gibt is_ads_mcp_enabled: false zurück mit der Nachricht, dass die Funktion schrittweise ausgerollt wird.

OpenClawRadar
Khael KI-Agent teilt Produktionsarchitekturentscheidungen für OpenClaw mit
Werkzeuge

Khael KI-Agent teilt Produktionsarchitekturentscheidungen für OpenClaw mit

Khael, ein KI-autonomer Agent, der auf OpenClaw läuft, erläutert spezifische Architekturentscheidungen, die sich seit Monaten in der Produktion bewährt haben, einschließlich separater LAWS.md-Dateien, Modusdateien, Selbstprüfungs-Cron-Jobs und spezialisierter Bot-Typen.

OpenClawRadar