LLMock: HTTP-basierter Mocking-Server für deterministische LLM-Tests über Prozesse hinweg

LLMock ist ein Mocking-Server, der LLM-API-Aufrufe abfängt, indem er als echter HTTP-Server auf einem bestimmten Port läuft, und ermöglicht so deterministisches Testen über mehrere Prozesse hinweg, ohne kostenpflichtige APIs anzusprechen.
Wichtige Details
Das Tool wurde entdeckt, nachdem ein Entwickler 12 US-Dollar für Playwright-Tests gegen echte OpenAI-APIs ausgegeben hatte. Das Problem trat auf, als MSW (Mock Service Worker) verwendet wurde, das das HTTP-Modul innerhalb des Node.js-Prozesses patcht, der server.listen() aufruft, aber separate Prozesse (wie einen Python-Agenten) völlig unberührt von der Simulation lässt.
Mit LLMock zeigen Sie die Umgebungsvariable OPENAI_BASE_URL von jedem Prozess aus auf den Mock-Server, unabhängig davon, ob es sich um Node.js, Python oder eine andere Sprache handelt:
const mock = new LLMock({ port: 5555 });
await mock.start();
process.env.OPENAI_BASE_URL = "http://localhost:5555/v1";Fixtures sind einfache JSON-Dateien, die auf Teilzeichenketten von Benutzernachrichten oder Regex-Muster abgestimmt sind und Boilerplate-Code für Handler eliminieren:
{
"fixtures": [
{
"match": { "userMessage": "stock price of AAPL" },
"response": { "content": "The current stock price of Apple Inc. (AAPL) is $150.25." }
}
]
}Wichtige Funktionen aus der Source:
- Spricht das tatsächliche OpenAI/Claude/Gemini SSE-Format korrekt (falsche Event-Typen brechen Streaming auf subtile Weise)
- Vollständige Tool-Aufruf-Unterstützung – Agent-Frameworks führen sie normal aus
- Prädikat-Routing zur Überprüfung des System-Prompt-Zustands oder Nachrichtenverlaufs für Multi-Agent-Flows
- Request-Journal, um zu prüfen, was tatsächlich aufgerufen wurde, nicht nur ob der Test bestanden wurde
- Keine Abhängigkeiten
Der Entwickler endete mit 9 LLM-Aufrufen über 3 Playwright-Tests hinweg, kostete 0 US-Dollar und erzielte bei jedem Durchlauf deterministische Ergebnisse.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

APEX-Testbenchmark-Ergebnisse: Qwen 3.5-Leistung bei echten Programmieraufgaben
APEX-Testing-Benchmark-Ergebnisse zeigen die Leistung der Qwen-3.5-Modelle bei 70 echten GitHub-Coding-Aufgaben, wobei die 397B-Version bei Master-Level-Aufgaben auf 1194 ELO abfällt, während GLM-4.7 quantisiert mit 1572 ELO die lokalen Modelle anführt.

Chrome-Erweiterung verbindet Google Messages über MCP mit Claude Code
Ein Entwickler hat eine Chrome-Erweiterung erstellt, die Google Messages Web mit Claude Code über MCP mit stdio und WebSocket-Transport verbindet. Die Erweiterung listet Chats auf, liest Nachrichten und verfasst Antworten, kann aber derzeit aufgrund der Angular zone.js-Isolation keine Nachrichten senden.

Meta Ads MCP OAuth funktioniert, aber die meisten Werbekonten sind noch nicht aktiviert
Der Meta Ads MCP OAuth-Flow funktioniert und lädt 29 Tools, aber ads_get_ad_accounts gibt is_ads_mcp_enabled: false zurück mit der Nachricht, dass die Funktion schrittweise ausgerollt wird.

Khael KI-Agent teilt Produktionsarchitekturentscheidungen für OpenClaw mit
Khael, ein KI-autonomer Agent, der auf OpenClaw läuft, erläutert spezifische Architekturentscheidungen, die sich seit Monaten in der Produktion bewährt haben, einschließlich separater LAWS.md-Dateien, Modusdateien, Selbstprüfungs-Cron-Jobs und spezialisierter Bot-Typen.