LLMock: HTTP-basierter Mocking-Server für deterministische LLM-Tests über Prozesse hinweg

LLMock ist ein Mocking-Server, der LLM-API-Aufrufe abfängt, indem er als echter HTTP-Server auf einem bestimmten Port läuft, und ermöglicht so deterministisches Testen über mehrere Prozesse hinweg, ohne kostenpflichtige APIs anzusprechen.
Wichtige Details
Das Tool wurde entdeckt, nachdem ein Entwickler 12 US-Dollar für Playwright-Tests gegen echte OpenAI-APIs ausgegeben hatte. Das Problem trat auf, als MSW (Mock Service Worker) verwendet wurde, das das HTTP-Modul innerhalb des Node.js-Prozesses patcht, der server.listen() aufruft, aber separate Prozesse (wie einen Python-Agenten) völlig unberührt von der Simulation lässt.
Mit LLMock zeigen Sie die Umgebungsvariable OPENAI_BASE_URL von jedem Prozess aus auf den Mock-Server, unabhängig davon, ob es sich um Node.js, Python oder eine andere Sprache handelt:
const mock = new LLMock({ port: 5555 });
await mock.start();
process.env.OPENAI_BASE_URL = "http://localhost:5555/v1";Fixtures sind einfache JSON-Dateien, die auf Teilzeichenketten von Benutzernachrichten oder Regex-Muster abgestimmt sind und Boilerplate-Code für Handler eliminieren:
{
"fixtures": [
{
"match": { "userMessage": "stock price of AAPL" },
"response": { "content": "The current stock price of Apple Inc. (AAPL) is $150.25." }
}
]
}Wichtige Funktionen aus der Source:
- Spricht das tatsächliche OpenAI/Claude/Gemini SSE-Format korrekt (falsche Event-Typen brechen Streaming auf subtile Weise)
- Vollständige Tool-Aufruf-Unterstützung – Agent-Frameworks führen sie normal aus
- Prädikat-Routing zur Überprüfung des System-Prompt-Zustands oder Nachrichtenverlaufs für Multi-Agent-Flows
- Request-Journal, um zu prüfen, was tatsächlich aufgerufen wurde, nicht nur ob der Test bestanden wurde
- Keine Abhängigkeiten
Der Entwickler endete mit 9 LLM-Aufrufen über 3 Playwright-Tests hinweg, kostete 0 US-Dollar und erzielte bei jedem Durchlauf deterministische Ergebnisse.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Freier Zauberer migriert ChatGPT-Verlauf zu Claude-Projekten — Wichtige Lektionen zu Token-Limits und RAG
Ein kostenloses No-Code-Tool führt ChatGPT-Exporte in Claude-Projekte ein und zeigt, dass 26 MB große JSON-Dateien an Token-Grenzen stoßen – die Lösung ist eine themenbasierte Aufteilung. Claude's RAG liest nur Teile großer Dateien, daher eignen sich spezifische Abfragen am besten.

Tacit: Eine LLM-erste Programmiersprache, entwickelt mit Claude Code und Opus 4.7
Tacit ist eine experimentelle, LLM-zentrierte Programmiersprache, die mit Claude Code und Opus 4.7 entwickelt und implementiert wurde. Sie entfernt menschliche Annehmlichkeiten, um die Token-Nutzung zu minimieren, und enthält eine Einführung, die mittleren und höheren LLMs (Sonnet und aufwärts) beibringt, Tacit-Code zu schreiben.

htmLLM-124M v2 veröffentlicht: Spezialisiertes HTML/Bootstrap-Autovervollständigungsmodell
LH-Tech-AI hat htmLLM-124M v2 veröffentlicht, ein 124-Millionen-Parameter-Modell, das speziell für HTML/Bootstrap-Autovervollständigung entwickelt wurde und einen Validierungsverlust von 0,91 erreicht sowie in ~8 Stunden auf einer einzelnen T4-GPU trainiert.

OpenClaw Agent Memory Plugin: Persistenter Kontext über Sitzungen hinweg
Ein Entwickler hat ein Memory-Layer-Plugin für OpenClaw erstellt, das vor jedem Zug relevanten Kontext aus vergangenen Gesprächen einspielt und nach jedem Zug neue Fakten und Ereignisse speichert, wodurch das Problem gelöst wird, dass Agenten zwischen Sitzungen alles vergessen.