Zwei $0 OpenClaw-Einrichtungen mit kostenlosen Cloud-Modellen oder lokalem Ollama

Ein OpenClaw-Nutzer berichtet, dass er einen Agenten drei Wochen lang kostenlos betrieben hat und dabei etwa 70 % der Aufgaben bewältigte, für die er zuvor mit Claude bezahlt hatte. Das Setup bietet zwei Wege: kostenlose Cloud-Modelle mit Ratenbegrenzungen oder lokale Modelle über Ollama ohne laufende Kosten.
Weg 1: Kostenlose Cloud-Modelle (keine Hardware erforderlich)
Dieser Ansatz erfordert nur eine bestehende OpenClaw-Installation und kostenlose API-Tarife:
- OpenRouter kostenloser Tarif: Registrieren Sie sich unter openrouter.ai ohne Kreditkarte. Bietet 30+ kostenlose Modelle, darunter Llama 3.3 70B, Nemotron Ultra 253B (262K Kontext), MiniMax M2.5 und Devstral. Konfigurationsbeispiel:
{
"env": { "OPENROUTER_API_KEY": "sk-or-..." },
"agents": {
"defaults": {
"model": {
"primary": "openrouter/nvidia/nemotron-ultra-253b:free"
}
}
}
}
Für automatische Modellauswahl: "primary": "openrouter/openrouter/free"
- Gemini kostenloser Tarif: Google bietet 15 Anfragen pro Minute für Gemini Flash kostenlos an. Holen Sie sich einen API-Schlüssel von ai.google.dev und führen Sie
openclaw onboardaus, wählen Sie Google als integrierten Anbieter. - Groq: Schnell mit kostenlosem, ratenbeschränktem Tarif, geeignet für grundlegende Agentenaufgaben.
Der Haken: Ratenbegrenzungen. Bei leichter bis moderater täglicher Nutzung (10-20 Interaktionen) sind Pausen kaum spürbar. Für 100+ Aufgaben täglich funktioniert dies nicht.
Weg 2: Lokale Modelle über Ollama (wirklich 0 €, für immer)
Ollama wurde im März 2026 offizieller OpenClaw-Anbieter. Dieses Setup hat keine API-Schlüssel, Konten, Ratenbegrenzungen und keine Daten verlassen Ihren Computer.
Einrichtungsschritte:
- Ollama installieren:
curl -fsSL https://ollama.com/install.sh | sh - Ein Modell basierend auf Ihrem VRAM laden:
- 20GB+ VRAM (RTX 3090, 4090, M4 Pro/Max):
ollama pull qwen3.5:27b - 16GB VRAM:
ollama pull qwen3.5:35b-a3b - 8GB VRAM (die meisten Laptops):
ollama pull qwen3.5:9b
- 20GB+ VRAM (RTX 3090, 4090, M4 Pro/Max):
- Führen Sie
openclaw onboardaus und wählen Sie Ollama, oder verwenden Sie die manuelle Einrichtung mitexport OLLAMA_API_KEY="ollama-local"
Qwen3.5 27B wird als aktueller Sweet Spot für OpenClaw angesehen, der Tool-Aufrufe gut für tägliche Agentenaufgaben bewältigt. Die 35b-a3b Mixture-of-Experts-Variante läuft mit 112 Tokens/Sekunde auf einer RTX 3090, indem nur 3B Parameter gleichzeitig aktiviert werden.
Manuelles Konfigurationsbeispiel:
{
"models": {
"providers": {
"ollama": {
"baseUrl": "http://localhost:11434",
"apiKey": "ollama-local",
"api": "ollama",
"models": [
{
"id": "qwen3.5:27b",
"name": "Qwen3.5 27B",
"reasoning": false,
"contextWindow": 131072,
"maxTokens": 8192
}
]
}
}
},
"agents": {
"defaults": {
"model": {
"primary": "ollama/qwen3.5:27b"
}
}
}
}
Wichtige Debugging-Hinweise:
- Verwenden Sie die native Ollama-API-URL (
http://localhost:11434), NICHT die OpenAI-kompatible (http://localhost:11434/v1). Der /v1-Pfad unterbricht Tool-Aufrufe, was zu roher JSON-Ausgabe als Klartext führt. - Setzen Sie
"reasoning": falsein der Modellkonfiguration.
📖 Read the full source: r/clawdbot
👀 Siehe auch

Claude Code LSP Einrichtungsanleitung: Strukturelles Code-Verständnis
Ein Reddit-Post beschreibt, wie man Claude Code so konfiguriert, dass er das Language Server Protocol für strukturelles Code-Verständnis anstelle von Textabgleich verwendet, wodurch Abfragezeiten von 30-60 Sekunden auf ~50ms reduziert werden, mit Funktionen wie Gehe-zur-Definition, Finde-Referenzen und Aufrufhierarchie.

Claude Code Workflow Visual: Speicherhierarchie, Fähigkeiten, Hooks und Schleife
Ein Reddit-Beitrag teilt eine Workflow-Visualisierung für Claude Code, die CLAUDE.md-Speicherschichtung (global → Repo → bereichsbezogen), Fähigkeiten als wiederverwendbare Muster in .claude/skills/ und einen empfohlenen Workflow-Loop (Planen → Beschreiben → Akzeptieren → Committen) abdeckt.

Claude-Code-Struktur, die mehrere reale Projekte überstanden hat
Ein Entwickler teilt ein Claude Code-Setup, das sich bei 2-3 realen Projekten mit mehreren Skills, MCP-Servern und Agents bewährt hat. Zu den wichtigsten Erkenntnissen gehören die Verwendung von CLAUDE MD für Konsistenz, das Aufteilen von Skills nach Zweck, die Implementierung von Hooks und die Begrenzung der Kontextnutzung auf unter 60 %.

Aufteilung des Agentenkontexts in drei Ebenen zur Lösung des 700-Zeilen-Monolithen-Problems
Ein Team, das ein 6-Agenten-autonomes System aufbaut, löste das Problem des aufgeblähten Kontextdateien-Volumens, indem es den Agentenkontext in drei Ebenen aufteilte, basierend auf der Art der Anforderung und der Änderungshäufigkeit: CLAUDE.md für die Identität, BRIEFING.md für die Mission und PLAYBOOK.md für den Betrieb. Dieser Ansatz verhindert stille Fehler durch Argumentgrenzen und macht die Bearbeitung vorhersehbar.