Aufbau einer serverlosen KI-Agenten-Plattform auf AWS für 0,01 $/Monat mit Claude Code

Projektübersicht
Serverless OpenClaw ist eine Full-Stack-Serverless-KI-Agenten-Plattform, die vollständig über konversationelle Prompts an Claude Code über 29 Stunden in 5 Wochen erstellt wurde. Die Plattform betreibt den OpenClaw-KI-Agenten bedarfsgesteuert auf AWS mit einer React-Web-Chat-UI und einem Telegram-Bot und stellt die gesamte Infrastruktur mit einem einzigen cdk deploy-Befehl bereit.
Technische Details
Kostenoptimierung: Das Projekt reduzierte die monatlichen Kosten von einem typischen ~70 $+ Serverless-Setup auf 0,01 $/Monat für Lambda ohne Leerlaufkosten. Spezifische Einsparungen umfassen:
- NAT Gateway: -32 $/Monat
- ALB (Application Load Balancer): -18 $/Monat
- Fargate dauerhaft aktiv: -15 $/Monat
- Interface VPC Endpoints: -7 $/Monat pro Endpoint
- Provisioned DynamoDB: Variable Einsparungen
Leistungsmetriken:
- Cold Start: 1,35 s (Lambda), 0,12 s warm
- Gesamt-AWS-Kosten während der Entwicklung: ~0,25 $
- Monatliche Betriebskosten: ~0,01 $ (Lambda)
Code-Qualität:
- Unit-Tests: 233
- E2E-Tests: 35
- CDK-Stacks: 8
- TypeScript-Pakete: 6 (Monorepo)
Entwicklungsprozess
Das gesamte Projekt wurde ohne manuelle Programmierung erstellt – nur durch Prompts, Reviews und Kurskorrekturen. Claude Code wurde verwendet für:
- Architekturdesign: „Entwerfe eine Serverless-Plattform, die unter 1 $/Monat kostet“ → Claude Code erstellte das PRD, CDK-Stacks, Netzwerkdesign
- TDD-Workflow: Claude Code schrieb zuerst Tests, dann die Implementierung (233 Tests vor dem ersten Deploy)
- Debugging-Sitzungen: Docker-Build-Fehler, Cold-Start-Optimierung (68 s → 1,35 s), WebSocket-Authentifizierungsprobleme
- Phase-2-Migration: Umzug von Fargate zu Lambda Container Image während des Projekts, inklusive S3-Sitzungspersistenz und Smart Routing
Die Prompts waren ursprünglich auf Koreanisch, und Claude Code bewältigte die zweisprachige Entwicklung nahtlos.
Tech-Stack
TypeScript-Monorepo (6 Pakete) auf AWS mit: CDK für IaC, API Gateway (WebSocket + REST), Lambda + Fargate Spot für Compute, DynamoDB, S3, Cognito-Authentifizierung, CloudFront + React SPA, Telegram Bot API. Multi-LLM-Unterstützung über Anthropic API und Amazon Bedrock.
Praktische Muster
API Gateway statt ALB: Spart 18+ $/Monat. WebSocket + REST auf API Gateway mit Lambda-Handlern.
Tutorial-Struktur
Das 7-Kapitel-„Vibe Coding“-Tutorial dokumentiert jeden Prompt, jeden Fehler und jede Korrektur:
- Kapitel 1: Die 1 $-/Monat-Herausforderung (~2 h) – PRD, Architekturdesign, Kostenanalyse
- Kapitel 2: MVP an einem Wochenende (~8 h) – 10-Schritte-Phase 1, CDK-Stacks, TDD
- Kapitel 3: Deployment-Realitätscheck (~4 h) – Docker, Secrets, Authentifizierung, erstes echtes Deploy
- Kapitel 4: Der Cold-Start-Kampf (~6 h) – Docker-Optimierung, CPU-Tuning, Pre-Warming
- Kapitel 5: Lambda-Migration (~4 h) – Phase 2, eingebetteter Agent, S3-Sitzungen
- Kapitel 6: Smart Routing (~3 h) – Lambda/Fargate-Hybrid, Cold-Start-Vorschau
- Kapitel 7: Release-Automatisierung (~2 h) – Skills, paralleles Review, GitHub-Releases
Jedes Kapitel enthält: den tatsächlich gegebenen Prompt → was Claude Code tat → was kaputtging → wie wir es reparierten → gelernte Lektionen → reproduzierbare Befehle.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Qwen3.5-397B MoE läuft auf 14 GB RAM dank geladenen Expertenseiten auf dem M1 Ultra
Die Paged-MoE-Engine hält nur 20 Experten im Arbeitsspeicher und lädt den Rest bei Bedarf von der SSD nach – damit läuft ein 209 GB großes 397B-Modell auf einem 64 GB Mac Studio mit 1,59 tok/s und 14 GB RAM-Spitzenlast. Enthält Benchmarks für kleinere Modelle.

RAG-Chatbot-Evaluierung: Wie ein Modell-Sweep und Retrieval-Fixes Kosten um 79% senkten und die Qualität um 19% steigerten
Ein Entwickler evaluierte einen RAG-Chatbot für den Kundensupport und stellte Fehlkonfigurationen bei der Abfrage, Mängel bei heuristischen Bewertern und ein günstigeres Modell fest, das das Produktionsmodell übertraf. Die Qualität verbesserte sich von 6,62 auf 7,88, während die Kosten pro Sitzung von 0,002420 $ auf 0,000509 $ sanken.

Implementierung von Zeitverfolgung in Claude AI-Projekten
Eine Methode, die Claude AI verwendet, umfasst das Zeitstempeln von Antworten, um Arbeitssitzungen zu verfolgen und Pausenbeschränkungen zu senden.

Durch Auslagerung mechanischer Aufgaben an DeepSeek V4 Flash via MCP senkt Claude Kosten um das 60-fache
Ein Reddit-Nutzer reduzierte die Claude-API-Kosten um das 60-fache, indem er Dateiklassifizierung, JSON-Neuformatierung und Feldextraktion über ein einfaches MCP-Tool und eine CLAUDE.md-Deny-List-Regel an DeepSeek V4 Flash auslagerte.