Cloudflares KI-Plattform: Einheitliche Inferenzschicht für KI-Agenten

Was Cloudflares KI-Plattform bietet
Cloudflare hat seine KI-Fähigkeiten zu einer einheitlichen Inferenzschicht erweitert, die speziell für KI-Agenten entwickelt wurde. Die Plattform adressiert die Herausforderung, dass KI-Modelle sich schnell ändern und die Notwendigkeit, mehrere Modelle für verschiedene Aufgaben innerhalb agentenbasierter Workflows zu nutzen.
Wichtige Funktionen und Implementierung
Das Kernangebot ist eine API, um auf jedes KI-Modell von jedem Anbieter zuzugreifen. Für Workers-Benutzer können Sie Drittanbietermodelle mit derselben AI.run()-Bindung aufrufen, die bereits für Workers AI verwendet wird. Der Wechsel zwischen Anbietern erfordert nur eine einzeilige Codeänderung.
const response = await env.AI.run('@cf/moonshotai/kimi-k2.5', {
prompt: 'What is AI Gateway?'
}, {
metadata: {
"teamId": "AI",
"userId": 12345
}
});Die Plattform bietet Zugriff auf über 70 Modelle von mehr als 12 Anbietern, darunter Alibaba Cloud, AssemblyAI, Bytedance, Google, InWorld, MiniMax, OpenAI, Pixverse, Recraft, Runway und Vidu. Die Modellangebote umfassen jetzt Bild-, Video- und Sprachmodelle für den Aufbau multimodaler Anwendungen.
Kostenmanagement und BYOM-Unterstützung
Alle KI-Ausgaben können über AI Gateway an einem Ort verwaltet werden. Durch die Einbeziehung benutzerdefinierter Metadaten in Anfragen erhalten Sie Kostenaufschlüsselungen nach Attributen wie kostenlose vs. zahlende Benutzer, einzelne Kunden oder bestimmte Workflows.
Für benutzerdefinierte Modellanforderungen arbeitet Cloudflare daran, Benutzern zu ermöglichen, ihre eigenen Modelle mit Replicates Cog-Technologie zu Workers AI mitzubringen. Dies beinhaltet die Containerisierung von Machine-Learning-Modellen mit einer cog.yaml-Datei und Python-Inferenzcode, wodurch CUDA-Abhängigkeiten, Python-Versionen und Gewichtsladung abstrahiert werden.
Aktuelle Updates und Verfügbarkeit
Zu den neuesten Ergänzungen gehören Standard-Gateways ohne Einrichtung, automatische Wiederholungsversuche bei Upstream-Fehlern und granularere Protokollierungssteuerungen. Die REST-API-Unterstützung für Nicht-Workers-Benutzer wird in den kommenden Wochen verfügbar sein.
📖 Read the full source: HN AI Agents
👀 Siehe auch

Ollama-Update fügt OpenClaw-Unterstützung für das Kimi k2.5-Cloud-Modell hinzu
Ollama hat ein Update veröffentlicht, das OpenClaw-Unterstützung für Cloud-Modelle integriert, einschließlich kostenfreiem Zugang zum Kimi k2.5-Modell mit Websuchfunktion, das in NVIDIA-Rechenzentren läuft.

GSD-Lite: Ein Zustandsautomat für Claude-Code, der TDD erzwingt und das Überspringen von Tests verhindert
GSD-Lite ist ein Open-Source-MCP-Server, der einen 12-Zustands-Workflow-Automaten zu Claude Code hinzufügt und testgetriebene Entwicklung mit spezifischen Anti-Rationalisierungs-Prompts sowie separaten Agentenkontexten für Ausführung, Überprüfung und Fehlerbehebung erzwingt.

Claude Code baute SaaS-Onboarding-Flow in 6 Stunden um vs. Entwicklerangebot von 3 Wochen, steigerte Aktivierung um 13 Punkte
Ein SaaS-Gründer hat mit Claude Code den gesamten Onboarding-Flow (Anmeldung → Profil → erste Rechnung → Dashboard-Tutorial) in 6 Stunden neu aufgebaut, statt der 3-Wochen-4.500$-Schätzung eines Entwicklers. Die Aktivierungsrate stieg um 13 Punkte von 35% auf 48%.

Mobile Harness: Browser-Use-Fähigkeiten für Claude-Agenten in Mobile Apps integrieren
Mobile Harness gibt Claude/Agenten wiederverwendbare mobile App-Fähigkeiten (Reddit, Instagram, TikTok) unter Verwendung von MobAI als Ausführungsschicht. Funktioniert mit echten Geräten, Emulatoren, Simulatoren, kostenloses tägliches Kontingent.