Qwen3 27B übertrifft Gemma 4 26B in echtem Tool-Einsatz für lokale KI-Videopipeline
Am Wochenende veröffentlichte All About AI einen detaillierten Leitfaden zu einer 100% lokalen Fireship-ähnlichen Video-Automatisierungspipeline. Die wichtigste Erkenntnis: Die Zuverlässigkeit von Tool-Calling unterschied sich stark zwischen den beiden getesteten Modellen.
Tool-Calling: Qwen3 27B vs Gemma 4 26B
Gemma 4 26B geriet wiederholt in Tool-Call-Schleifen und verschwendete Tokens für unnötige Überlegungen. Qwen3 (genauer gesagt Qwen 3.6 27B?) handhabte dieselbe Orchestrierung sauber, ohne verschwendete Denk-Tokens. Die Diskrepanz zwischen Benchmark-Zahlen und tatsächlicher Agentenworkflow-Leistung ist erheblich – Tool-Call-Schleifen fressen sowohl Zeit als auch GPU-Speicher.
Wenn Sie einen Tool-Calling-Stack (OpenClaw, Aider oder eine benutzerdefinierte Schleife) betreiben, spielt die Modellwahl eine größere Rolle, als synthetische Benchmarks vermuten lassen. Der Autor bittet ausdrücklich um Fehlerraten für Qwen3-Tool-Calling im Vergleich zu DeepSeek V4 bei bestimmten Stacks.
Bildgenerierung: Said Image Turbo
Für Bilder verwendete die Pipeline Said Image Turbo von Hugging Face – offene Gewichte, keine API-Kosten. Es funktioniert gut für Meme-artige Karten, aber für Porträtaufnahmen sollte man stattdessen Flux oder Seedream verwenden.
Orchestrierung: OpenCode mit 174K Kontext
Die gesamte Pipeline wurde mit OpenCode orchestriert. Der Kontextfenster erreichte 174K Tokens, und die Aufgabenliste wurde nicht in einem Durchgang vollständig abgearbeitet. Der Bediener verließ den Vorgang mitten im Lauf und kam zu einem Teilergebnis zurück – eine ehrliche Darstellung des aktuellen Stands autonomer KI-Werkzeuge.
Remote-Ausführung
Wenn Sie ein 27B-Modell nicht lokal ausführen können, ist Qwen3 bei mehreren Inference-Anbietern verfügbar, sodass Sie dieselben Gewichte und dasselbe Tool-Calling-Verhalten ohne die GPU-Investition erhalten.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

NYC-Kliniken beenden Palantir-Vertrag, während Expansion in Großbritannien unter die Lupe genommen wird
Das öffentliche Krankenhaussystem von New York City wird seinen 4-Millionen-Dollar-Vertrag mit Palantir im Oktober nicht verlängern und auf interne Systeme umstellen. Gleichzeitig sieht sich Palantir mit Datenschutzbedenken hinsichtlich seines 330-Millionen-Pfund-Abkommens mit dem NHS und einem neuen Vertrag mit der britischen Finanzaufsicht konfrontiert.

Claude für Excel und PowerPoint Updates: Kontext- und Fähigkeitenintegration über Anwendungen hinweg
Claude für Excel und PowerPoint teilen nun Konversationskontext über geöffnete Dateien hinweg, wobei Skills in beiden Add-Ins verfügbar sind. Die Tools sind über Amazon Bedrock, Google Clouds Vertex AI und Microsoft Foundry für zahlende Mac- und Windows-Nutzer zugänglich.

40 KI-Agenten wetten 4.000 $ auf die WM-Gruppenphase: Wie die Favoritenfalle 18 Cent pro Dollar kostete
Ein Experiment mit über 40 KI-Agenten, die rund 1.500 Echtgeld-Wetten auf Polymarket platzierten, zeigt die Favoritenfalle: Auf den offensichtlichen Sieger zu setzen brachte 18 Cent Verlust pro eingesetztem Dollar, obwohl die Favoriten in 69 % der Fälle gewannen.
Opus 4.7 Reasoning Effort Benchmark: Medium schlägt High und Max bei realen Aufgaben
In 29 Aufgaben aus dem GraphQL-go-tools-Repo erreicht Opus 4.7 in Claude Code bei mittlerem Reasoning-Aufwand die Spitzenleistung – höhere Einstellungen verschlechtern die Korrektheit und erhöhen die Kosten, ohne die Patch-Qualität zu verbessern.