Qwen Meetup Entwurf: Function Calling Harness 2 steigert CoT-Compliance von 9,91% auf 100% durch strukturierte Schemata

✍️ OpenClawRadar📅 Veröffentlicht: 2. Mai 2026🔗 Source
Qwen Meetup Entwurf: Function Calling Harness 2 steigert CoT-Compliance von 9,91% auf 100% durch strukturierte Schemata
Ad

Ein Vortrag beim Qwen Meetup Korea (Ende Mai) präsentiert eine zweite Iteration des Funktionsaufruf-Harness-Musters. Der ursprüngliche Harness verbesserte qwen3-coder-next von 6,75% auf 100% bei der Backend-Codegenerierung mittels Typvalidierung und Compiler-Feedback. Dieses Update erweitert die gleiche Idee auf Bereiche ohne Compiler: Investitionsmemoranden, Rechtsgutachten und klinische Diagramme.

Schema-gesteuerte CoT-Compliance

Der Kernmechanismus ist ein TypeScript-Schema (mit typia-Tags), das die Modelllogik in eine erforderliche Form zwingt. Jedes Feld muss ausgefüllt sein, sonst wird die Einreichung abgelehnt. Beispielschema für ein Investitionsmemorandum:

import { tags } from "typia";

export interface IInvestmentMemo { recommendation: "BUY" | "HOLD" | "SELL"; thesis: { consensusView: string; differentiatedView: string; }; counterThesis: { bearCase: string; ourResponse: string; }; // bull / base / bear alle erforderlich – verhindert Einreichung nur des Basisfalls scenarios: { bull: IScenario; base: IScenario; bear: IScenario; }; // leere Arrays sind versiegelt valuationDrivers: IValuationDriver[] & tags.MinItems<1>; killConditions: IKillCondition[] & tags.MinItems<1>; evidenceSources: IEvidenceSource[] & tags.MinItems<1>; }

// Nur falsifizierbare Schwellenwerte – verhindert Freiform wie „Vertrauen in das Management“ export type IKillCondition = | { type: "price_drawdown"; percentBelowEntry: number } | { type: "metric_breach"; metric: string; below: number } | { type: "milestone_miss"; expectedBy: string; what: string };

Das Schema wird dann validiert, indem es auf historische Investitionsfälle angewendet wird – die gleiche Idee wie Backtesting einer Handelsstrategie mit Marktdaten. Der Diff zeigt, welche vergangenen Calls das Schema richtig gehabt hätte und welche es verfehlt hat; man fügt hinzu, was fehlt.

Ad

Gemessene CoT-Compliance

Mit AutoBEs CoT-Funktion (nicht der Finanzinvestitionsanalyse selbst) hält qwen3.6-27b auf diesen CoT-Compliance-Schemata mit den Spitzenmodellen Schritt. Der Harness erhöht die Compliance von 9,91% auf 100%.

Für wen es gedacht ist

Entwickler, die KI-Agenten bauen, die strukturierte, überprüfbare Argumentation in Bereichen ohne automatische Korrektheitsprüfungen benötigen (z. B. Finanzen, Recht, Medizin).

📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA

Vorherige Präsentation: Teil 1

Ad

👀 Siehe auch

🦀
Werkzeuge

GitHubs Projekt HydraFusion: Multi-Modell-Orchestrierung für KI-Codierung auf Spitzenniveau

GitHub Copilots HydraFusion-Forschungsvorschau orchestriert mehrere Modelle pro Aufgabe und wählt zwischen Einzel-, Kaskaden- oder Kritik-Workflows. Benchmarks zeigen eine Qualitätssteigerung von 4,9 Punkten bei 67% geringeren Kosten im Vergleich zu Claude Opus 5.

OpenClawRadar
Agenexus: Agent-Native-Plattform für autonome KI-Kollaboration
Werkzeuge

Agenexus: Agent-Native-Plattform für autonome KI-Kollaboration

Agenexus ist eine Plattform, auf der KI-Agenten sich über eine SKILL.md-Datei registrieren, Fähigkeitsherausforderungen absolvieren, die von der Claude API verifiziert werden, und semantisch für die Zusammenarbeit abgeglichen werden, ohne menschliches Eingreifen. Gebaut mit Next.js, Supabase, Voyage AI Embeddings und der Claude API.

OpenClawRadar
JANG-Quantisierungsmethode verbessert MLX-Leistung für große Modelle
Werkzeuge

JANG-Quantisierungsmethode verbessert MLX-Leistung für große Modelle

Eine neue Quantisierungsmethode namens JANG ermöglicht das Ausführen großer Modelle wie MiniMax-M2.5 und Qwen 3.5 auf Apples MLX-Framework mit deutlich besserer Leistung als die Standard-MLX-Quantisierung. Sie erreicht nahezu native Geschwindigkeiten bei einer Genauigkeit, die mit höherbitigen Quantisierungen vergleichbar ist.

OpenClawRadar
Claude Code Best Practice Repo erreicht 50k Sterne, vollständig mit KI-Agenten erstellt
Werkzeuge

Claude Code Best Practice Repo erreicht 50k Sterne, vollständig mit KI-Agenten erstellt

Ein GitHub-Repository vollgepackt mit Claude-Best-Practices, das zu 100 % von autonomen Claude-Code-Workflows entwickelt und gepflegt wird, hat 50.000 Sterne überschritten – und ist damit das meistgestirnte Repository Pakistans im Jahr 2026.

OpenClawRadar