Qwen Meetup Entwurf: Function Calling Harness 2 steigert CoT-Compliance von 9,91% auf 100% durch strukturierte Schemata

✍️ OpenClawRadar📅 Veröffentlicht: 2. Mai 2026🔗 Source
Qwen Meetup Entwurf: Function Calling Harness 2 steigert CoT-Compliance von 9,91% auf 100% durch strukturierte Schemata
Ad

Ein Vortrag beim Qwen Meetup Korea (Ende Mai) präsentiert eine zweite Iteration des Funktionsaufruf-Harness-Musters. Der ursprüngliche Harness verbesserte qwen3-coder-next von 6,75% auf 100% bei der Backend-Codegenerierung mittels Typvalidierung und Compiler-Feedback. Dieses Update erweitert die gleiche Idee auf Bereiche ohne Compiler: Investitionsmemoranden, Rechtsgutachten und klinische Diagramme.

Schema-gesteuerte CoT-Compliance

Der Kernmechanismus ist ein TypeScript-Schema (mit typia-Tags), das die Modelllogik in eine erforderliche Form zwingt. Jedes Feld muss ausgefüllt sein, sonst wird die Einreichung abgelehnt. Beispielschema für ein Investitionsmemorandum:

import { tags } from "typia";

export interface IInvestmentMemo { recommendation: "BUY" | "HOLD" | "SELL"; thesis: { consensusView: string; differentiatedView: string; }; counterThesis: { bearCase: string; ourResponse: string; }; // bull / base / bear alle erforderlich – verhindert Einreichung nur des Basisfalls scenarios: { bull: IScenario; base: IScenario; bear: IScenario; }; // leere Arrays sind versiegelt valuationDrivers: IValuationDriver[] & tags.MinItems<1>; killConditions: IKillCondition[] & tags.MinItems<1>; evidenceSources: IEvidenceSource[] & tags.MinItems<1>; }

// Nur falsifizierbare Schwellenwerte – verhindert Freiform wie „Vertrauen in das Management“ export type IKillCondition = | { type: "price_drawdown"; percentBelowEntry: number } | { type: "metric_breach"; metric: string; below: number } | { type: "milestone_miss"; expectedBy: string; what: string };

Das Schema wird dann validiert, indem es auf historische Investitionsfälle angewendet wird – die gleiche Idee wie Backtesting einer Handelsstrategie mit Marktdaten. Der Diff zeigt, welche vergangenen Calls das Schema richtig gehabt hätte und welche es verfehlt hat; man fügt hinzu, was fehlt.

Ad

Gemessene CoT-Compliance

Mit AutoBEs CoT-Funktion (nicht der Finanzinvestitionsanalyse selbst) hält qwen3.6-27b auf diesen CoT-Compliance-Schemata mit den Spitzenmodellen Schritt. Der Harness erhöht die Compliance von 9,91% auf 100%.

Für wen es gedacht ist

Entwickler, die KI-Agenten bauen, die strukturierte, überprüfbare Argumentation in Bereichen ohne automatische Korrektheitsprüfungen benötigen (z. B. Finanzen, Recht, Medizin).

📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA

Vorherige Präsentation: Teil 1

Ad

👀 Siehe auch

Compass Chrome-Erweiterung fügt Navigationswerkzeuge zu Claude und ChatGPT hinzu
Werkzeuge

Compass Chrome-Erweiterung fügt Navigationswerkzeuge zu Claude und ChatGPT hinzu

Ein Entwickler hat eine kostenlose Chrome-Erweiterung namens Compass erstellt, die Claude- und ChatGPT-Oberflächen eine Prompt-Minimap, feststehende Scroll-Header, Sitzungs-Checklisten und Prompt-Builder-Vorlagen hinzufügt, um Navigationsprobleme in langen Konversationen zu lösen.

OpenClawRadar
read-once: Ein Claude-Code-Hook, der redundante Dateizugriffe verhindert
Werkzeuge

read-once: Ein Claude-Code-Hook, der redundante Dateizugriffe verhindert

Ein Entwickler hat einen PreToolUse-Hook namens read-once erstellt, der verfolgt, welche Dateien Claude Code bereits in einer Sitzung gelesen hat. Er blockiert das erneute Lesen unveränderter Dateien und nutzt Diffs für geänderte Dateien. Das Tool spart tausende von Tokens pro Sitzung, indem es verhindert, dass Claude wiederholt denselben Dateiinhalt liest.

OpenClawRadar
Entwickler testet Qwen3.5 27B im Vergleich zu größeren Modellen für lokale Programmieraufgaben
Werkzeuge

Entwickler testet Qwen3.5 27B im Vergleich zu größeren Modellen für lokale Programmieraufgaben

Ein Entwickler testete mehrere Qwen3.5- und Nemotron-Modelle und stellte fest, dass Qwen3.5-27B-GGUF:UD-Q6_K_XL für Entwicklungsaufgaben auf bestehender 2x RTX 3090-Hardware gut abschneidet, mit 803 pp und 25 tg/s bei 256k Kontext auf vast.ai.

OpenClawRadar
OpenYak: Open-Source Desktop-KI-Agent für lokale Dateiverwaltung und Automatisierung
Werkzeuge

OpenYak: Open-Source Desktop-KI-Agent für lokale Dateiverwaltung und Automatisierung

OpenYak ist ein Open-Source-Desktop-KI-Assistent, der vollständig auf Ihrem Rechner läuft und Dateiverwaltung, Datenanalyse sowie Büroautomatisierung mit über 100 KI-Modellen über OpenRouter und mehr als 20 BYOK-Anbietern bietet.

OpenClawRadar