Schema structuré : Qwen Meetup Draft - Le harnais d'appel de fonction améliore la conformité CoT de 9,91 % à 100 %

Un exposé au Qwen Meetup Korea (fin mai) présente une deuxième itération du modèle de harnais d'appel de fonctions. Le harnais original a fait passer qwen3-coder-next de 6,75% à 100% sur la génération de code backend en utilisant la validation de type et les retours du compilateur. Cette mise à jour étend la même idée aux domaines sans compilateur : notes d'investissement, avis juridiques et dossiers cliniques.
Conformité CoT pilotée par schéma
Le mécanisme central est un schéma TypeScript (utilisant les balises typia) qui force le raisonnement du modèle dans une forme requise. Chaque champ doit être rempli, sinon la soumission est rejetée. Exemple de schéma pour une note d'investissement :
import { tags } from "typia";
export interface IInvestmentMemo {
recommendation: "BUY" | "HOLD" | "SELL";
thesis: {
consensusView: string;
differentiatedView: string;
};
counterThesis: {
bearCase: string;
ourResponse: string;
};
// bull / base / bear tous requis — empêche de soumettre seulement le scénario de base
scenarios: {
bull: IScenario;
base: IScenario;
bear: IScenario;
};
// les tableaux vides sont interdits
valuationDrivers: IValuationDriver[] & tags.MinItems<1>;
killConditions: IKillCondition[] & tags.MinItems<1>;
evidenceSources: IEvidenceSource[] & tags.MinItems<1>;
}
// Seuils falsifiables uniquement — empêche les formulations libres comme "confiance dans la direction"
export type IKillCondition =
| { type: "price_drawdown"; percentBelowEntry: number }
| { type: "metric_breach"; metric: string; below: number }
| { type: "milestone_miss"; expectedBy: string; what: string };
Le schéma est ensuite validé en l'exécutant sur des cas d'investissement historiques — la même idée que le backtesting d'une stratégie de trading sur des données de marché. Le diff montre quels appels passés le schéma aurait réussis et lesquels il a manqués ; vous ajoutez ce qui manque.
Conformité CoT mesurée
En utilisant la fonctionnalité CoT d'AutoBE (et non l'analyse d'investissement financier elle-même), qwen3.6-27b suit le rythme des modèles frontaliers sur ces schémas de conformité CoT. Le harnais fait passer la conformité de 9,91% à 100%.
À qui cela s'adresse
Développeurs créant des agents IA qui ont besoin d'un raisonnement structuré et vérifiable dans des domaines sans contrôles automatiques de correction (par exemple, finance, droit, médecine).
📖 Lire la source complète : r/LocalLLaMA
Présentation précédente : Partie 1
👀 See Also

Les frameworks d'agents gaspillent plus de 350 000 jetons par session en renvoyant des fichiers statiques.
Un benchmark sur une configuration locale Qwen 3.5 122B a révélé que les frameworks d'agents gaspillent plus de 350 000 tokens par session en renvoyant des fichiers statiques. Une approche de compilation a réduit le contexte de requête de 1 373 tokens à 73, réalisant une réduction de 95 %.

Échafaudeur de Compétences : Créez des Compétences OpenClaw Sans Écrire de Code
Skill Scaffolder est un outil open-source qui permet aux utilisateurs de créer des compétences OpenClaw en décrivant ce qu'ils veulent en anglais simple. Il gère l'intégralité du processus—interroger les utilisateurs, écrire les fichiers de compétences, tester et installer—sans nécessiter de fichiers YAML, Python ou de configuration.

Contourner l'isolation du bac à sable NemoClaw pour l'agent local Nemotron 9B
Un développeur a contourné l'isolation sandbox de NemoClaw pour exécuter un agent entièrement local en utilisant Nemotron 9B avec appels d'outils sur un seul RTX 5090. L'approche impliquait une configuration iptables, un relais TCP personnalisé et une traduction en temps réel des appels d'outils.

Weejur : Une interface utilisateur simple pour la publication sur GitHub Pages
Weejur est un outil gratuit qui fournit une interface utilisateur simplifiée pour publier des sites web via GitHub Pages, permettant aux utilisateurs de coller du HTML ou de télécharger des fichiers après une connexion OAuth.