Проект встречи Qwen: Harness 2 для вызова функций повышает соответствие CoT с 9,91% до 100% с помощью структурированных схем

✍️ OpenClawRadar📅 Опубликовано: 2 мая 2026 г.🔗 Source
Проект встречи Qwen: Harness 2 для вызова функций повышает соответствие CoT с 9,91% до 100% с помощью структурированных схем
Ad

Доклад на Qwen Meetup Korea (конец мая) представляет вторую итерацию паттерна функции вызова-привязки. Оригинальная привязка подняла qwen3-coder-next с 6.75% до 100% на генерации бэкенд-кода, используя проверку типов и обратную связь от компилятора. Это обновление расширяет ту же идею на домены без компилятора: инвестиционные меморандумы, юридические заключения и клинические карты.

Соответствие CoT на основе схем

Основной механизм — схема TypeScript (с использованием тегов typia), которая принуждает логику модели к требуемой форме. Каждое поле должно быть заполнено, иначе отправка отклоняется. Пример схемы для инвестиционного меморандума:

import { tags } from "typia";

export interface IInvestmentMemo { recommendation: "BUY" | "HOLD" | "SELL"; thesis: { consensusView: string; differentiatedView: string; }; counterThesis: { bearCase: string; ourResponse: string; }; // bull / base / bear все обязательны — блокирует отправку только базового сценария scenarios: { bull: IScenario; base: IScenario; bear: IScenario; }; // пустые массивы запрещены valuationDrivers: IValuationDriver[] & tags.MinItems<1>; killConditions: IKillCondition[] & tags.MinItems<1>; evidenceSources: IEvidenceSource[] & tags.MinItems<1>; }

// Только фальсифицируемые пороги — блокирует свободные формулировки вроде "вера в руководство" export type IKillCondition = | { type: "price_drawdown"; percentBelowEntry: number } | { type: "metric_breach"; metric: string; below: number } | { type: "milestone_miss"; expectedBy: string; what: string };

Затем схема проверяется на исторических инвестиционных кейсах — та же идея, что и бэктестинг торговой стратегии на рыночных данных. Разница показывает, какие прошлые решения схема бы приняла правильно, а какие пропустила; вы добавляете недостающее.

Ad

Измеренное соответствие CoT

Используя функцию CoT от AutoBE (не сам анализ финансовых инвестиций), qwen3.6-27b не отстаёт от передовых моделей на этих схемах соответствия CoT. Привязка повышает соответствие с 9.91% до 100%.

Для кого это

Для разработчиков, создающих AI-агентов, которым требуется структурированное, проверяемое рассуждение в доменах без автоматических проверок корректности (например, финансы, юриспруденция, медицина).

📖 Читать полный источник: r/LocalLLaMA

Предыдущая презентация: Часть 1

Ad

👀 Смотрите также

ToolLoop: Открытая платформа агентов для инструментов в стиле Claude с любой моделью
Инструменты

ToolLoop: Открытая платформа агентов для инструментов в стиле Claude с любой моделью

ToolLoop — это фреймворк с открытым исходным кодом на Python, включающий 11 инструментов для работы с файлами, поиска кода, доступа к оболочке и под-агентов, который работает с любой LLM через LiteLLM. Фреймворк объёмом 2700 строк кода позволяет переключать модели в середине диалога с сохранением общего контекста.

OpenClawRadar
Эа: SIMD-компилятор для Python, написанный на Rust
Инструменты

Эа: SIMD-компилятор для Python, написанный на Rust

Разработчик создал Eä — компилятор для SIMD-ядер на ~12 тысячах строк Rust, который генерирует общие библиотеки и Python-обёртки из файлов .ea, достигая ускорения в 6,6 раз по сравнению с NumPy без использования ctypes или систем сборки.

OpenClawRadar
Плагин Spectyra для OpenClaw: оптимизация затрат на ИИ в реальном времени за счет анализа полного потока запросов
Инструменты

Плагин Spectyra для OpenClaw: оптимизация затрат на ИИ в реальном времени за счет анализа полного потока запросов

Плагин Spectyra снижает затраты на AI API, выявляя в реальном времени скрытые потери, такие как повторные вызовы, избыточный контекст и неправильное использование дорогих моделей.

OpenClawRadar
Создание локального приложения для преобразования речи в текст на macOS с помощью Claude Code: пример Vext
Инструменты

Создание локального приложения для преобразования речи в текст на macOS с помощью Claude Code: пример Vext

Разработчик потратил 3 месяца на создание Vext — приложения для преобразования голоса в текст под macOS, использующего Whisper на Apple Neural Engine. Claude Code помог с Rust/Swift FFI, оптимизацией Core ML и архитектурой горячих клавиш. Приложение работает полностью офлайн, транскрибируя 60-секундное аудио за ~400 мс.

OpenClawRadar