Проект встречи Qwen: Harness 2 для вызова функций повышает соответствие CoT с 9,91% до 100% с помощью структурированных схем

Доклад на Qwen Meetup Korea (конец мая) представляет вторую итерацию паттерна функции вызова-привязки. Оригинальная привязка подняла qwen3-coder-next с 6.75% до 100% на генерации бэкенд-кода, используя проверку типов и обратную связь от компилятора. Это обновление расширяет ту же идею на домены без компилятора: инвестиционные меморандумы, юридические заключения и клинические карты.
Соответствие CoT на основе схем
Основной механизм — схема TypeScript (с использованием тегов typia), которая принуждает логику модели к требуемой форме. Каждое поле должно быть заполнено, иначе отправка отклоняется. Пример схемы для инвестиционного меморандума:
import { tags } from "typia";
export interface IInvestmentMemo {
recommendation: "BUY" | "HOLD" | "SELL";
thesis: {
consensusView: string;
differentiatedView: string;
};
counterThesis: {
bearCase: string;
ourResponse: string;
};
// bull / base / bear все обязательны — блокирует отправку только базового сценария
scenarios: {
bull: IScenario;
base: IScenario;
bear: IScenario;
};
// пустые массивы запрещены
valuationDrivers: IValuationDriver[] & tags.MinItems<1>;
killConditions: IKillCondition[] & tags.MinItems<1>;
evidenceSources: IEvidenceSource[] & tags.MinItems<1>;
}
// Только фальсифицируемые пороги — блокирует свободные формулировки вроде "вера в руководство"
export type IKillCondition =
| { type: "price_drawdown"; percentBelowEntry: number }
| { type: "metric_breach"; metric: string; below: number }
| { type: "milestone_miss"; expectedBy: string; what: string };
Затем схема проверяется на исторических инвестиционных кейсах — та же идея, что и бэктестинг торговой стратегии на рыночных данных. Разница показывает, какие прошлые решения схема бы приняла правильно, а какие пропустила; вы добавляете недостающее.
Измеренное соответствие CoT
Используя функцию CoT от AutoBE (не сам анализ финансовых инвестиций), qwen3.6-27b не отстаёт от передовых моделей на этих схемах соответствия CoT. Привязка повышает соответствие с 9.91% до 100%.
Для кого это
Для разработчиков, создающих AI-агентов, которым требуется структурированное, проверяемое рассуждение в доменах без автоматических проверок корректности (например, финансы, юриспруденция, медицина).
📖 Читать полный источник: r/LocalLLaMA
Предыдущая презентация: Часть 1
👀 Смотрите также

GrapeRoot Pro добавляет Undo Shield для предотвращения удаления вашего проекта Claude Code
После сообщений на Reddit о том, что Claude Code удаляет целые проекты, GrapeRoot Pro представляет Undo Shield — функцию, которая отслеживает граф сессии Claude и блокирует разрушительные команды, такие как rm -rf, для файлов, которые активно редактировались.

Крэг: Инструмент с открытым исходным кодом создает единые правила для ИИ-агентов на основе конфигураций проектов.
Crag — это компилятор с открытым исходным кодом, который анализирует конфигурации проекта, генерирует единый файл governance.md, а затем компилирует его в несколько файлов правил для ИИ-агентов, чтобы предотвратить расхождение конфигураций в таких инструментах, как Claude Code, Cursor и Copilot.

Портативный формат разума (PMF): Независимая от провайдера спецификация агентов с 15 открытыми агентами
Portable Mind Format (PMF) — это спецификация на основе JSON для определения идентичностей ИИ-агентов, которые могут работать на различных моделях и платформах, включая Claude, GPT-4, Gemini, DeepSeek и локальные модели через Ollama. Включает 15 готовых агентов с лицензией MIT и конвертеры для Claude Code, Cursor, GitHub Copilot и Gemini CLI.

Memctl: Открытый MCP-сервер для постоянной памяти в AI-кодирующих агентах
Memctl — это сервер MCP с открытым исходным кодом, который предоставляет ИИ-агентам для программирования постоянную память между сеансами, устройствами и средами разработки. Созданный в основном с помощью Claude Code за две недели, он сохраняет контекст проекта и предоставляет его в последующих сеансах.