Qwen 미트업 초안: 함수 호출 하네스 2가 구조적 스키마를 통해 CoT 준수율을 9.91%에서 100%로 향상

Qwen Meetup Korea(5월 말)에서 발표된 강연은 함수 호출 하네스 패턴의 두 번째 버전을 소개합니다. 원래 하네스는 유형 검증과 컴파일러 피드백을 사용하여 백엔드 코드 생성에서 qwen3-coder-next의 성능을 6.75%에서 100%로 끌어올렸습니다. 이번 업데이트는 컴파일러가 없는 도메인(투자 메모, 법률 의견, 임상 차트)에 동일한 아이디어를 확장합니다.
스키마 기반 CoT 준수
핵심 메커니즘은 모델의 추론을 필수 형식으로 강제하는 TypeScript 스키마(typia 태그 사용)입니다. 모든 필드를 채워야 하며, 그렇지 않으면 제출이 거부됩니다. 투자 메모의 예시 스키마는 다음과 같습니다:
import { tags } from "typia";
export interface IInvestmentMemo {
recommendation: "BUY" | "HOLD" | "SELL";
thesis: {
consensusView: string;
differentiatedView: string;
};
counterThesis: {
bearCase: string;
ourResponse: string;
};
// bull / base / bear 모두 필수 — 기본 케이스만 제출하는 것을 차단
scenarios: {
bull: IScenario;
base: IScenario;
bear: IScenario;
};
// 빈 배열은 허용되지 않음
valuationDrivers: IValuationDriver[] & tags.MinItems<1>;
killConditions: IKillCondition[] & tags.MinItems<1>;
evidenceSources: IEvidenceSource[] & tags.MinItems<1>;
}
// 반증 가능한 임계값만 허용 — "경영진에 대한 신뢰"와 같은 자유 형식 차단
export type IKillCondition =
| { type: "price_drawdown"; percentBelowEntry: number }
| { type: "metric_breach"; metric: string; below: number }
| { type: "milestone_miss"; expectedBy: string; what: string };
그런 다음 스키마를 과거 투자 사례에 적용하여 검증합니다. 이는 시장 데이터에 트레이딩 전략을 백테스트하는 것과 동일한 개념입니다. diff는 스키마가 과거 결정 중 올바르게 예측한 것과 놓친 것을 보여주며, 누락된 부분을 추가합니다.
측정된 CoT 준수
AutoBE의 CoT 기능(금융 투자 분석 자체가 아님)을 사용하여 qwen3.6-27b는 이러한 CoT 준수 스키마에서 최첨단 모델과 경쟁합니다. 하네스는 준수율을 9.91%에서 100%로 향상시킵니다.
대상
자동 정확성 검사가 없는 도메인(예: 금융, 법률, 의료)에서 구조화되고 검증 가능한 추론이 필요한 AI 에이전트를 개발하는 개발자.
📖 전체 출처 읽기: r/LocalLLaMA
이전 발표: Part 1
👀 See Also

OpenClaw 인도 주식 시장 통합: 다중 에이전트 분석 및 트레이딩 터미널
인도 시장을 위한 오픈 소스 트레이딩 터미널이 OpenClaw 스킬 서버로 구성되어, 모든 OpenClaw 에이전트가 로컬 설치 없이 HTTP를 통해 인도 주식 시장 데이터를 가져오고 완전한 분석을 실행할 수 있게 되었습니다. 이 시스템은 7개의 전문 에이전트가 병렬로 작동하여 구조화된 분석과 거래 계획을 생성합니다.

클로드 코드의 읽기 도구가 이미지 해상도를 묵시적으로 낮추어 환각을 유발함
Claude Code의 `read` 도구는 모델이 이미지를 보기 전에 조용히 해상도를 낮추어, 스크린샷에서 텍스트를 추출할 때 출력 품질이 저하되고 인식하지 못한 환각 현상이 발생하게 됩니다.

오프 그리드: 오프라인 AI 애플리케이션을 위한 휴대폰 하드웨어 활용
오프 그리드는 휴대폰의 하드웨어를 활용하여 텍스트 생성 및 음성 기록과 같은 오프라인 AI 작업을 수행하는 오픈 소스 앱입니다.

개발자, AI 에이전트 메모리 문제 해결 위해 LibraHQ 앱 구축
한 개발자가 챗봇과 코딩 에이전트 간의 공유 메모리 계층 역할을 하는 무료 노트 앱인 LibraHQ를 만들었습니다. 이 앱은 채팅에서 중요한 메모와 결정을 기록하고 향후 세션을 위해 저장하여, AI 에이전트가 이전에 내린 결정을 잊어버리는 문제를 해결합니다.