Claw编写的插件为OpenClaw添加Qwen 3.8 27B思考级别支持
llama.cpp와 OpenClaw 2026.6.9에서 Qwen 3.8 27B를 실행 중인데 네이티브 사고 수준 제어가 없어 답답하셨나요? 한 OpenClaw 사용자가 같은 문제를 겪고 AI 에이전트에게 플러그인을 작성하게 했습니다. 완전히 생성되었고, 사람의 눈으로 테스트되지 않았습니다.
이 플러그인이 필요한 이유
Qwen 3.8은 전용 매개변수가 아닌 채팅 템플릿을 통해 사고 수준을 제어합니다. OpenClaw의 llama.cpp 백엔드 버전 2026.6.9는 이를 기본적으로 매핑하지 않으므로 사고 수준이 무시되거나 잘못 적용됩니다. 이 플러그인이 그 격차를 메웁니다.
기능
- 호출별 사고 수준 — 각 요청에 대해
enable_thinking값을 채팅 템플릿에 올바르게 주입합니다. - 하트비트용 별도 수준 — 백그라운드 하트비트 호출에 대해 다른 사고 수준을 설정할 수 있습니다 (저자는
xhigh사용). - 지시 모드 (사고 끄기) — 사고를 비활성화하고 unsloth가 권장하는 샘플링 매개변수를 적용하여 최적의 출력을 얻습니다.
- 선택적 타임아웃 가드 — 긴 추론 체인 중 타임아웃을 방지하기 위해 강제로 지시 모드로 전환합니다.
획득 방법
플러그인은 GitLab에 게시되어 있습니다:
git clone https://gitlab.com/moltwithhat/llamacpp-qwen-thinking
저자 메모: "저는 코드를 보지도 않았습니다" — 전체가 AI 에이전트가 작성했습니다. 에이전트가 인간의 검토 없이 유용하고 공유 가능한 도구를 생성할 수 있다는 개념 증명입니다.
대상 사용자
OpenClaw를 통해 llama.cpp에서 Qwen 3.8 (또는 유사 모델)을 실행하고 요청별로 사고 수준을 세밀하게 제어하려는 모든 사람. 하트비트에 의존하거나 지시 모드를 대체 수단으로 필요로 한다면, 이 플러그인은 배관 작업을 줄여줍니다.
📖 전체 소스 보기: r/openclaw
👀 See Also

컨텍스트 게이트웨이: AI 에이전트 컨텍스트 압축을 위한 오픈소스 프록시
컨텍스트 게이트웨이는 코딩 에이전트와 LLM 사이에 위치하는 오픈소스 프록시로, 컨텍스트 윈도우에 도달하기 전에 도구 출력을 압축합니다. 이는 컨텍스트 내 신호를 감지하기 위해 소형 언어 모델을 사용하며, 윈도우 용량의 85%에서 백그라운드 압축을 수행하고, 지출 한도, 대시보드, Slack 알림 기능을 포함합니다.

고급 클로드 코드 팁 8가지: 비용 절감, 컨텍스트 관리, 사용자 명령어
Claude Code를 일상적으로 많이 사용하면서 얻은 실용적인 팁들로, Git 워크플로 자동화, 멀티모달 이미지 입력, API 사용량 추적, 컨텍스트 압축, 세션 재개, 규칙 관리, 사고 트리거, 사용자 정의 명령어를 다룹니다.

런타임: 모든 팀원을 위한 샌드박스 코딩 에이전트
Runtime (YC P26)는 비엔지니어가 Claude Code, Codex 등 에이전트를 안전하게 사용할 수 있는 샌드박스 코딩 에이전트 인프라를 제공합니다. Docker, Kafka, Redis, 시드 데이터베이스 등 다중 서비스 환경을 스냅샷하여 수 밀리초 만에 부팅하며, 인프라 수준에서 가드레일을 갖추고 있습니다.

클로 컴팩터: LLM 파이프라인을 위한 14단계 토큰 압축 엔진
Claw Compactor는 14단계 Fusion Pipeline을 사용하여 LLM 추론 비용 없이 평균 54% 압축률을 달성하는 오픈소스 LLM 토큰 압축 엔진입니다. 코드, JSON, 로그, diff, 검색 결과에 대한 특화된 압축기를 포함하며 가역적 압축 기능을 제공합니다.