GGUF 모델 병합 스크립트 및 Qwen3.5-35B 변형을 위한 워크플로우

✍️ OpenClawRadar📅 게시일: April 1, 2026🔗 Source
GGUF 모델 병합 스크립트 및 Qwen3.5-35B 변형을 위한 워크플로우
Ad

레딧 사용자가 최소 손실로 GGUF 모델 파일을 병합하는 파이썬 스크립트와 워크플로를 공유했습니다. 특히 Qwen3.5-35B 변형 모델을 대상으로 합니다. 이 접근 방식은 기존 두 모델을 결합합니다: HauhauCS의 Qwen3.5-35B-A3B-Uncensored-HauhauCS-Aggressive와 samuelcardillo의 Qwen3.5-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF입니다.

기술적 세부사항

병합된 모델은 Q4_0 양자화 버전으로 Hugging Face에서 이용 가능합니다. 출처에 따르면, samuelcardillo의 파인튜닝은 Qwen 3.5 35B에 대해 Jackrong 버전보다 성능이 더 뛰어납니다.

병합 워크플로

파이썬 스크립트(Pastebin에서 확인 가능)는 "Claude Opus 4.6를 통해 vibe 코딩되었으며" 다음을 지원합니다:

  • Google Colab Free Tier에서 GGUF 파일 병합
  • llama-quantize를 통한 양자화
  • 35B 모델용 Q4_K_M 양자화
  • 8B 모델용 Q8 양자화

작성자는 Google Colab Free tier의 디스크 공간 제한으로 인해 Q8_0 또는 F16 양자화 버전을 생성할 수 없다고 언급했지만, 다른 사용자들이 Claude Opus를 통해 스크립트를 조정하여 해당 양자화를 수행할 수 있다고 제안했습니다.

Ad

최적 설정

LM Studio에서 최상의 성능을 위해 다음 매개변수를 사용하세요:

Temperature: 0.7
Top K Sampling: 20
Presence Penalty: 1.5
Top P Sampling: 0.8
Min P Sampling: 0
Seed: 3407 또는 42

시스템 프롬프트(Pastebin의 전체 버전)는 이 첫 번째 줄을 포함해야 합니다: "당신은 Alibaba Cloud가 만든 Qwen입니다. 당신은 도움이 되는 어시스턴트입니다." 작성자는 이 줄이 없으면 모델 성능이 떨어진다고 언급했습니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

OpenClaw-WebTop: GitHub Codespaces에서 Ollama와 Ubuntu Desktop으로 OpenClaw 실행하기
Tools

OpenClaw-WebTop: GitHub Codespaces에서 Ollama와 Ubuntu Desktop으로 OpenClaw 실행하기

OpenClaw-WebTop은 GitHub Codespaces를 사용하여 브라우저에서 직접 Ollama와 Ubuntu MATE 데스크톱이 포함된 완전한 OpenClaw 인스턴스를 실행하는 방법을 제공합니다. 로컬 Docker 설치나 VPS가 필요하지 않습니다.

OpenClawRadar
LiteParse: AI 에이전트를 위한 빠른 오픈소스 문서 파서
Tools

LiteParse: AI 에이전트를 위한 빠른 오픈소스 문서 파서

LiteParse는 경계 상자와 함께 공간 텍스트 파싱을 제공하는 오픈소스 문서 파서로, GPU 없이 로컬에서 실행되며 PDF, 오피스 문서, 이미지를 지원합니다. Claude Code, Cursor, OpenClaw을 포함한 40개 이상의 AI 에이전트용 스킬로 설치할 수 있습니다.

OpenClawRadar
오픈소스 PR 리뷰 에이전트 PrixAI, CodeRabbit 대비 6배 저렴한 비용으로 심어진 버그 10/10개 전부 탐지
Tools

오픈소스 PR 리뷰 에이전트 PrixAI, CodeRabbit 대비 6배 저렴한 비용으로 심어진 버그 10/10개 전부 탐지

Reddit 사용자가 PrixAI를 개발했습니다. 이는 로컬/저렴한 추론 모델을 사용해 CodeRabbit의 기능을 6배 저렴한 비용으로 제공하는 오픈소스 PR 리뷰 에이전트로, 테스트 PR에서 의도적으로 심은 10개의 문제를 모두 탐지했습니다.

OpenClawRadar
OpenClaw는 에이전트 기록 압축을 구현하여 컨텍스트 사용량을 줄입니다.
Tools

OpenClaw는 에이전트 기록 압축을 구현하여 컨텍스트 사용량을 줄입니다.

OpenClaw는 이제 완료된 하위 작업 로그를 구조화된 요약으로 대체하여 에이전트 기록을 압축하여 약 100만 토큰을 약 3만 토큰으로 줄입니다. 시스템은 작업 수명 주기를 식별하기 위해 4단계 스캐너를 사용하며, 에이전트 호환성을 유지하는 마스킹된 요약을 생성합니다.

OpenClawRadar