디스코드 자동완성을 위한 Qwen 14B 미세 조정

✍️ OpenClawRadar📅 게시일: February 13, 2026🔗 Source
디스코드 자동완성을 위한 Qwen 14B 미세 조정
Ad

한 개발자가 자신의 디스코드 메시지를 활용해 Qwen 14B 모델을 미세 조정하여 자동 완성 도구로 만든 경험을 공유했습니다. 이 설정은 GitHub Copilot과 유사하게 타이핑 중에 제안을 제공하는 방식입니다.

개발자는 스크래핑 도구를 통해 수집한 약 250개의 디스코드 대화를 데이터셋으로 사용했습니다. 각 대화는 chat-ml 훈련 샘플로 형식화되었으며, 특히 코드 블록이나 링크 없이 사용자가 마지막으로 말한 메시지에 초점을 맞췄습니다. 이 선택은 기술적 내용보다 대화적 어조에 중점을 둔 것을 나타냅니다.

Qwen 14B 모델은 unsloth.ai 플랫폼과 QLoRA를 사용해 Kaggle GPU에서 미세 조정되었으며, 작은 데이터셋 크기로 인해 전체 훈련 과정은 약 15분 동안 지속되었습니다. 그런 다음 미세 조정된 모델을 .gguf 형식으로 병합하여 ollama.com을 통해 로컬에서 사용할 수 있게 했습니다.

이 자동 완성 도구의 프론트엔드는 Chrome 확장 프로그램으로 구현되었습니다. 마지막 몇 개의 메시지와 사용자의 현재 입력을 캡처하여 적절한 컨텍스트를 가진 chat-ml 프롬프트를 구성한 다음, Ollama에서 제공하는 모델을 사용해 완성문을 생성합니다. 제안이 시작되는 위치를 표시하기 위해 제로 너비 유니코드 문자가 교묘하게 사용되며, shift+tab을 누르면 제안을 수락합니다.

현재 설정은 디스코드에서 작동 중이며, 향후 다른 사이트도 지원할 수 있는 확장 가능성이 있습니다. 개발자는 현재 14B 모델이 사용 가능한 메모리를 거의 최대한 사용하고 있기 때문에 다른 모델 크기도 실험해 볼 것을 제안합니다. 4B나 8B 모델이 데이터 제한이 있을 수 있지만 실행 가능한 대안이 될 수 있다고 제안합니다.

소스 코드와 자세한 내용은 개발자의 GitHub github.com/b44ken/finetune에서 확인할 수 있습니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

500ms 미만 음성 에이전트 구축: 아키텍처와 성능 통찰
Tools

500ms 미만 음성 에이전트 구축: 아키텍처와 성능 통찰

한 개발자가 처음부터 음성 에이전트를 구축하여 전체 STT → LLM → TTS 스트리밍으로 ~400ms의 종단 간 지연 시간을 달성했습니다. 주요 통찰로는 음성을 차례 바꾸기 문제로 취급하고, 의미론적 차례 종료 감지를 사용하며, 모든 구성 요소를 최소 지연 시간을 위해 동일 위치에 배치하는 것이 포함됩니다.

OpenClawRadar
16GB Mac Mini M4에서 88개의 소형 GGUF 모델 벤치마킹
Tools

16GB Mac Mini M4에서 88개의 소형 GGUF 모델 벤치마킹

Mac Mini M4(16GB RAM)에서 88개의 GGUF 모델을 자동화 파이프라인으로 테스트한 결과, 9개 모델은 사용 불가능했으며, 속도와 품질 측면에서 파레토 최적선에 위치한 4개의 LFM2-8B-A1B MoE 모델을 확인했습니다.

OpenClawRadar
PayClaw, 가상 비자 카드로 결제 MCP 서버 샌드박스 출시
Tools

PayClaw, 가상 비자 카드로 결제 MCP 서버 샌드박스 출시

PayClaw가 결제 MCP 서버를 위한 샌드박스 환경을 출시했습니다. 이 환경에는 15분 만료 시간을 가진 가맹점 고정 가상 Visa 카드, 거래별 MFA 인증을 통한 인간 승인, 카드 발급 전 의도 선언 기능이 포함되어 있습니다. 실제 카드는 3월 4일에 출시될 예정입니다.

OpenClawRadar
IUM: MCP 심볼 인덱서, AI 에이전트 토큰 사용량을 grep 대비 15.9배 절감
Tools

IUM: MCP 심볼 인덱서, AI 에이전트 토큰 사용량을 grep 대비 15.9배 절감

IUM은 코드베이스를 SQLite 심볼 이벤트 매트릭스로 색인하여 정확한 파일:라인 좌표, 호출 그래프 추적 및 MCP를 통한 의미 검색을 제공합니다. DataFusion(1,538개 파일)을 기준으로 벤치마킹한 결과, 동등한 쿼리에 대해 grep보다 토큰이 15.9배 적었습니다.

OpenClawRadar