6GB GPU에서 회의 요약: qwen3.5:0.8B는 57초 작동, Granite 4 350M은 환각 발생

✍️ OpenClawRadar📅 게시일: May 19, 2026🔗 Source
6GB GPU에서 회의 요약: qwen3.5:0.8B는 57초 작동, Granite 4 350M은 환각 발생
Ad

VoiceFlow는 오픈소스(MIT) 받아쓰기 및 전사 도구로, 완전히 로컬에서 실행됩니다. 유일한 네트워크 호출은 선택적 LLM 요약 엔드포인트(Ollama, llama.cpp, Groq, OpenAI)입니다. 오늘 출시된 v1.6.0에는 회의 녹음기가 추가되었습니다. 마이크와 시스템 오디오를 스테레오 파일로 혼합하고, faster-whisper로 전사한 후, 설정한 모든 엔드포인트로 요약합니다.

벤치마크: 실제 회의록에서 10억 미만 모델

RTX 3060 Laptop 6GB(Whisper 로드 후 약 4.3GB 여유, Ollama 0.23, Arch Linux)에서 실제 4분 회의록(~2900자) 기준:

  • qwen3.5:0.8B(873M, Q8_0) — 기본 num_ctx(4096)가 thinking 토큰에 의해 소모됨. 수정:
    FROM qwen3.5:0.8b
    PARAMETER num_ctx 16384
    수정 후: 1562자 구조화된 요약(TL;DR, 결정, 액션 아이템, 미해결 질문)을 57초에 생성, 2.2GB VRAM 사용. 작동함.
  • Granite 4.0 350M — 더 빠르고(요약당 0.6~2.8초), 출력 구조는 적절하지만 심각한 환각: Anthropic이 Bun을 인수한다는 회의록에서 "Anthropic의 Anthropic 인수"를 반환하고 Binance를 지어냄. 다른 회의에서는 "Starship Cassiopeia" 스타트렉 함교 로그를 생성. 키워드는 존재했지만 관계가 뒤섞였음.

결론: qwen3.5:0.8B가 로컬 회의 요약의 실용적 최소 기준이며, 5억 미만 모델은 실제 대화 데이터에서 일관된 출력을 아직 생성하지 못했습니다.

Ad

무료 클라우드 옵션: Groq의 llama-3.3-70B

Groq의 무료 티어 llama-3.3-70B는 약 2초 만에 요약을 생성하며, 로컬 0.8B보다 "더 타이트한" 출력을 제공합니다. 유일한 실패는 4시간 회의록이 컨텍스트 창을 초과한 경우였습니다. 대부분의 회의 길이에서는 견고한 무료 대안입니다.

미해결 질문: 낮은 VRAM에서 긴 컨텍스트 요약

저자는 커뮤니티에 묻습니다: 6-8GB GPU에서 1-2시간 회의록(~3만~6만 토큰)에 어떤 방법이 효과적일까요? 옵션: 더 넓은 컨텍스트(VRAM 소모), 청크 기반 map-reduce, 또는 긴 입력에서 구조를 유지하면서 24GB가 필요하지 않은 다른 소형 모델.

VoiceFlow는 단일 .exe(Windows) 또는 .AppImage(Linux)로 제공되며, Pyloid + React + faster-whisper + SQLite로 제작되었습니다. CUDA 자동 감지 및 CPU 대체 지원. 설정(모델, 마이크, 단축키)에 약 1분 소요됩니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

오픈소스 북 제네시스: 자율적 책 쓰기를 위한 20가지 클로드 코드 스킬
Tools

오픈소스 북 제네시스: 자율적 책 쓰기를 위한 20가지 클로드 코드 스킬

북 제네시스는 20개의 전문화된 클로드 코드 스킬로 구성된 오픈소스 시스템으로, 책 아이디어 하나에서 완성된 출간 준비된 원고를 14단계 자동화 파이프라인을 통해 생성합니다. '카오스 엔진'을 포함해 AI 예측 가능성을 깨는 기능이 있으며, 68,000단어 회고록을 생성하여 제네시스 점수 9.0/10을 기록했습니다.

OpenClawRadar
iai-mcp: 로컬 데몬이 99% 재현율로 세션 간 지속적 메모리를 클로드에게 제공
Tools

iai-mcp: 로컬 데몬이 99% 재현율로 세션 간 지속적 메모리를 클로드에게 제공

iai-mcp는 모든 Claude 대화를 캡처하여 세 가지 메모리 계층으로 구성하고 새 세션에 컨텍스트를 다시 제공하는 오픈 소스 로컬 데몬입니다. 99% 이상의 정확한 재현, 100ms 미만의 검색, 세션 시작 비용 3,000 토큰 미만을 달성합니다.

OpenClawRadar
귀하의 공정한 몫 계산 도구: 회사 이익에 대한 귀하의 동등한 몫 계산하기
Tools

귀하의 공정한 몫 계산 도구: 회사 이익에 대한 귀하의 동등한 몫 계산하기

한 개발자가 클로드 코드와 Vercel을 사용해 SEC 10-K 제출 자료를 기반으로 고용주의 연간 이익 중 귀하의 균등 분배액을 계산하는 웹 도구를 구축했습니다. 이 도구는 애플 직원당 74만 7천 달러, 엔비디아 직원당 280만 달러와 같은 구체적인 수치를 보여줍니다.

OpenClawRadar
OpenClaw 에이전트, 맞춤형 스킬로 전화 통화 기능 획득
Tools

OpenClaw 에이전트, 맞춤형 스킬로 전화 통화 기능 획득

한 개발자가 자체 호스팅 OpenClaw 에이전트를 위한 맞춤형 스킬을 만들어 전화 통화 기능을 추가했습니다. 이 스킬은 빌드 완료나 서버 장애 같은 트리거에 따라 에이전트가 전화를 걸 수 있게 해줍니다. 구현체는 웹 검색 및 알림 설정을 포함한 모든 채팅 기능을 갖춘 음성 상호작용을 제공합니다.

OpenClawRadar