6GB GPU에서 회의 요약: qwen3.5:0.8B는 57초 작동, Granite 4 350M은 환각 발생

VoiceFlow는 오픈소스(MIT) 받아쓰기 및 전사 도구로, 완전히 로컬에서 실행됩니다. 유일한 네트워크 호출은 선택적 LLM 요약 엔드포인트(Ollama, llama.cpp, Groq, OpenAI)입니다. 오늘 출시된 v1.6.0에는 회의 녹음기가 추가되었습니다. 마이크와 시스템 오디오를 스테레오 파일로 혼합하고, faster-whisper로 전사한 후, 설정한 모든 엔드포인트로 요약합니다.
벤치마크: 실제 회의록에서 10억 미만 모델
RTX 3060 Laptop 6GB(Whisper 로드 후 약 4.3GB 여유, Ollama 0.23, Arch Linux)에서 실제 4분 회의록(~2900자) 기준:
- qwen3.5:0.8B(873M, Q8_0) — 기본 num_ctx(4096)가 thinking 토큰에 의해 소모됨. 수정:
수정 후: 1562자 구조화된 요약(TL;DR, 결정, 액션 아이템, 미해결 질문)을 57초에 생성, 2.2GB VRAM 사용. 작동함.FROM qwen3.5:0.8b PARAMETER num_ctx 16384 - Granite 4.0 350M — 더 빠르고(요약당 0.6~2.8초), 출력 구조는 적절하지만 심각한 환각: Anthropic이 Bun을 인수한다는 회의록에서 "Anthropic의 Anthropic 인수"를 반환하고 Binance를 지어냄. 다른 회의에서는 "Starship Cassiopeia" 스타트렉 함교 로그를 생성. 키워드는 존재했지만 관계가 뒤섞였음.
결론: qwen3.5:0.8B가 로컬 회의 요약의 실용적 최소 기준이며, 5억 미만 모델은 실제 대화 데이터에서 일관된 출력을 아직 생성하지 못했습니다.
무료 클라우드 옵션: Groq의 llama-3.3-70B
Groq의 무료 티어 llama-3.3-70B는 약 2초 만에 요약을 생성하며, 로컬 0.8B보다 "더 타이트한" 출력을 제공합니다. 유일한 실패는 4시간 회의록이 컨텍스트 창을 초과한 경우였습니다. 대부분의 회의 길이에서는 견고한 무료 대안입니다.
미해결 질문: 낮은 VRAM에서 긴 컨텍스트 요약
저자는 커뮤니티에 묻습니다: 6-8GB GPU에서 1-2시간 회의록(~3만~6만 토큰)에 어떤 방법이 효과적일까요? 옵션: 더 넓은 컨텍스트(VRAM 소모), 청크 기반 map-reduce, 또는 긴 입력에서 구조를 유지하면서 24GB가 필요하지 않은 다른 소형 모델.
VoiceFlow는 단일 .exe(Windows) 또는 .AppImage(Linux)로 제공되며, Pyloid + React + faster-whisper + SQLite로 제작되었습니다. CUDA 자동 감지 및 CPU 대체 지원. 설정(모델, 마이크, 단축키)에 약 1분 소요됩니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

오픈소스 북 제네시스: 자율적 책 쓰기를 위한 20가지 클로드 코드 스킬
북 제네시스는 20개의 전문화된 클로드 코드 스킬로 구성된 오픈소스 시스템으로, 책 아이디어 하나에서 완성된 출간 준비된 원고를 14단계 자동화 파이프라인을 통해 생성합니다. '카오스 엔진'을 포함해 AI 예측 가능성을 깨는 기능이 있으며, 68,000단어 회고록을 생성하여 제네시스 점수 9.0/10을 기록했습니다.

iai-mcp: 로컬 데몬이 99% 재현율로 세션 간 지속적 메모리를 클로드에게 제공
iai-mcp는 모든 Claude 대화를 캡처하여 세 가지 메모리 계층으로 구성하고 새 세션에 컨텍스트를 다시 제공하는 오픈 소스 로컬 데몬입니다. 99% 이상의 정확한 재현, 100ms 미만의 검색, 세션 시작 비용 3,000 토큰 미만을 달성합니다.

귀하의 공정한 몫 계산 도구: 회사 이익에 대한 귀하의 동등한 몫 계산하기
한 개발자가 클로드 코드와 Vercel을 사용해 SEC 10-K 제출 자료를 기반으로 고용주의 연간 이익 중 귀하의 균등 분배액을 계산하는 웹 도구를 구축했습니다. 이 도구는 애플 직원당 74만 7천 달러, 엔비디아 직원당 280만 달러와 같은 구체적인 수치를 보여줍니다.

OpenClaw 에이전트, 맞춤형 스킬로 전화 통화 기능 획득
한 개발자가 자체 호스팅 OpenClaw 에이전트를 위한 맞춤형 스킬을 만들어 전화 통화 기능을 추가했습니다. 이 스킬은 빌드 완료나 서버 장애 같은 트리거에 따라 에이전트가 전화를 걸 수 있게 해줍니다. 구현체는 웹 검색 및 알림 설정을 포함한 모든 채팅 기능을 갖춘 음성 상호작용을 제공합니다.