32GB VRAM GPU를 위한 로컬 번역 모델 추천

32GB VRAM GPU 설정(특히 5090을 언급)을 가진 개발자가 실시간 자막 및 단어/구문 번역에 최적화된 로컬 번역 모델에 대한 실용적인 결과를 공유했습니다. 주요 언어 쌍은 스웨덴어-영어와 한국어-영어입니다.
추천 모델
품질과 속도 테스트를 기반으로:
- 전반적인 언어용: Unsloth Gemma3 27b Instruct UD, Q6_K_XL
- 유럽 언어 + 11개 포함(한국어 등): Bartowski Utter Project EuroLLM 22B Instruct 2512, Q8_0
개발자는 이 모델들이 이전에 주로 사용하던 Magistral Small 2509 Q8, Gemma 3 27b Q4, Mistral Small 3.2 Q6_K, GPT_OSS 20b(순서대로)보다 성능이 우수하다고 언급했습니다.
성능 노트
이 모델들로 다음과 같은 결과를 얻었습니다:
- 버퍼링이 거의 없거나 전혀 없는 자막 번역
- 0-2초 내 단어 조회 번역
너무 느렸던 모델들
- Qwen3.5 27b Q6
- HyperCLOVAX SEED Think 32B Q6 (한국어용)
- Qwen3 32b Q6 (다른 Qwen3-3.5 변형들 포함)
- Viking 33b I1 Q4_K_S
기타 관찰 사항
개발자는 TranslateGemma 모델들을 언급하며, "Google에 따르면 번역에서 Gemma3 27b보다 상당히 우수하다"고 보고했지만, 이 모델들이 시스템-사용자 형식이 아닌 사용자-사용자 프롬프트를 사용한다고 지적했습니다. 이 형식 차이 때문에 직접 시도해보지는 않았습니다.
특히 스웨덴어 번역의 경우, GPT SW3 20b는 "작동할 때는 좋지만, 드물게 작동합니다(시스템 프롬프트를 수락하지 않음)."라고 언급되었습니다.
개발자는 또한 로컬 번역이 나쁘기 때문이 아니라 "여전히 일부 실수를 발견하고 있어서" Gemini 2.5 Flash와 Gemini 2.5 Flash-lite 체험판으로 전환했다고 언급했습니다. 저렴한 번역을 위해 Deepseek, OpenAI, Gemini, z.AI, Claude 중에서 고민 중이며, ChatGPT Thinking을 품질 기준으로 삼고 있습니다.
NVIDIA NIM, Routeway, Kilo, OpenCode, Puter.js를 통한 무료 API 키 옵션들도 언급했지만, 시도해보지는 않았습니다. z.ai에서 직접 GLM-4.7-Flash API를 테스트해본 결과 "꽤 좋았고, Gemma 3 27b 수준이거나 더 나은 정도"였지만, 자막 번역 위에 단어 조회를 할 때 속도 제한에 도달했습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

리눅스에서 멀티 샌드박싱으로 llama.cpp 네이티브 도구(exec_shell_command)를 안전하게 실행하는 방법
llama.cpp 네이티브 도구, 특히 exec_shell_command를 사용하고 Firejail + 작은 Alpine VM 등 다중 샌드박스 내에서 실행하여 llama-server 웹 UI를 통해 안전하게 웹을 가져오고 명령을 실행하는 실용적인 가이드입니다.

클로드 스킬 제작 실용 가이드: 구조, 트리거, 스크립트
클로드 스킬은 반복적인 작업을 자동화하는 지침 매뉴얼로, ~/.claude/skills/ 디렉토리에 SKILL.md 파일이 포함된 폴더 형태로 저장됩니다. 이 가이드는 YAML 트리거, 스크립트 통합, 그리고 다중 스킬 오케스트레이션 규칙을 설명합니다.

macOS에서 로컬 LLM으로 OpenClaw 실행하기 – 16–24GB RAM 가이드
macOS(16~24GB RAM)에서 양자화된 Qwen 3.5 모델을 OpenClaw와 함께 설정하는 실용적인 가이드. 설정 확인용 테스트 스킬 포함.

프로덕션급 AI 에이전트 신뢰성을 위한 제약 조건 설계
레딧 게시물은 클로드를 사용한 복잡한 코드베이스 작업에 대한 제약 기반 접근법을 자세히 설명하며, 명시적인 실패 모드 열거, 체크포인트가 있는 단계적 실행, 단축키 방지 규칙을 강조하여 140개 파일을 제거할 때 빌드 실패를 0건으로 달성하는 방법을 제시합니다.