Lokale Übersetzungsmodell-Empfehlungen für GPUs mit 32 GB VRAM

✍️ OpenClawRadar📅 Veröffentlicht: 26. März 2026🔗 Source
Lokale Übersetzungsmodell-Empfehlungen für GPUs mit 32 GB VRAM
Ad

Ein Entwickler mit einem 32GB-VRAM-GPU-Setup (erwähnte speziell eine 5090) teilte praktische Erkenntnisse über lokale Übersetzungsmodelle, die für Echtzeit-Untertitel- und Wort-/Phrasenübersetzungen optimiert sind. Seine Hauptsprachpaare sind Schwedisch-Englisch und Koreanisch-Englisch.

Empfohlene Modelle

Basierend auf Tests zu Qualität und Geschwindigkeit:

  • Für allgemeine Sprachen: Unsloth Gemma3 27b Instruct UD, Q6_K_XL
  • Für europäische Sprachen + 11 enthaltene (darunter Koreanisch): Bartowski Utter Project EuroLLM 22B Instruct 2512, Q8_0

Der Entwickler stellte fest, dass diese frühere Standardmodelle übertrafen: Magistral Small 2509 Q8, Gemma 3 27b Q4, Mistral Small 3.2 Q6_K und GPT_OSS 20b (in dieser Reihenfolge).

Leistungshinweise

Mit diesen Modellen erreichte er:

  • Untertitelübersetzungen mit wenig bis keiner Pufferung
  • Wortnachschlagübersetzungen innerhalb von 0-2 Sekunden

Modelle, die zu langsam waren

  • Qwen3.5 27b Q6
  • HyperCLOVAX SEED Think 32B Q6 (für Koreanisch)
  • Qwen3 32b Q6 (unter anderen Qwen3-3.5-Varianten)
  • Viking 33b I1 Q4_K_S
Ad

Weitere Beobachtungen

Der Entwickler erwähnte TranslateGemma-Modelle, von denen er berichtet, sie seien "laut Google deutlich besser als Gemma3 27b bei der Übersetzung", merkte aber an, dass diese Benutzer-Benutzer-Prompts anstelle des System-Benutzer-Formats verwenden. Er hat sie aufgrund dieses Formatunterschieds nicht selbst ausprobiert.

Für schwedische Übersetzungen speziell wurde GPT SW3 20b als "gut, wenn es funktioniert, was selten ist (lehnt meinen System-Prompt ab)" beschrieben.

Der Entwickler erwähnte auch, dass er zu Testversionen von Gemini 2.5 Flash und Gemini 2.5 Flash-lite gewechselt ist, nicht weil lokale Übersetzungen schlecht waren, sondern weil er "immer noch einige Fehler bemerkte". Er überlegt zwischen Deepseek, OpenAI, Gemini, z.AI und Claude für günstige Übersetzungen, wobei ChatGPT Thinking seine Qualitätsmesslatte ist.

Er erwähnte einige kostenlose API-Schlüsseloptionen über: NVIDIA NIM, Routeway, Kilo, OpenCode und Puter.js, hat sie aber nicht ausprobiert. Er testete die GLM-4.7-Flash-API direkt von z.ai und fand sie "ziemlich gut, auf Gemma 3 27b-Niveau oder sogar besser", stieß aber bei Wortnachschlägen zusätzlich zu Untertitelübersetzungen auf Ratenbegrenzungen.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Kostenloses OpenClaw Gateway mit lokalem LLM auf Oracle Cloud
Anleitungen

Kostenloses OpenClaw Gateway mit lokalem LLM auf Oracle Cloud

Ein Entwickler teilt mit, wie man OpenClaw Gateway mit einem lokalen Qwen3.5 27B A3B 4-Bit-LLM auf der kostenlosen Stufe von Oracle Cloud unter Verwendung einer VM.Standard.A2.Flex-Instanz mit 4 OCPUs, 24 GB RAM und 200 GB SSD betreibt, die über die QCAI-App ferngesteuert wird.

OpenClawRadar
Qwen3.5-397B MoE läuft auf 14 GB RAM dank geladenen Expertenseiten auf dem M1 Ultra
Anleitungen

Qwen3.5-397B MoE läuft auf 14 GB RAM dank geladenen Expertenseiten auf dem M1 Ultra

Die Paged-MoE-Engine hält nur 20 Experten im Arbeitsspeicher und lädt den Rest bei Bedarf von der SSD nach – damit läuft ein 209 GB großes 397B-Modell auf einem 64 GB Mac Studio mit 1,59 tok/s und 14 GB RAM-Spitzenlast. Enthält Benchmarks für kleinere Modelle.

OpenClawRadar
Praktische Lehren aus der Entwicklung von On-Device-KI in React Native
Anleitungen

Praktische Lehren aus der Entwicklung von On-Device-KI in React Native

Ein Entwickler teilt spezifische technische Details aus dem Aufbau einer React Native App mit On-Device-LLMs, Bildgenerierung, Sprachanalyse und Vision AI, einschließlich Speicherverwaltungsstrategien, Bibliotheksauswahl und Leistungsbenchmarks.

OpenClawRadar
Sicheres Ausführen von llama.cpp nativen Tools (exec_shell_command) mit mehrfacher Sandboxing unter Linux
Anleitungen

Sicheres Ausführen von llama.cpp nativen Tools (exec_shell_command) mit mehrfacher Sandboxing unter Linux

Eine praktische Anleitung zur Aktivierung der nativen Tools von llama.cpp, insbesondere exec_shell_command, und deren Ausführung in mehreren Sandboxen (Firejail + winzige Alpine VM) für sicheres Web-Fetching und Befehlsausführung über die llama-server Web-Oberfläche.

OpenClawRadar