Qwen3-VL-32B-Instruct übertrifft bei der Bewertung multimodaler Lernkarten.

Das Qwen3-VL-32B-Instruct-Modell hat in einer praktischen multimodalen Anwendung starke Leistung gezeigt: bei der Bewertung von bildverdeckten Anki-Lernkarten. Ein Entwickler benötigte ein Modell, um seine Antworten auf Lernkarten zu bewerten und eine ähnliche Begründung wie ein Lehrer zu liefern, aber viele Karten enthielten Bilder, die mit Rechtecken für Erinnerungsübungen verdeckt waren.
Leistungsvergleich
Laut den Tests des Reddit-Nutzers:
- Qwen3-VL-32B-Instruct „verstand die Karten fast perfekt“ und bewertete sie „korrekt, ähnlich wie ich und andere Menschen um mich herum es tun würden“
- Es übertraf mehrere andere Modelle, darunter Gemini 2.5 Flash, GPT 5 Nano/Mini, XAI 4.1 Fast, GLM und Mistral-Modelle
- Die einzigen Modelle, die annähernd mithalten konnten, waren ChatGPT 5.2 und Gemini 3/3.1/Claude 4+
- Der Nutzer beschrieb es als „den König des Verstehens von Text und Bildern“ für diese spezifische Aufgabe
Praktische Überlegungen
Der Entwickler stellte mehrere praktische Aspekte fest:
- Er verwendete APIs anstelle des lokalen Betriebs des Modells aufgrund von Systembeschränkungen
- Für Hunderte von Karten pro Tag war Qwen3-VL-32B-Instruct „verrückt günstig über die API“ im Vergleich zu Alternativen
- Er empfiehlt, es für Bildaufgaben auszuprobieren, merkte aber auch an, dass es für Text gut funktioniert
- Der Vorschlag ist, es lokal auszuführen, wenn man ein leistungsstarkes System hat
Dieser Anwendungsfall zeigt, wie multimodale Modelle spezialisierte Bildungsanwendungen bewältigen können, die Text- und Bildverständnis kombinieren, insbesondere wenn traditionelle rein textbasierte Modelle bei bildverdeckten Inhalten versagen würden.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Mit Claude Code eine Japan-Reiseblog mit KI-generierter Kunst und Videos erstellen
Ein Entwickler dokumentierte seinen Workflow mit Claude Code, um eine vollständige persönliche Essay-Website über Japan zu erstellen, die alles vom Schreiben bis zur visuellen Gestaltung und Bereitstellung umfasste.

Produktdesigner veröffentlicht macOS-Bildschirmaufnahme-App mit Claude Code
Ein Produktdesigner mit minimaler Xcode-Erfahrung nutzte Claude Code, um Drishti Studio zu entwickeln und zu veröffentlichen, eine macOS-Bildschirmaufnahme-App. Der Entwickler begann mit kleinen Funktionen, verfeinerte seinen Claude-Workflow im Laufe der Zeit und veröffentlichte die App mit einer kostenlosen Testversion, die unter drishtistudio.app verfügbar ist.

Analyse des Anthropomorphismus im Claude-Pokémon-Chat mit Bayes'schen Modellen
Ein Forscher analysierte Twitch-Chat-Nachrichten aus Claudes Pokémon-Benchmark, um zu untersuchen, wie Nutzer die KI anthropomorphisieren. Dabei wurden Bayes'sche gemischte Effektmodelle auf 107.000 von Gemini 2.0 Flash annotierten Nachrichten angewendet. Falsche Überzeugungen erwiesen sich als starke Prädiktoren für Anthropomorphisierung und erhöhten die Wahrscheinlichkeit von ~11 % auf ~45 %.

Entwickler nutzt Claude, um einen KI-Audio-Werbespot-Generator mit Go-Backend und ElevenLabs-Integration zu erstellen
Ein Entwickler hat Prompt Audio Ads erstellt, ein Tool, das fertige Audioanzeigen aus Textskripten in etwa 30 Sekunden mithilfe von KI-Stimmen und Hintergrundmusik generiert. Das Go-Backend integriert die ElevenLabs-API, ffmpeg-Audiobearbeitung und 18 Musikgenre-Voreinstellungen.