Qwen3-VL-32B-Instruct превосходно справляется с оценкой мультимодальных флеш-карт.

Модель Qwen3-VL-32B-Instruct продемонстрировала высокую производительность в практическом мультимодальном приложении: оценке карточек Anki с закрытыми изображениями. Разработчику требовалась модель для проверки своих ответов на карточках и предоставления объяснений, подобных учительским, но многие карточки содержали изображения, скрытые прямоугольниками для практики запоминания.
Сравнение производительности
Согласно тестированию пользователя Reddit:
- Qwen3-VL-32B-Instruct «почти идеально понимал карточки» и оценивал их «правильно, так же, как я и окружающие меня люди»
- Он превзошёл несколько других моделей, включая Gemini 2.5 Flash, GPT 5 Nano/Mini, XAI 4.1 Fast, GLM и модели Mistral
- Единственными моделями, которые приблизились к нему, были ChatGPT 5.2 и Gemini 3/3.1/Claude 4+
- Пользователь описал его как «короля в понимании текста и изображений» для этой конкретной задачи
Практические соображения
Разработчик отметил несколько практических аспектов:
- Они использовали API, а не запускали модель локально, из-за ограничений системы
- Для сотен карточек в день Qwen3-VL-32B-Instruct был «безумно дешёвым по API» по сравнению с альтернативами
- Они рекомендуют попробовать его для задач, связанных с компьютерным зрением, но также отметили, что он хорошо справляется и с текстом
- Предложение — запускать его локально, если у вас мощная система
Этот пример использования демонстрирует, как мультимодальные модели могут справляться со специализированными образовательными приложениями, сочетающими понимание текста и изображений, особенно когда традиционные текстовые модели не справляются с контентом, содержащим скрытые изображения.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Непрограммист создаёт приложение для iOS с помощью Claude за год: практические выводы
Человек без опыта разработки и без знаний в области программного обеспечения создал BloomDay, полноценное приложение для повышения продуктивности на iOS, используя Claude в течение года. Приложение включает отслеживание задач и привычек, режим фокусировки с фоновыми звуками и виртуальный сад, построено на React Native и Expo.

Агент ИИ застройщика совершает первый телефонный звонок с контекстом и стилем голоса
Разработчик, управляющий многоагентной системой для недвижимости, сообщает, что его ИИ-агент совершил первый успешный телефонный звонок, используя полный контекст о сделках и потенциальных клиентах, имитируя конкретный подход к продажам и стиль речи разработчика.

Использование OpenClaw с инструментами ИИ для видео для масштабирования создания короткого контента
Разработчик делится своим рабочим процессом, используя OpenClaw для поиска ракурсов и зацепок контента, затем сочетая его с инструментом для создания видео на ИИ, чтобы создавать и массово публиковать Shorts, Reels и TikTok, что приводит к стабильным переходам по партнёрским ссылкам и выплатам от платформ.

Пользовательский рабочий процесс: Использование Claude.ai для планирования и Claude Code для реализации
Разработчик описывает использование Claude.ai для детального планирования и обсуждения архитектуры, затем Claude Code для реализации, но отмечает, что между двумя инструментами нет общего состояния, что требует ручной передачи файлов.