Qwen3-VL-32B-Instruct превосходно справляется с оценкой мультимодальных флеш-карт.

Модель Qwen3-VL-32B-Instruct продемонстрировала высокую производительность в практическом мультимодальном приложении: оценке карточек Anki с закрытыми изображениями. Разработчику требовалась модель для проверки своих ответов на карточках и предоставления объяснений, подобных учительским, но многие карточки содержали изображения, скрытые прямоугольниками для практики запоминания.
Сравнение производительности
Согласно тестированию пользователя Reddit:
- Qwen3-VL-32B-Instruct «почти идеально понимал карточки» и оценивал их «правильно, так же, как я и окружающие меня люди»
- Он превзошёл несколько других моделей, включая Gemini 2.5 Flash, GPT 5 Nano/Mini, XAI 4.1 Fast, GLM и модели Mistral
- Единственными моделями, которые приблизились к нему, были ChatGPT 5.2 и Gemini 3/3.1/Claude 4+
- Пользователь описал его как «короля в понимании текста и изображений» для этой конкретной задачи
Практические соображения
Разработчик отметил несколько практических аспектов:
- Они использовали API, а не запускали модель локально, из-за ограничений системы
- Для сотен карточек в день Qwen3-VL-32B-Instruct был «безумно дешёвым по API» по сравнению с альтернативами
- Они рекомендуют попробовать его для задач, связанных с компьютерным зрением, но также отметили, что он хорошо справляется и с текстом
- Предложение — запускать его локально, если у вас мощная система
Этот пример использования демонстрирует, как мультимодальные модели могут справляться со специализированными образовательными приложениями, сочетающими понимание текста и изображений, особенно когда традиционные текстовые модели не справляются с контентом, содержащим скрытые изображения.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Использование Claude Haiku в качестве фильтра для снижения затрат на API Sonnet на 80%
Разработчик создал двухэтапный конвейер, используя Claude Haiku для фильтрации 85% неструктурированного текста перед отправкой только релевантного контента в Claude Sonnet, что сократило затраты на API примерно на 80% при обработке тысяч комментариев.

Использование Claude для аудита почтовых систем на предмет отсутствующих пользовательских сценариев
Разработчик использовал Claude для анализа схемы своей базы данных и email-триггеров, выявив четыре критические пробела: отсутствие последующих действий для неподтверждённых регистраций, отсутствие подтверждения для понижения тарифов, отсутствие уведомлений о принятых приглашениях в команду и отсутствие предупреждений о приближении к лимитам тарифного плана.

Разработчик создает приложение для бухгалтерского учета на основе ИИ с использованием Claude Code
Разработчик создал AICountant — приложение для бухгалтерского учёта на основе ИИ для фрилансеров и малого бизнеса, используя Claude Code во всём стеке технологий, включая Next.js App Router, Prisma с PostgreSQL и Vercel Blob storage. Приложение извлекает данные с чеков, конвертирует иностранные валюты по историческим курсам и организует всё в поисковый реестр.

Практическое применение OpenClaw для операций компании с одним сотрудником
Разработчик делится своим опытом использования OpenClaw для ведения компании в одиночку, отмечая, что он работает на вашем собственном компьютере в виртуальной машине или на Mac Mini и подключается к существующим инструментам. В посте говорится, что он больше всего подходит для повторяющихся задач и небольших операционных работ, а не для полностью автономного управления компанией.