在6GB GPU上进行会议摘要:qwen3.5:0.8B 用时57秒,Granite 4 350M 产生幻觉

VoiceFlow — это инструмент с открытым исходным кодом (MIT) для диктовки и транскрибации, работающий полностью локально — единственный сетевой запрос — это опциональная конечная точка LLM для обобщения (Ollama, llama.cpp, Groq, OpenAI). v1.6.0, выпущенная сегодня, добавляет рекордер совещаний: микрофон + системный звук смешиваются в стереофайл, транскрибируются faster-whisper, а затем обобщаются любой настроенной конечной точкой.
Бенчмарк: модели менее 1 млрд на реальных стенограммах совещаний
На RTX 3060 Laptop 6GB (~4,3 ГБ свободно после загрузки Whisper, Ollama 0.23, Arch Linux), на реальной 4-минутной стенограмме (~2900 символов):
- qwen3.5:0.8B (873M, Q8_0) — стандартный num_ctx (4096) был съеден токенами размышления. Исправление:
После исправления: структурированная сводка из 1562 символов (TL;DR, решения, действия, открытые вопросы) за 57 секунд, используя 2,2 ГБ видеопамяти. Работает.FROM qwen3.5:0.8b PARAMETER num_ctx 16384 - Granite 4.0 350M — быстрее (0,6–2,8 с на сводку), правильно структурированный вывод, но сильно галлюцинировал: на стенограмме о приобретении Bun компанией Anthropic он вернул «Приобретение Anthropic компанией Anthropic» и выдумал Binance. На другом совещании он выдал вахтенный журнал звездолета «Кассиопея». Ключевые слова присутствовали, но связи были перепутаны.
Вывод: qwen3.5:0.8B — это рабочая нижняя граница для локального обобщения совещаний; ни одна модель менее 500M еще не дала связного вывода на реальных разговорных данных.
Бесплатный облачный вариант: Groq's llama-3.3-70B
Бесплатный уровень Groq на llama-3.3-70B дает сводки за ~2 секунды, вывод «более плотный», чем у локальной 0.8B. Единственная неудача — 4-часовая стенограмма, превысившая контекстное окно. Для большинства длин совещаний это отличная бесплатная альтернатива.
Открытый вопрос: обобщение длинных контекстов при малом объеме видеопамяти
Автор спрашивает сообщество: для стенограмм длительностью 1-2 часа (~30К–60К токенов) на GPU с 6-8 ГБ, что работает? Варианты: более широкий контекст (съедает видеопамять), чанкованный map-reduce или другая маленькая модель, сохраняющая структуру на длинных входах — без необходимости 24 ГБ.
VoiceFlow поставляется как один .exe (Windows) или .AppImage (Linux), собранный с Pyloid + React + faster-whisper + SQLite. Автоопределение CUDA с запасным вариантом на CPU. Начальная настройка (модель, микрофон, горячая клавиша) занимает ~1 минуту.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

ClawRelay: нативный для macOS прокси-сервер, совместимый с OpenAI, для работы с LLM, поддерживающий автоматическое переключение при сбоях
ClawRelay запускает HTTP-сервер, совместимый с OpenAI, на macOS 15+ с автоматическим переключением между провайдерами LLM. Поддерживает OpenAI, Groq, Nvidia NIMs, Ollama и любые сервисы с конечной точкой /v1/chat/completions.

Creation OS: Локальная σ-затворная среда выполнения LLM, позволяющая моделям говорить «Я не знаю» вместо галлюцинаций
Creation OS оборачивает локальные LLM (BitNet, Qwen, Gemma, любые GGUF) с σ-затвором, который измеряет несколько каналов неопределенности и принимает решение ACCEPT, RETHINK или ABSTAIN для каждого вывода. Без облака, без API. Точность TruthfulQA улучшена ~29% за счет селективной регенерации.

Layerkit: Редактор изображений с ИИ и редактируемыми слоями, созданный на основе Claude Code
Разработчик создал Layerkit — браузерный AI-редактор изображений, который генерирует сцены с редактируемыми слоями, чтобы избежать постоянных повторных запросов. Инструмент использует многоэтапный AI-конвейер: один LLM планирует композицию, модель изображений генерирует сцену, а другой LLM анализирует фактическое изображение для размещения читаемого текста.

clarp: Открытая замена Claude с оплатой по тарифу до 15 июня
Claude -p переходит на тарификацию по кредитам с 15 июня. clarp — это open source CLI, который заменяет его для локальных рабочих процессов: просто измените имя бинарного файла с claude на clarp.