在6GB GPU上进行会议摘要:qwen3.5:0.8B 用时57秒,Granite 4 350M 产生幻觉

✍️ OpenClawRadar📅 Опубликовано: 19 мая 2026 г.🔗 Source
在6GB GPU上进行会议摘要:qwen3.5:0.8B 用时57秒,Granite 4 350M 产生幻觉
Ad

VoiceFlow — это инструмент с открытым исходным кодом (MIT) для диктовки и транскрибации, работающий полностью локально — единственный сетевой запрос — это опциональная конечная точка LLM для обобщения (Ollama, llama.cpp, Groq, OpenAI). v1.6.0, выпущенная сегодня, добавляет рекордер совещаний: микрофон + системный звук смешиваются в стереофайл, транскрибируются faster-whisper, а затем обобщаются любой настроенной конечной точкой.

Бенчмарк: модели менее 1 млрд на реальных стенограммах совещаний

На RTX 3060 Laptop 6GB (~4,3 ГБ свободно после загрузки Whisper, Ollama 0.23, Arch Linux), на реальной 4-минутной стенограмме (~2900 символов):

  • qwen3.5:0.8B (873M, Q8_0) — стандартный num_ctx (4096) был съеден токенами размышления. Исправление:
    FROM qwen3.5:0.8b
    PARAMETER num_ctx 16384
    После исправления: структурированная сводка из 1562 символов (TL;DR, решения, действия, открытые вопросы) за 57 секунд, используя 2,2 ГБ видеопамяти. Работает.
  • Granite 4.0 350M — быстрее (0,6–2,8 с на сводку), правильно структурированный вывод, но сильно галлюцинировал: на стенограмме о приобретении Bun компанией Anthropic он вернул «Приобретение Anthropic компанией Anthropic» и выдумал Binance. На другом совещании он выдал вахтенный журнал звездолета «Кассиопея». Ключевые слова присутствовали, но связи были перепутаны.

Вывод: qwen3.5:0.8B — это рабочая нижняя граница для локального обобщения совещаний; ни одна модель менее 500M еще не дала связного вывода на реальных разговорных данных.

Ad

Бесплатный облачный вариант: Groq's llama-3.3-70B

Бесплатный уровень Groq на llama-3.3-70B дает сводки за ~2 секунды, вывод «более плотный», чем у локальной 0.8B. Единственная неудача — 4-часовая стенограмма, превысившая контекстное окно. Для большинства длин совещаний это отличная бесплатная альтернатива.

Открытый вопрос: обобщение длинных контекстов при малом объеме видеопамяти

Автор спрашивает сообщество: для стенограмм длительностью 1-2 часа (~30К–60К токенов) на GPU с 6-8 ГБ, что работает? Варианты: более широкий контекст (съедает видеопамять), чанкованный map-reduce или другая маленькая модель, сохраняющая структуру на длинных входах — без необходимости 24 ГБ.

VoiceFlow поставляется как один .exe (Windows) или .AppImage (Linux), собранный с Pyloid + React + faster-whisper + SQLite. Автоопределение CUDA с запасным вариантом на CPU. Начальная настройка (модель, микрофон, горячая клавиша) занимает ~1 минуту.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

ClawRelay: нативный для macOS прокси-сервер, совместимый с OpenAI, для работы с LLM, поддерживающий автоматическое переключение при сбоях
Инструменты

ClawRelay: нативный для macOS прокси-сервер, совместимый с OpenAI, для работы с LLM, поддерживающий автоматическое переключение при сбоях

ClawRelay запускает HTTP-сервер, совместимый с OpenAI, на macOS 15+ с автоматическим переключением между провайдерами LLM. Поддерживает OpenAI, Groq, Nvidia NIMs, Ollama и любые сервисы с конечной точкой /v1/chat/completions.

OpenClawRadar
Creation OS: Локальная σ-затворная среда выполнения LLM, позволяющая моделям говорить «Я не знаю» вместо галлюцинаций
Инструменты

Creation OS: Локальная σ-затворная среда выполнения LLM, позволяющая моделям говорить «Я не знаю» вместо галлюцинаций

Creation OS оборачивает локальные LLM (BitNet, Qwen, Gemma, любые GGUF) с σ-затвором, который измеряет несколько каналов неопределенности и принимает решение ACCEPT, RETHINK или ABSTAIN для каждого вывода. Без облака, без API. Точность TruthfulQA улучшена ~29% за счет селективной регенерации.

OpenClawRadar
Layerkit: Редактор изображений с ИИ и редактируемыми слоями, созданный на основе Claude Code
Инструменты

Layerkit: Редактор изображений с ИИ и редактируемыми слоями, созданный на основе Claude Code

Разработчик создал Layerkit — браузерный AI-редактор изображений, который генерирует сцены с редактируемыми слоями, чтобы избежать постоянных повторных запросов. Инструмент использует многоэтапный AI-конвейер: один LLM планирует композицию, модель изображений генерирует сцену, а другой LLM анализирует фактическое изображение для размещения читаемого текста.

OpenClawRadar
clarp: Открытая замена Claude с оплатой по тарифу до 15 июня
Инструменты

clarp: Открытая замена Claude с оплатой по тарифу до 15 июня

Claude -p переходит на тарификацию по кредитам с 15 июня. clarp — это open source CLI, который заменяет его для локальных рабочих процессов: просто измените имя бинарного файла с claude на clarp.

OpenClawRadar