在6GB GPU上进行会议摘要:qwen3.5:0.8B 用时57秒,Granite 4 350M 产生幻觉

✍️ OpenClawRadar📅 Опубликовано: 19 мая 2026 г.🔗 Source
在6GB GPU上进行会议摘要:qwen3.5:0.8B 用时57秒,Granite 4 350M 产生幻觉
Ad

VoiceFlow — это инструмент с открытым исходным кодом (MIT) для диктовки и транскрибации, работающий полностью локально — единственный сетевой запрос — это опциональная конечная точка LLM для обобщения (Ollama, llama.cpp, Groq, OpenAI). v1.6.0, выпущенная сегодня, добавляет рекордер совещаний: микрофон + системный звук смешиваются в стереофайл, транскрибируются faster-whisper, а затем обобщаются любой настроенной конечной точкой.

Бенчмарк: модели менее 1 млрд на реальных стенограммах совещаний

На RTX 3060 Laptop 6GB (~4,3 ГБ свободно после загрузки Whisper, Ollama 0.23, Arch Linux), на реальной 4-минутной стенограмме (~2900 символов):

  • qwen3.5:0.8B (873M, Q8_0) — стандартный num_ctx (4096) был съеден токенами размышления. Исправление:
    FROM qwen3.5:0.8b
    PARAMETER num_ctx 16384
    После исправления: структурированная сводка из 1562 символов (TL;DR, решения, действия, открытые вопросы) за 57 секунд, используя 2,2 ГБ видеопамяти. Работает.
  • Granite 4.0 350M — быстрее (0,6–2,8 с на сводку), правильно структурированный вывод, но сильно галлюцинировал: на стенограмме о приобретении Bun компанией Anthropic он вернул «Приобретение Anthropic компанией Anthropic» и выдумал Binance. На другом совещании он выдал вахтенный журнал звездолета «Кассиопея». Ключевые слова присутствовали, но связи были перепутаны.

Вывод: qwen3.5:0.8B — это рабочая нижняя граница для локального обобщения совещаний; ни одна модель менее 500M еще не дала связного вывода на реальных разговорных данных.

Ad

Бесплатный облачный вариант: Groq's llama-3.3-70B

Бесплатный уровень Groq на llama-3.3-70B дает сводки за ~2 секунды, вывод «более плотный», чем у локальной 0.8B. Единственная неудача — 4-часовая стенограмма, превысившая контекстное окно. Для большинства длин совещаний это отличная бесплатная альтернатива.

Открытый вопрос: обобщение длинных контекстов при малом объеме видеопамяти

Автор спрашивает сообщество: для стенограмм длительностью 1-2 часа (~30К–60К токенов) на GPU с 6-8 ГБ, что работает? Варианты: более широкий контекст (съедает видеопамять), чанкованный map-reduce или другая маленькая модель, сохраняющая структуру на длинных входах — без необходимости 24 ГБ.

VoiceFlow поставляется как один .exe (Windows) или .AppImage (Linux), собранный с Pyloid + React + faster-whisper + SQLite. Автоопределение CUDA с запасным вариантом на CPU. Начальная настройка (модель, микрофон, горячая клавиша) занимает ~1 минуту.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Навык Claude для Devvit повышает точность генерации кода с 73% до 100%.
Инструменты

Навык Claude для Devvit повышает точность генерации кода с 73% до 100%.

Разработчик создал структурированный слой подсказок SKILL.md для Claude, который предоставляет контекст для платформы Devvit от Reddit, улучшив результаты оценки с 7/10 до 10/10 по типичным задачам Devvit за счет предотвращения конкретных ошибок времени выполнения.

OpenClawRadar
Трекер сессий Claude: Автоматическое сохранение сессий кода Claude в Issues GitHub
Инструменты

Трекер сессий Claude: Автоматическое сохранение сессий кода Claude в Issues GitHub

Новый инструмент под названием claude-session-tracker автоматически сохраняет сессии Claude Code в GitHub Issues, записывая каждый запрос и ответ в виде комментариев с отметками времени. Он создаёт один Issue на GitHub для каждой сессии, привязывая его к доске Projects, и работает через нативную систему хуков Claude Code, не расходуя токены контекста.

OpenClawRadar
Инструменты CLI с совместимостью с AI-агентами: подход через каталог навыков
Инструменты

Инструменты CLI с совместимостью с AI-агентами: подход через каталог навыков

Пользователь Reddit делится методом обеспечения совместимости CLI-инструментов с ИИ-агентами для программирования, такими как Claude Code, путем создания SKILL.md файлов, которые обучают агентов установке, аутентификации и использованию. Этот подход решает распространённые проблемы, такие как интерактивные запросы, вывод JSON и методы аутентификации.

OpenClawRadar
Навык Clawhub позволяет OpenClaw анализировать данные Apple Health через API.
Инструменты

Навык Clawhub позволяет OpenClaw анализировать данные Apple Health через API.

Новый навык Clawhub под названием 'apple-health-export-analyzer' позволяет OpenClaw читать и анализировать данные Apple Health, предоставляя их через API, обрабатывая большие XML-файлы для извлечения соответствующих метрик и предоставляя ежедневные обновления о здоровье с практическими рекомендациями.

OpenClawRadar