6GB GPUでのミーティング要約: qwen3.5:0.8Bは57秒で動作、Granite 4 350Mは幻覚を起こす

VoiceFlowは、完全にローカルで動作するオープンソース(MIT)のディクテーションおよび文字起こしツールです。唯一のネットワーク呼び出しは、オプションのLLM要約エンドポイント(Ollama、llama.cpp、Groq、OpenAI)です。本日リリースされたv1.6.0では、会議レコーダーが追加されました。マイクとシステム音声をステレオファイルにミキシングし、faster-whisperで文字起こし、設定した任意のエンドポイントで要約します。
ベンチマーク: 実際の会議文字起こしでのサブ10億パラメータモデル
RTX 3060 Laptop 6GB(Whisperロード後約4.3GB空き、Ollama 0.23、Arch Linux)で、実際の4分間の会議文字起こし(約2900文字)を使用:
- qwen3.5:0.8B(873M、Q8_0)— デフォルトのnum_ctx(4096)が思考トークンに消費されました。修正:
修正後: 1562文字の構造化要約(TL;DR、決定事項、アクションアイテム、未解決質問)を57秒で生成、2.2GB VRAM使用。動作します。FROM qwen3.5:0.8b PARAMETER num_ctx 16384 - Granite 4.0 350M — より高速(要約あたり0.6~2.8秒)、適切に構造化された出力ですが、ひどく幻覚を起こしました: AnthropicがBunを買収したという文字起こしに対して、「AnthropicによるAnthropicの買収」を返し、Binanceをでっち上げました。別の会議では、スタートレックのブリッジログ(「Starship Cassiopeia」)を生成しました。キーワードは存在していましたが、関係性がめちゃくちゃでした。
結論: qwen3.5:0.8Bがローカル会議要約の実用最低ラインです。5億パラメータ未満のモデルでは、実際の会話データに対して首尾一貫した出力を生成できたものはまだありません。
無料クラウドオプション: Groqのllama-3.3-70B
Groqのllama-3.3-70Bの無料ティアは、約2秒の要約を提供し、出力はローカルの0.8Bより「引き締まっています」。唯一の失敗例は4時間の文字起こしがコンテキストウィンドウを超えた場合です。ほとんどの会議時間において、堅実な無料代替案です。
未解決の課題: 低VRAMでの長文脈要約
著者はコミュニティに問いかけます: 6~8GBのGPUで1~2時間の文字起こし(約30K~60Kトークン)に対して、何が有効でしょうか? 選択肢: より広いコンテキスト(VRAMを消費)、チャンク化マップリデュース、または長い入力でも構造を保持する別の小型モデル(24GBは不要)。
VoiceFlowは、単一の.exe(Windows)または.AppImage(Linux)として出荷され、Pyloid + React + faster-whisper + SQLiteで構築されています。CUDA自動検出とCPUフォールバック対応。セットアップ(モデル、マイク、ホットキー)は約1分です。
📖 全文を読む: r/LocalLLaMA
👀 See Also

Hermes Agent v0.6.0は、モデルごとのツール呼び出しパーサーによる強化されたローカルモデルサポートを提供します。
Nous ResearchによるHermes Agent v0.6.0は、30Bクラスのモデルで適切にツール呼び出しを処理するモデルごとのツールコールパーサーを提供し、Ollama、vLLM、sglangをすぐにサポートし、サーバーレス展開のためのModalやDaytonaを含む6つのターミナルバックエンドを備えています。

Microsoft Teams SDK、既存のAIエージェント向けにHTTPサーバーアダプターを追加
Microsoft Teams SDKには、開発者が既存のAIエージェントをTeamsに接続できるHTTPサーバーアダプターが追加されました。これにより、コードを書き直すことなく、LangChainチェーン、Slackボット、Azure Foundryデプロイメントを既存のExpressサーバーにPOST /api/messagesエンドポイントを注入して連携できます。

2026年エルメスエージェント代替品総まとめ:OpenClawからmemU Botまでのセルフホストオプション
ClawHubのセキュリティ問題後、Hermesをローンチから運用してきた開発者が、すべてのセルフホスト型およびマネージド代替案をテスト。主な発見: OpenClaw (370kスター) だが4日間で9件のCVE、約20%が悪意あるパッケージ; TrustClawはOAuth/サンドボックスで再構築; nanobotは約4000行のPythonでMCP対応; memU Botは独自の構造化メモリを搭載。マネージドオプションには、Perplexity Computer (19モデル、月200ドル)、Claude Cowork (実際のMacアプリを起動)、KimiClaw (40GB RAG、K2.5固定、中国データ法適用) など。詳細はソース参照。

Claude Code Karma:Claude Codeセッションのためのローカル可視化ダッシュボード
Claude Code Karmaは、~/.claude/のJSONLファイルを解析してClaude Codeセッションデータを可視化し、ツール使用状況を追跡し、サイレント障害を監視するオープンソースのローカルダッシュボードです。FastAPI、Svelte-Kit 2、Svelte 5、SQLiteで構築されており、完全なセッションタイムラインとライブ追跡を提供します。