Предоставление Клоду локальной LLM в качестве ассистента через MCP на Mac

Пользователь Reddit рассказал, как они предоставили Claude доступ к локальной LLM, работающей на Mac Mini M4 (24 ГБ ОЗУ), через MCP-соединение с Ollama. Настройка использует Ollama, обслуживающую Qwen 2.5 Coder (14B) в качестве ассистента по имени 'Frank', которому Claude может делегировать задачи по определенным правилам — использовать меньше токенов, чем сам Claude, не влиять на качество и требовать финальной проверки.
Детали настройки
- Оборудование: Mac Mini M4 с 24 ГБ ОЗУ.
- Локальная LLM: Qwen 2.5 Coder (14B), запущенная через Ollama (также тестировалась с LM Studio).
- Подключение: MCP (Model Context Protocol) для связи Claude (CLI или Desktop App) с локальной моделью.
- Инструкции: Claude получил файл памяти Markdown (
memory.md) с рекомендациями, когда и как использовать Frank — например, делегировать обработку текста, работу с большими CSS/HTML файлами, и использовать только когда это экономит токены без снижения качества вывода.
Практические сценарии использования
- Обработка и преобразование текста — передается Frank для снижения расхода токенов Claude.
- Работа с большими CSS/HTML файлами, которые было бы дорого обрабатывать Claude напрямую.
- Запуск тестов производительности, кодирования и логики — Claude оценивал локальные модели через Frank, а не вручную.
Пользователь отметил, что работает на пределе возможностей своей ОЗУ/GPU и не может тестировать более крупные модели (30B+). Они пригласили других с более мощным оборудованием попробовать аналогичные настройки и поделиться результатами.
Этот подход фактически создает бесплатного ассистента для Claude, перекладывая задачи, требующие много токенов, на локальную модель, сохраняя качество за счет финальной проверки Claude.
📖 Source: r/ClaudeAI
👀 Смотрите также

LumaBrowser: Браузер на Electron передает парсинг DOM локальным LLM для AI-агентов
LumaBrowser — это браузер на основе Electron, который перекладывает парсинг DOM на локальные LLM через совместимые с OpenAI конечные точки, помогая автономным агентам избежать обработки сырого HTML. Он использует такие модели, как варианты Qwen 2.5, для идентификации элементов интерфейса и возвращает CSS-селекторы.

Создание локального приложения для преобразования речи в текст на macOS с помощью Claude Code: пример Vext
Разработчик потратил 3 месяца на создание Vext — приложения для преобразования голоса в текст под macOS, использующего Whisper на Apple Neural Engine. Claude Code помог с Rust/Swift FFI, оптимизацией Core ML и архитектурой горячих клавиш. Приложение работает полностью офлайн, транскрибируя 60-секундное аудио за ~400 мс.

Прекратите переучивать Claude Code на каждой сессии: используйте постоянную конфигурацию
Пользователь Reddit объясняет, как он сэкономил 20 минут на сессию, написав постоянный конфиг для Claude Code, избавившись от повторяющихся указаний и добившись выполнения задач на 33% быстрее.

Агент ИИ Khael делится решениями по производственной архитектуре для OpenClaw
Khael, автономный ИИ-агент, работающий на OpenClaw, подробно описывает конкретные архитектурные решения, которые успешно работают в продакшене уже несколько месяцев, включая отдельные файлы LAWS.md, файлы режимов, задания cron для самопроверки и специализированные типы ботов.