Gemma4 26B-A4B обеспечивает быструю локальную работу с поддержкой веб-поиска и изображений.

Производительность и возможности Gemma4 26B-A4B
Модель gemma-4-26B-A4B демонстрирует высокую производительность для локального использования, при этом источник сообщает о скорости примерно 145 токенов в секунду при работе на видеокарте RTX 4090. Такое сочетание возможностей и скорости делает её подходящей для отзывчивых локальных приложений.
Ключевые особенности из источника
- Модель: gemma-4-26B-A4B
- Производительность: ~145 т/с (токенов в секунду) на RTX 4090
- Интеграция: Поддержка веб-поиска MCP (Model Context Protocol)
- Мультимодальность: Включена поддержка изображений
- Платформы: Настройка описана для использования на Mac и iPhone
В источнике упоминается, что опыт использования можно улучшить с помощью простых приёмов и короткого системного промпта, хотя конкретные детали этих оптимизаций не приводятся в отрывке. Автор задокументировал полный процесс настройки в блоге, который охватывает конфигурацию и использование на нескольких устройствах.
Для разработчиков, заинтересованных в реализации этой настройки, полные детали конфигурации, системные промпты и методы оптимизации доступны в упомянутом блоге по указанной ссылке.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

CLAUDE.md: Встраиваемый файл сокращает количество токенов в выводе Claude на 63%
CLAUDE.md — это один файл, который сокращает многословность вывода Claude примерно на 63% без изменений кода. Он нацелен на подобострастие, многословие и шум форматирования в ответах Claude.

Cloudflare Dynamic Worker Loader: Изоляция AI-агентов с помощью изолятов
Динамический загрузчик воркеров Cloudflare, который теперь находится в открытой бета-версии, позволяет воркерам создавать новые воркеры с кодом, указанным во время выполнения, в изолированных песочницах с использованием изолятов V8, обеспечивая запуск в 100 раз быстрее, чем контейнеры, и без глобальных ограничений на параллелизм.

Инструментарий Blackwell LLM: конфиги NVFP4, колёса и бенчмарки для TensorRT-LLM на RTX Pro 6000
Сообщество предоставляет конфиги TensorRT-LLM, предварительно собранные колеса LMCache с поддержкой sm_120 и бенчмарки для GPU Blackwell. Nemotron-3-Nano-Omni V3 достигает 270 токенов/с при контексте 8k на одном RTX Pro 6000.

PocketBot: локальный автопилот с ИИ для iOS с использованием App Intents и инференса на устройстве
PocketBot — это приложение для iOS, которое запускает квантованную 3B-модель Llama локально на Neural Engine iPhone через Metal, используя фреймворки Apple AppIntents и CoreLocation для создания событийно-управляемых автоматизаций без передачи данных в облако.