Пользователь Reddit сообщает о 18,8 ток/с при CPU-инференсе модели Qwen 3 30B Q4 на архитектуре Zen 4.

Пользователь Reddit поделился своим опытом тестирования локального вывода LLM на процессоре вместо инвестиций в дорогое графическое оборудование.
Ключевые детали
Пользователь рассматривал возможность покупки графического оборудования для локального вывода LLM, включая:
- Графические процессоры P40
- Графические процессоры V100 (почти купил версию SXM2, которая не подключается к обычным материнским платам)
- Графические процессоры RTX 3090 (стоимостью от $800+ из-за спроса на ИИ)
После совета сначала попробовать вывод на процессоре, он протестировал:
- Модель: Qwen 3 30B Q4
- Оборудование: Процессор Zen 4 с памятью DDR5
- Производительность: 18,8 токенов в секунду на процессоре
- Ожидание против реальности: Ожидал 3-5 ток/с, получил почти 19 ток/с
Пользователь отметил, что «Zen 4 + DDR5 просто взломан для вывода».
Результаты практического тестирования
Пользователь провел сравнение реальных задач по программированию:
- Модель на 8B «уверенно писала совершенно неправильный код»
- Модель на 30B «справилась с первого раза»
- Он описал производительность модели на 30B как «практически уровень GPT-4o за $0»
Это говорит о том, что для определенных задач программирования правильно квантованная модель на 30B, работающая на современном процессорном оборудовании, может давать результаты, сравнимые с более крупными облачными моделями, без инвестиций в оборудование, обычно связанных с локальным выводом LLM.
📖 Прочитать полный источник: r/LocalLLaMA
👀 Смотрите также

TimesFM 2.5 от Google: 200-миллионная модель для временных рядов с контекстом в 16 тысяч элементов.
Google Research представила TimesFM 2.5 — декодерную базовую модель для прогнозирования временных рядов с 200 миллионами параметров, длиной контекста 16 тысяч и непрерывным квантильным прогнозированием до горизонта в 1 тысячу.

«Код никогда не был сложной частью» — это оскорбление для всех программистов
Сенко Рашич опровергает утверждение, что программировать легко, а сложно понять, что создавать, утверждая, что и то и другое сложно, и пренебрежение этим вредно.

Claude Code v2.1.211: Пересылка текста субагентом, исправления разрешений и изменения в режиме Vim
Claude Code v2.1.211 добавляет флаг --forward-subagent-text, исправляет спуфинг предпросмотра разрешений, улучшает переопределение модели суб-агентов и обновляет Vim s/S для работы в режиме NORMAL.

Claude Code якобы отклоняет запросы или взимает дополнительную плату, когда в коммитах упоминается 'OpenClaw'
Твит от Theo утверждает, что Claude Code либо отказывает в запросах, либо взимает дополнительную плату, если ваши git-коммиты упоминают 'OpenClaw', что вызвало обсуждение на HN.