AI-инференс явно прибылен: разбираем экономику

✍️ OpenClawRadar📅 Опубликовано: 4 июля 2026 г.🔗 Source
AI-инференс явно прибылен: разбираем экономику
Ad

Шон Гёдекс утверждает, что AI-инференс явно прибылен, вопреки заявлениям о том, что он субсидируется венчурными инвестициями. Он разбирает математику и ценообразование открытых моделей, показывая, что обслуживание LLM может быть устойчивым бизнесом.

Разбор затрат для плотной модели на 70B

Используя четыре Nvidia A100 (400W каждая, ~2 млн токенов/час):

  • Электроэнергия: ~13¢/час по промышленным тарифам, плюс ~13¢/час на охлаждение → итого 26¢/час
  • Амортизация GPU: $20k за A100 за 5 лет → $16k/год или $1,80/час
  • Итого: примерно $1 за миллион выходных токенов

OpenAI GPT-5.4-mini взимает $4,50 за миллион токенов, а более мощные модели — в 3-6 раз дороже. Это делает заявленную валовую маржу в 70-80% правдоподобной.

Ad

Открытые модели подтверждают прибыльность

DeepSeek заявляет о марже более 80% на инференсе R1, взимая менее половины от цен OpenAI/Anthropic. Их API DeepSeek-V4-Pro стоит около 87¢ за миллион выходных токенов — близко к фактической стоимости, что предполагает еще более высокую маржу для фронтирных моделей.

Почему существуют высокие маржи

AI-лабораториям, таким как OpenAI и Anthropic, нужна прибыль от инференса для субсидирования затрат на обучение, поэтому они держат высокие цены на API. Но провайдер, занимающийся только инференсом и не несущий затрат на обучение, может получать прибыль даже при более низких ценах. Даже если фронтирные лаборатории разорятся, тот, кто приобретет права на их модели, сможет продолжать прибыльно продавать инференс.

📖 Читать полный источник: HN AI Agents

Ad

👀 Смотрите также

Критика границ абстракции и подхода к интеграции сервисов в MCP
Новости

Критика границ абстракции и подхода к интеграции сервисов в MCP

Обсуждение на Reddit критикует MCP за объединение доступа к API, эффективных инструментов и предметных знаний в один слой, утверждая, что это создаёт ограниченные интерфейсы по сравнению с базовыми API. В посте в качестве примера приводится Lattice, чей публичный API охватывает только рабочие процессы HR-администрирования, несмотря на наличие полного GraphQL API.

OpenClawRadar
Пользователь Reddit критикует рабочие процессы виртуальных CEO-агентов и выступает за подход, основанный на навыках.
Новости

Пользователь Reddit критикует рабочие процессы виртуальных CEO-агентов и выступает за подход, основанный на навыках.

Пост на Reddit в r/openclaw критикует создание ИИ-агентов с должностями вроде 'бэкенд-разработчик' или 'гросс-хакер' как излишнюю нагрузку, предлагая вместо этого упаковывать способности в виде переиспользуемых навыков, которые можно вызывать по мере необходимости.

OpenClawRadar
Claude Code 2.1.84 добавляет универсальный агентный промпт и инструмент PowerShell, удаляет избыточные промпты.
Новости

Claude Code 2.1.84 добавляет универсальный агентный промпт и инструмент PowerShell, удаляет избыточные промпты.

Claude Code 2.1.84 представляет новый универсальный промпт для под-агента, предназначенный для операций с кодом, а также описание инструмента PowerShell с рекомендациями по избеганию команд sleep. Обновление удаляет девять избыточных промптов и упрощает описания нескольких инструментов.

OpenClawRadar
🦀
Новости

Qwen3 27B превосходит Gemma 4 26B в реальном вызове инструментов для локального AI-видеопаплайна

Эксперимент с локальным AI-видеопайплайном показывает, что Qwen3 27B чисто обрабатывает вызовы инструментов, тогда как Gemma 4 26B застревает в циклах. Также рассматриваются Said Image Turbo для локальной генерации изображений и оркестрация OpenCode с контекстом 174K.

OpenClawRadar