AI-инференс явно прибылен: разбираем экономику

Шон Гёдекс утверждает, что AI-инференс явно прибылен, вопреки заявлениям о том, что он субсидируется венчурными инвестициями. Он разбирает математику и ценообразование открытых моделей, показывая, что обслуживание LLM может быть устойчивым бизнесом.
Разбор затрат для плотной модели на 70B
Используя четыре Nvidia A100 (400W каждая, ~2 млн токенов/час):
- Электроэнергия: ~13¢/час по промышленным тарифам, плюс ~13¢/час на охлаждение → итого 26¢/час
- Амортизация GPU: $20k за A100 за 5 лет → $16k/год или $1,80/час
- Итого: примерно $1 за миллион выходных токенов
OpenAI GPT-5.4-mini взимает $4,50 за миллион токенов, а более мощные модели — в 3-6 раз дороже. Это делает заявленную валовую маржу в 70-80% правдоподобной.
Открытые модели подтверждают прибыльность
DeepSeek заявляет о марже более 80% на инференсе R1, взимая менее половины от цен OpenAI/Anthropic. Их API DeepSeek-V4-Pro стоит около 87¢ за миллион выходных токенов — близко к фактической стоимости, что предполагает еще более высокую маржу для фронтирных моделей.
Почему существуют высокие маржи
AI-лабораториям, таким как OpenAI и Anthropic, нужна прибыль от инференса для субсидирования затрат на обучение, поэтому они держат высокие цены на API. Но провайдер, занимающийся только инференсом и не несущий затрат на обучение, может получать прибыль даже при более низких ценах. Даже если фронтирные лаборатории разорятся, тот, кто приобретет права на их модели, сможет продолжать прибыльно продавать инференс.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

AWS Bedrock тихо убивает квоту Claude Opus 4.7: Предупреждение для производственных AI-процессов
Пользователь HN сообщает, что AWS Bedrock установил квоту на Claude Opus 4.7 на уровне 0 без предупреждения. AWS поддержка подтвердила, что это было обновление системы, и не может гарантировать восстановление. Пользователям рекомендуется перейти на Opus 4.6 или сменить провайдера.

Отчет Anthropic об интенсивности внедрения искусственного интеллекта в мире
Последние данные Anthropic показывают неравномерное внедрение ИИ в мире, измеряя интенсивность использования, а не общее количество пользователей. Отчёт демонстрирует, где ИИ интегрирован в рабочие процессы, такие как программирование, исследования и принятие решений, как среди частных лиц, так и в бизнесе.

Исследование показывает, что сбои агента Claude Opus были вызваны архитектурными, а не проблемами согласованности.
Исследование поместило Claude Opus и Kimi K2.5 в реальную среду с доступом к электронной почте, оболочке и постоянному хранилищу. Модели продемонстрировали правильные ценности, но столкнулись с серьёзными сбоями из-за отсутствия архитектурных защитных механизмов, таких как модели заинтересованных сторон и границы выполнения.

OpenAI разрабатывает альтернативу GitHub, сообщает Reuters.
Reuters сообщает, что OpenAI разрабатывает альтернативу GitHub от Microsoft, при этом история набрала 35 баллов и 12 комментариев на Hacker News.