Inferência de IA é Claramente Lucrativa: Detalhando a Economia

Sean Goedecke argumenta que a inferência de IA é obviamente lucrativa, ao contrário de alegações de que é subsidiada por capital de risco. Ele detalha a matemática e os preços de modelos abertos para mostrar que servir LLMs pode ser um negócio sustentável.
Detalhamento de Custos para um Modelo Denso de 70B
Usando quatro GPUs Nvidia A100 (400W cada, ~2M tokens/hora):
- Energia: ~13¢/hora a tarifas industriais, mais ~13¢/hora para refrigeração → 26¢/hora no total
- Amortização da GPU: $20k por A100 em 5 anos → $16k/ano ou $1,80/hora
- Total: aproximadamente $1 por milhão de tokens de saída
O GPT-5.4-mini da OpenAI cobra $4,50 por milhão de tokens, e modelos mais potentes são 3 a 6 vezes mais caros. Isso torna a margem bruta reivindicada de 70-80% plausível.
Modelos Abertos Confirmam Lucratividade
A DeepSeek afirma ter margem superior a 80% na inferência do R1 enquanto cobra menos da metade do que OpenAI/Anthropic. A API DeepSeek-V4-Pro custa cerca de 87 centavos por milhão de tokens de saída—próximo ao custo real, sugerindo que as margens para modelos de ponta são ainda maiores.
Por Que Existem Margens Altas
Laboratórios de IA como OpenAI e Anthropic precisam dos lucros da inferência para subsidiar os custos de treinamento, por isso mantêm os preços das APIs altos. Mas um provedor exclusivo de inferência, sem custos de treinamento, poderia lucrar mesmo com preços mais baixos. Mesmo que os laboratórios de ponta fechem, quem adquirir os direitos de seus modelos pode continuar vendendo inferência de forma lucrativa.
📖 Leia a fonte original: HN AI Agents
👀 See Also

Claude Opus 4.7: Alterações no Prompt do Sistema: Renomeação da Plataforma, Integração de Ferramentas e Atualizações Comportamentais
A Anthropic atualizou o prompt do sistema Claude Opus da versão 4.6 (5 de fevereiro de 2026) para a 4.7 (16 de abril de 2026), renomeando a 'plataforma de desenvolvedor' para 'Plataforma Claude', adicionando o Claude no Powerpoint à lista de ferramentas, expandindo as instruções de segurança infantil e implementando novas diretrizes comportamentais para uso de ferramentas e concisão nas respostas.

Mudanças Frequentes de Quebra no OpenClaw: Procedimentos de Atualização e Problemas Atuais
A OpenClaw lançou 13 versões pontuais apenas em março de 2026, com mudanças disruptivas ocorrendo a cada 2-3 semanas. A fonte fornece procedimentos específicos de atualização e detalha problemas atuais na versão 3.28, incluindo alterações na autenticação localhost e bugs de regressão.

Autoencoders de Linguagem Natural da Anthropic Transformam as Ativações de Claude em Inglês Legível — Veja Como
A Anthropic lançou os Autoencoders de Linguagem Natural (NLAs) que convertem as ativações internas do Claude em explicações em texto simples, revelando o raciocínio do modelo sobre rimas, consciência de testes de segurança e detecção de trapaça.
Deloitte admite que IA escreveu partes de relatório para o conselho de Wellington — mas mantém conclusões
O prefeito de Wellington diz que 'grandes partes' de um relatório da Deloitte de US$ 435.000 foram escritas por IA. O relatório afirmava haver 330 funcionários excedentes, mas erros de dados revelam suposições falhas.