Inferência de IA é Claramente Lucrativa: Detalhando a Economia

Sean Goedecke argumenta que a inferência de IA é obviamente lucrativa, ao contrário de alegações de que é subsidiada por capital de risco. Ele detalha a matemática e os preços de modelos abertos para mostrar que servir LLMs pode ser um negócio sustentável.
Detalhamento de Custos para um Modelo Denso de 70B
Usando quatro GPUs Nvidia A100 (400W cada, ~2M tokens/hora):
- Energia: ~13¢/hora a tarifas industriais, mais ~13¢/hora para refrigeração → 26¢/hora no total
- Amortização da GPU: $20k por A100 em 5 anos → $16k/ano ou $1,80/hora
- Total: aproximadamente $1 por milhão de tokens de saída
O GPT-5.4-mini da OpenAI cobra $4,50 por milhão de tokens, e modelos mais potentes são 3 a 6 vezes mais caros. Isso torna a margem bruta reivindicada de 70-80% plausível.
Modelos Abertos Confirmam Lucratividade
A DeepSeek afirma ter margem superior a 80% na inferência do R1 enquanto cobra menos da metade do que OpenAI/Anthropic. A API DeepSeek-V4-Pro custa cerca de 87 centavos por milhão de tokens de saída—próximo ao custo real, sugerindo que as margens para modelos de ponta são ainda maiores.
Por Que Existem Margens Altas
Laboratórios de IA como OpenAI e Anthropic precisam dos lucros da inferência para subsidiar os custos de treinamento, por isso mantêm os preços das APIs altos. Mas um provedor exclusivo de inferência, sem custos de treinamento, poderia lucrar mesmo com preços mais baixos. Mesmo que os laboratórios de ponta fechem, quem adquirir os direitos de seus modelos pode continuar vendendo inferência de forma lucrativa.
📖 Leia a fonte original: HN AI Agents
👀 See Also

Anthropic usa o Google Forms para feedback do Claude
Anthropic, a empresa por trás do Claude, usa um Google Forms de 2008 para coletar feedback de design em vez de criar uma ferramenta personalizada—destacando uma filosofia pragmática de construir vs. comprar.

OpenClaw 2026.3.28: Alterações Incompatíveis para Usuários do MiniMax, Reparo Automático de Configuração Removido
OpenClaw 2026.3.28 remove o reparo automático para chaves de configuração obsoletas e elimina vários modelos MiniMax. Os usuários devem atualizar as configurações antes de atualizar para evitar falhas na inicialização do gateway.

Domo CDO: Pare o FOMO de IA, Comece com Planilhas
O diretor de design da Domo, Chris Willis, argumenta que a IA está sendo vendida sem especificações, criando um teatro de 'tokenmaxxing' baseado no medo. Sua solução: comece automatizando um processo de planilha, não perseguindo metas mirabolantes.

Claude Code v2.1.68: Opus 4.6 define esforço médio como padrão e reintroduz a palavra-chave ultrathink
A versão 2.1.68 do Claude Code altera o nível de esforço padrão do Opus 4.6 para médio para assinantes Max e Team, reintroduz a palavra-chave 'ultrathink' para alto esforço e remove os modelos mais antigos Opus 4 e 4.1 da API oficial.