Fundadores da Codestrap criticam métricas de codificação por IA e alertam sobre problemas de qualidade

Dorian Smiley e Connor Deeks, fundadores do serviço de consultoria em IA Codestrap, argumentam que as organizações empresariais estão lutando para implementar a IA de forma eficaz porque não há um manual estabelecido para arquiteturas de referência ou casos de uso. Eles afirmam que muitas empresas fingem ter estratégias de IA enquanto carecem de ciclos de feedback adequados para medir o impacto real.
Métricas problemáticas e resultados falhos
Smiley afirma que a avaliação atual da IA na programação se concentra nas métricas erradas: "Linhas de código, número de [pull requests], são passivos. Não são medidas de excelência em engenharia." Ele identifica as métricas adequadas de engenharia como frequência de implantação, tempo de espera para produção, taxa de falha de alteração, tempo médio de restauração e gravidade de incidentes.
Para ilustrar as consequências da má medição, Smiley cita uma tentativa recente de reescrever o SQLite em Rust usando IA: "Passou em todos os testes unitários, a estrutura do código parece correta. São 3,7 vezes mais linhas de código que performam 2.000 vezes pior do que o SQLite real. Duas mil vezes pior para um banco de dados é um produto inviável."
Limitações fundamentais dos LLMs
Deeks aponta problemas fundamentais com a tecnologia atual de LLMs: "É difícil ensinar novos fatos a eles. É difícil recuperar fatos de forma confiável. A passagem direta pelas redes neurais é não determinística, especialmente quando você tem modelos de raciocínio que envolvem um monólogo interno para aumentar a eficiência da previsão do próximo token, o que significa que você obterá uma resposta diferente a cada vez."
Smiley acrescenta: "E eles não têm capacidades de raciocínio indutivo. Um modelo não pode verificar seu próprio trabalho. Ele não sabe se a resposta que deu está correta. Esses são problemas fundamentais que ninguém resolveu na tecnologia de LLMs."
Nova abordagem de medição proposta
Os fundadores defendem o desenvolvimento de novas métricas especificamente para engenharia assistida por IA. Smiley sugere uma métrica potencial: "medir tokens consumidos para chegar a um pull request aprovado – uma mudança formalmente aceita no software." Ele enfatiza que as organizações precisam experimentar e iterar em ciclos de feedback porque "a IA ainda não funciona muito bem" mesmo dentro de contextos de programação.
Deeks faz referência a recentes interrupções da Amazon e AWS como indicadores de possíveis problemas futuros, embora a Amazon tenha afirmado que esses incidentes não estavam relacionados à IA.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Usuários do OpenClaw Relatam Substituições de Modelos Após Proibição da Anthropic
Uma pesquisa comunitária do Reddit, X, YouTube e GitHub revela o GPT-5.x como o substituto mais adotado para o Claude nos fluxos de trabalho do OpenClaw, com o Kimi K2.5 liderando as votações da comunidade e as configurações híbridas ganhando popularidade.

IA é muito cara: Hiperescaladores precisam de US$ 3 trilhões para atingir o ponto de equilíbrio
Os hyperscalers investiram mais de US$ 800 bilhões em Capex de IA, com mais US$ 1 trilhão planejados para 2027. Só a Microsoft gastou ~US$ 100 bilhões na infraestrutura da OpenAI, mas a receita de IA cobre apenas ~20% do seu Capex.

Benchmarking dos Modelos de IA Mais Recentes: A Ascensão dos Modelos Extremos
Uma análise detalhada de 40 novos modelos de IA revela um mercado dividido, com 'Modo Deus' e 'Modo Flash' liderando o caminho. Modelos de faixa intermediária agora são considerados obsoletos.

Acordo da CBP com a Clearview AI: Reconhecimento Facial para Direcionamento Tático
A Alfândega e Proteção de Fronteiras dos EUA contratou a Clearview AI para direcionamento tático, usando tecnologia de reconhecimento facial em bilhões de imagens extraídas da internet.