LamBench: Um Conjunto de Benchmarks de Cálculo Lambda para Agentes de Codificação de IA

Victor Taelin lançou o LamBench v1, um framework de benchmark projetado para testar agentes de codificação de IA em problemas de cálculo lambda. O projeto está hospedado no GitHub em github.com/VictorTaelin/LamBench e inclui um site ao vivo em victortaelin.github.io/lambench/.
Detalhes Principais
- Métricas: O benchmark mede três eixos:
:intelligence,:speede:elegance. - Componentes: Um conjunto de
:problemse uma:matrixpara pontuação dos resultados. - Versão: v1 (lançamento inicial).
LamBench faz parte de um esforço mais amplo de Taelin para criar avaliações rigorosas para sistemas de IA em computação simbólica. Para contexto, cálculo lambda é um sistema formal em lógica matemática e computação, frequentemente usado para testar raciocínio e capacidades de programação funcional — tornando este benchmark particularmente relevante para agentes de codificação de IA que precisam lidar com manipulação simbólica, recursão e funções de ordem superior.
Para Quem É
Pesquisadores e desenvolvedores de IA que estão construindo ou avaliando agentes de codificação, especialmente aqueles que trabalham com programação funcional ou tarefas de raciocínio simbólico.
📖 Leia a fonte original: HN AI Agents
👀 See Also

Calmkeep: Uma Camada de Continuidade Externa para Combater a Deriva de LLM em Sessões Estendidas
Calmkeep é uma camada de continuidade externa projetada para neutralizar a deriva de LLMs em sessões prolongadas, apresentando 85% de integridade contra 60% do Claude padrão em um teste de construção de backend de 25 turnos e 100% contra 50% em uma sessão jurídica.

Extensão do Visual Studio 2022 Adiciona Integração Nativa do Ollama para LLMs Locais
Uma extensão gratuita para o Visual Studio 2022 conecta-se diretamente a endpoints locais do Ollama, permitindo assistência de IA privada para programação sem alternar entre ferramentas. Suporta modelos como DeepSeek e Llama 3 com opções de fallback na nuvem.

rawq: Ferramenta CLI Local para Busca Semântica de Código por Agentes de IA
rawq é uma ferramenta CLI de código aberto que ajuda agentes de IA a encontrar código relevante usando busca semântica com um modelo local de 33MB via ONNX runtime e busca lexical BM25 via tantivy. Em testes, agentes de IA usando rawq consumiram 4 vezes menos tokens e completaram tarefas 2 vezes mais rápido em comparação com ferramentas cegas de leitura/grep.

Claude Code Hook Monitora o Acúmulo de WIP em Fluxos de Trabalho de Codificação com IA
Um desenvolvedor criou um hook UserPromptSubmit para o Claude Code que revela o acúmulo de trabalho em andamento em quatro filas: alterações não commitadas com mais de 200 linhas, três ou mais commits não enviados, commits enviados sem arquivos de changeset e PRs de release abertos por mais de 24 horas.