ATLAS: Pipeline de Computação em Tempo de Teste de Código Aberto para Qwen3-14B Alcança Desempenho de Codificação de Nível de Fronteira

O ATLAS é um pipeline de computação em tempo de teste de código aberto construído em torno do Qwen3-14B que alcança desempenho de codificação comparável a modelos de ponta a um custo significativamente menor. O projeto foi desenvolvido por um estudante de gestão empresarial da Virginia Tech que aprendeu a programar enquanto o construía.
Evolução do Desenvolvimento
O desenvolvedor passou de dois a três meses pesquisando centenas de artigos para conectar pesquisas existentes que ainda não haviam sido combinadas. O sistema evoluiu através de três versões principais:
- V1: Infraestrutura básica, descrita como "MUITO rudimentar (essencialmente apenas RAG)"
- V2: Aplicou verificação baseada em energia inspirada no artigo da Anthropic "When Models Manipulate Manifolds", resultando em um verificador decente
- V3: Dobrou o desempenho em relação à linha de base da V1 após extensa pesquisa, incluindo a exploração do Problema da Parada
Benchmarks de Desempenho
Resultados em 599 problemas do LiveCodeBench v5:
- DeepSeek V3.2 Reasoning: 86,2% pass@1, ~US$ 0,002 por tarefa (API)
- GPT-5 (alta): 84,6% pass@1, ~US$ 0,043 por tarefa (API)
- ATLAS V3: 74,6% pass@1, ~US$ 0,004 por tarefa (eletricidade)
- Claude 4.5 Sonnet: 71,4% pass@1, ~US$ 0,066 por tarefa (API)
Detalhes Técnicos e Limitações
O sistema é "lento pra caramba" de acordo com o desenvolvedor. Tarefas fáceis levam segundos, mas problemas de codificação complexos podem levar até uma hora. A V3.1 está migrando para o Qwen 3.5 9B para melhorar a velocidade e a paralelização.
O ATLAS inclui infraestrutura completa de MaaS (Model-as-a-Service) que permite conectar OpenCode ou Claude Code via API. O desenvolvedor recomenda pelo menos 16GB de VRAM, alertando que com menos memória será "ainda mais lento do que mencionei".
Configuração e Reprodutibilidade
O projeto é totalmente de código aberto sem planos de comercialização. O repositório está disponível em https://github.com/itigges22/ATLAS. O desenvolvedor observa que a reprodutibilidade precisa de trabalho, mas sugere que "se você pedir ao Claude Code para otimizá-lo para sua configuração, deve funcionar bem".
📖 Read the full source: r/LocalLLaMA
👀 See Also

Monitor de Segurança de Runtime InsAIts para Claude Code Atinge 8.000 Downloads no PyPI
O InsAIts, um monitor de segurança em tempo de execução para sessões agentes do Claude Code, atingiu 8.140 downloads totais no PyPI. A versão 3.4.0 adiciona um Gerenciador de Contexto Adaptativo, sistema de injeção de âncoras em camadas e melhorias no painel.

Universal CLAUDE.md reduz os tokens de saída do Claude em 63% em benchmarks
Um desenvolvedor criou um arquivo universal CLAUDE.md que reduz a saída de tokens do Claude em 63% em cinco testes de referência, mantendo a precisão técnica. O arquivo aborda comportamentos comuns do Claude, como respostas verbosas, formatação desnecessária e sugestões não solicitadas.

Configurando o OpenClaw como um Assistente de IA Sempre Ativo
O OpenClaw é configurado como um assistente de IA sempre ativo para uma pequena equipe de desenvolvimento. Ele está hospedado em um servidor Railway, garantindo acessibilidade constante além das máquinas locais individuais. O backend de Modelo de Linguagem Grande (LLM) utilizado é o Opus 4.5 do Claude. A interação ocorre principalmente através do WhatsApp via o gateway integrado.

MCP gratuito permite que Claude analise automaticamente dados do Google Search Console
Um servidor MCP (Model Context Protocol) gratuito permite que o Claude consulte diretamente os dados do Google Search Console para qualquer site ao qual você tenha acesso. Faça perguntas sobre consultas, páginas, cliques, impressões, CTR e posição sem exportar CSVs manualmente.