Código de reimplementação do Claude de código aberto corrigido para compatibilidade com modelos locais

O que foi corrigido
Um desenvolvedor corrigiu a reimplementação de código aberto do Claude Code para resolver problemas de compatibilidade com modelos locais. O fork original não conseguia executar com modelos locais devido às dependências embutidas do cliente da Anthropic.
Principais alterações
- A CLI agora detecta automaticamente o provedor a partir do nome do modelo e das variáveis de ambiente
- Suporta Ollama, LM Studio, OpenAI, xAI ou qualquer endpoint compatível com OpenAI
- Corrigiu vários bugs de renderização que apareciam no PowerShell
- Adicionou funcionalidade para PowerShell
- Testado no Windows 11 com Ollama no Docker
- Deve funcionar no Linux/macOS também (a compilação Rust é multiplataforma, embora alguns testes usem APIs exclusivas do Unix)
Detalhes técnicos
A correção remove a dependência rígida do cliente de API da Anthropic, tornando a ferramenta flexível o suficiente para funcionar com vários provedores de modelos locais. O sistema de detecção automática examina os nomes dos modelos e as variáveis de ambiente para determinar qual interface de provedor usar.
Esse tipo de modificação é particularmente útil para desenvolvedores que desejam experimentar capacidades de geração de código semelhantes ao Claude usando seu próprio hardware e provedores de modelos preferidos, em vez de ficarem presos a um serviço de nuvem específico.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Benchmark Flash-MOE no M5 Max: 12.99 tok/s com Qwen3.5-397B
Um benchmark do modelo Qwen3.5 de 397 bilhões de parâmetros executado localmente em um MacBook Pro M5 Max com 128GB de RAM alcançou 12,99 tokens por segundo usando quantização de 4 bits e cache-io-split 4, três vezes mais rápido que o benchmark original de 48GB.

A Queda Silenciosa de Claude: A Falha da Camada de Ação Quando Agentes de IA Alcançam Sites de Negócios
Claude consegue ler sites de negócios (preços, fluxos de reserva, formulários), mas falha na camada de ação — reservar, enviar ou rotear — devido à falta de endpoints acionáveis. Isso causa uma desistência invisível do usuário, sem nenhum sinal de análise.

RTX 5060 Ti 16GB: Benchmarks de LLM Local - Modelos de 30B ainda lideram em programação
Benchmarks em uma RTX 5060 Ti 16GB mostram o Unsloth Qwen3-Coder-30B UD-Q3_K_XL atingindo 76,3 tok/s no Ubuntu com pontuação de qualidade 8,14, tornando-o o modelo de codificação padrão recomendado. O Unsloth Qwen3.5-35B UD-Q2_K_XL atinge 80,1 tok/s, mas com pontuações de qualidade mais baixas.

SourceBridge: Ferramenta de código aberto para análise de base de código usando LLMs locais
SourceBridge é uma ferramenta de código aberto que indexa repositórios Git em grafos de símbolos e usa LLMs locais para gerar resumos de bases de código, passeios arquiteturais e materiais de aprendizado. Ele suporta vários backends locais, incluindo Ollama, llama.cpp, vLLM, LM Studio e SGLang via APIs compatíveis com OpenAI.