Roteie o Claude Code pelo Ollama e Corte Sua Conta em ~90%

Este repositório, criado por Coherence Daddy, fornece uma configuração completa para rotear sessões do terminal do Claude Code através de uma instância local do Ollama, mantendo o Claude Desktop no plano Pro pago da Anthropic. O resultado: uma redução alegada de ~90% nos custos da API do Claude Code.
Como Funciona
Você executa dois mecanismos lado a lado:
- Claude Desktop (Anthropic) – usado para estratégia, arquitetura, revisão de código e bugs complexos.
- Claude Code → Ollama – usado para lints, refatorações, edições repetitivas, operações em lote de arquivos e tarefas de grep-and-replace. Roda em um modelo gratuito de código aberto (Gemma, Qwen, DeepSeek, à sua escolha).
Processo de Configuração
O repositório inclui uma apresentação HTML autossuficiente (21 slides) com um prompt copiável que faz ~98% da configuração automaticamente. Ele detecta automaticamente seu sistema operacional (macOS, Windows + WSL2, Linux), instala tudo, configura o roteador e verifica ambos os mecanismos ao final.
Para executar localmente:
git clone https://github.com/Coherence-Daddy/use-ollama-to-enhance-claude.git
cd use-ollama-to-enhance-claude/presentation
open index.html # macOS, ou arraste para o navegadorOu use diretamente o prompt copiável de prompts/copy-paste-prompt.md.
Estrutura do Repositório
prompts/copy-paste-prompt.md– o prompt de configuração.presentation/index.html– apresentação visual completa (sem necessidade de build).- Também hospedado em coherencedaddy.com/tutorials/use-ollama-to-enhance-claude.
Por Que Isso Existe
O Claude Pro no desktop é ótimo para pensar e arquitetar, mas o Claude Code no terminal consome rapidamente a cota em tarefas com muito contexto. Roteando essas tarefas através do Ollama (modelos gratuitos locais ou hospedados na nuvem) mantém a mesma experiência do usuário, mas por uma fração do custo.
Licença
MIT – livre para usar, bifurcar ou remixar.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Construindo um Rig de Dados Financeiros Locais + IA Pessoal no Mac Studio
Um desenvolvedor relata sua jornada na construção de um sistema totalmente localizado de processamento de dados financeiros e assistente pessoal de IA em um Mac Studio, incluindo decisões de arquitetura, distribuição de memória, orquestração de cron e primeiras otimizações.

12 Dicas de Usuário Avançado do OpenClaw para Fluxos de Trabalho Eficientes de Agentes de IA
Uma postagem no Reddit descreve estratégias práticas para otimizar o uso do OpenClaw, incluindo dividir conversas em tópicos específicos, usar memos de voz para entrada, combinar modelos com tarefas, delegar trabalho para subagentes e implementar camadas de segurança.

Como Pequenos Modelos de Avaliação de Prompts Podem Enganar e Como Corrigi-los
Uma postagem no Reddit explica que prompts de avaliação para modelos pequenos frequentemente produzem resultados enganosos devido à ativação de vias cognitivas incorretas nos transformadores, especificamente identificando três modos distintos: recuperação factual, aplicação/seguimento de instruções e inferência emocional/empática.

Análise de Custo do Agente OpenClaw: De US$ 340 para US$ 112 Mensais com Cinco Otimizações
Um desenvolvedor monitorou 18.000 chamadas de API em quatro agentes OpenClaw durante 30 dias, descobrindo que 70% das tarefas não precisavam do GPT-4.1. Implementando cache de prompts, encurtando prompts do sistema, agrupando análises, trocando para modelos mais baratos e adicionando limites máximos de tokens, os custos caíram de US$ 340 para US$ 112 mensais.