Problemas Técnicos e Controvérsia na Comunidade do Ollama

Tecnologia Central e Problemas de Atribuição do Ollama
Toda a capacidade de inferência do Ollama originalmente veio do llama.cpp, o mecanismo de inferência em C++ criado por Georgi Gerganov em março de 2023. Por mais de um ano, o README do Ollama não mencionava o llama.cpp, e suas distribuições binárias não incluíam o aviso de licença MIT obrigatório para o código do llama.cpp que estavam distribuindo.
A comunidade abriu a issue #3185 no GitHub no início de 2024 solicitando conformidade com a licença, que passou mais de 400 dias sem resposta dos mantenedores. Quando a issue #3697 foi aberta em abril de 2024 especificamente solicitando o reconhecimento do llama.cpp, o cofundador do Ollama, Michael Chiang, eventualmente adicionou uma única linha no final do README: "projeto llama.cpp fundado por Georgi Gerganov."
Problemas Técnicos com o Backend Personalizado
Em meados de 2025, o Ollama deixou de usar o llama.cpp como seu backend de inferência e construiu uma implementação personalizada diretamente sobre o ggml. Este backend personalizado reintroduziu bugs que o llama.cpp havia resolvido anos antes, incluindo:
- Suporte a saída estruturada quebrado
- Falhas em modelos de visão
- Falhas de asserção GGML em várias versões
- Modelos que funcionavam bem no llama.cpp original falhavam no Ollama
- Falta de suporte para tipos de tensor exigidos por novos lançamentos como o GPT-OSS 20B
Georgi Gerganov identificou que o Ollama havia feito um fork e implementado alterações problemáticas no GGML.
Benchmarks de Desempenho
Vários testes da comunidade mostram o llama.cpp executando 1,8x mais rápido que o Ollama no mesmo hardware com o mesmo modelo:
- 161 tokens por segundo versus 89 tokens por segundo
- Em CPU, a diferença de desempenho é de 30-50%
- Uma comparação recente com o Qwen-3 Coder 32B mostrou ~70% maior throughput com o llama.cpp
A sobrecarga de desempenho vem da camada de daemon do Ollama, heurísticas ruins de descarga para GPU e um backend personalizado que fica atrás do original.
Problemas com Nomenclatura de Modelos
Quando a DeepSeek lançou sua família de modelos R1 em janeiro de 2025, o Ollama listou as versões destiladas menores (modelos como DeepSeek-R1-Distill-Qwen-32B) sem indicar claramente que eram destilados em vez dos modelos completos.
📖 Leia a fonte completa: HN LLM Tools
👀 See Also

Relay: Plano de Controle de Código Aberto para Agentes de IA OpenClaw
Relay é um aplicativo de desktop Electron que fornece um fluxo de trabalho semelhante ao Claude Cowork para OpenClaw, executando em sua infraestrutura com sua escolha de modelos LLM e recursos de governança integrados, incluindo portões de aprovação e trilhas de auditoria exportáveis.

Lat.md: Um Gráfico de Conhecimento Baseado em Markdown para Bases de Código
O Lat.md cria um grafo de conhecimento para bases de código usando arquivos markdown interconectados em um diretório lat.md/. Ele resolve problemas de escalabilidade com documentação monolítica ao vincular seções com [[links wiki]], conectar-se ao código-fonte por meio de comentários como // @lat: [[section-id]] e fornecer ferramentas CLI para validação e busca.

Prompt-Mini: Plugin do Claude Code Intercepta Prompts Vagos para Reduzir o Desperdício de Créditos
Prompt-mini é um plugin do Claude Code que intercepta prompts vagos antes da execução, faz perguntas de esclarecimento e constrói prompts estruturados com detecção de stack e regras específicas para mais de 40 frameworks. A ferramenta aborda 35 padrões que desperdiçam créditos, como escopo ausente, condições de parada e caminhos de arquivo.

LumaBrowser: Navegador Electron Descarrega a Análise DOM para LLMs Locais para Agentes de IA
LumaBrowser é um navegador Electron que transfere a análise do DOM para LLMs locais por meio de endpoints compatíveis com OpenAI, ajudando agentes autônomos a evitar o processamento de HTML bruto. Ele usa modelos como variantes do Qwen 2.5 para identificar elementos da interface do usuário e retorna seletores CSS.