Problèmes techniques et controverses communautaires d'Ollama

Technologie de base d'Ollama et problèmes d'attribution
La capacité d'inférence complète d'Ollama provenait à l'origine de llama.cpp, le moteur d'inférence en C++ créé par Georgi Gerganov en mars 2023. Pendant plus d'un an, le README d'Ollama ne mentionnait pas llama.cpp, et leurs distributions binaires n'incluaient pas l'avis de licence MIT requis pour le code llama.cpp qu'ils distribuaient.
La communauté a ouvert l'issue GitHub #3185 début 2024 demandant la conformité des licences, qui est restée plus de 400 jours sans réponse des mainteneurs. Lorsque l'issue #3697 a été ouverte en avril 2024 demandant spécifiquement la reconnaissance de llama.cpp, le co-fondateur d'Ollama Michael Chiang a finalement ajouté une seule ligne en bas du README : "projet llama.cpp fondé par Georgi Gerganov."
Problèmes techniques avec le backend personnalisé
Mi-2025, Ollama a cessé d'utiliser llama.cpp comme backend d'inférence et a construit une implémentation personnalisée directement sur ggml. Ce backend personnalisé a réintroduit des bugs que llama.cpp avait résolus des années auparavant, notamment :
- Support de sortie structurée cassé
- Défaillances des modèles de vision
- Plantages d'assertion GGML sur plusieurs versions
- Des modèles qui fonctionnaient parfaitement dans llama.cpp en amont échouaient dans Ollama
- Manque de support pour les types de tenseurs requis par les nouvelles versions comme GPT-OSS 20B
Georgi Gerganov a identifié qu'Ollama avait forké et apporté de mauvaises modifications à GGML.
Benchmarks de performance
Plusieurs tests communautaires montrent que llama.cpp fonctionne 1,8 fois plus vite qu'Ollama sur le même matériel avec le même modèle :
- 161 tokens par seconde contre 89 tokens par seconde
- Sur CPU, l'écart de performance est de 30 à 50 %
- Une comparaison récente sur Qwen-3 Coder 32B a montré un débit environ 70 % plus élevé avec llama.cpp
La surcharge de performance provient de la couche démon d'Ollama, de mauvaises heuristiques de déchargement GPU et d'un backend vendu qui suit en retard les versions en amont.
Problèmes de nommage des modèles
Lorsque DeepSeek a publié sa famille de modèles R1 en janvier 2025, Ollama a listé les versions distillées plus petites (modèles comme DeepSeek-R1-Distill-Qwen-32B) sans indiquer clairement qu'il s'agissait de versions distillées plutôt que des modèles complets.
📖 Read the full source: HN LLM Tools
👀 See Also

Distillerie : Un Plugin Claude Code pour un Contexte d'Équipe Persistant
Distillery est un plugin pour Claude Code qui fournit aux équipes un contexte partagé et persistant entre les sessions et les personnes. La version 0.2.0 ajoute la recherche hybride, l'audit de connexion et la prise en charge de uv.

PromoClock : Suiveur de fuseaux horaires pour les heures creuses 2x de Claude, développé avec Claude 4.6
Un développeur a créé PromoClock.co, un outil gratuit qui convertit automatiquement les heures promotionnelles hors pointe de Claude « 5-11h PT / 12-18h GMT » en heure locale, utilisant Claude 4.6 pour la logique des fuseaux horaires, une configuration Next.js 15 et la conception de l'interface utilisateur.

SkillMesh : Routeur compatible MCP pour les grands catalogues d'outils réduit la taille du contexte de 70 %
SkillMesh est un routeur compatible MCP qui récupère uniquement les cartes d'expert pertinentes pour les requêtes des agents IA, réduisant la taille du contexte de 70 % et améliorant la sélection d'outils. Il prend en charge Claude via un serveur MCP, des bundles de compétences Codex et des schémas de fonction de style OpenAI.

Les tests de référence MemAware évaluent la mémoire de l'IA au-delà de la simple recherche par mots-clés.
MemAware est un benchmark avec 900 questions réparties sur 3 niveaux de difficulté qui teste si les assistants IA dotés de mémoire peuvent faire remonter un contexte pertinent lorsque les requêtes ne le suggèrent pas. Les résultats montrent que la recherche BM25 a obtenu 2,8 % contre 0,8 % sans mémoire, tandis que la recherche vectorielle chute à 0,7 % sur les connexions inter-domaines.