Problèmes techniques et controverses communautaires d'Ollama

✍️ OpenClawRadar📅 Publié: April 18, 2026🔗 Source
Problèmes techniques et controverses communautaires d'Ollama
Ad

Technologie de base d'Ollama et problèmes d'attribution

La capacité d'inférence complète d'Ollama provenait à l'origine de llama.cpp, le moteur d'inférence en C++ créé par Georgi Gerganov en mars 2023. Pendant plus d'un an, le README d'Ollama ne mentionnait pas llama.cpp, et leurs distributions binaires n'incluaient pas l'avis de licence MIT requis pour le code llama.cpp qu'ils distribuaient.

La communauté a ouvert l'issue GitHub #3185 début 2024 demandant la conformité des licences, qui est restée plus de 400 jours sans réponse des mainteneurs. Lorsque l'issue #3697 a été ouverte en avril 2024 demandant spécifiquement la reconnaissance de llama.cpp, le co-fondateur d'Ollama Michael Chiang a finalement ajouté une seule ligne en bas du README : "projet llama.cpp fondé par Georgi Gerganov."

Problèmes techniques avec le backend personnalisé

Mi-2025, Ollama a cessé d'utiliser llama.cpp comme backend d'inférence et a construit une implémentation personnalisée directement sur ggml. Ce backend personnalisé a réintroduit des bugs que llama.cpp avait résolus des années auparavant, notamment :

  • Support de sortie structurée cassé
  • Défaillances des modèles de vision
  • Plantages d'assertion GGML sur plusieurs versions
  • Des modèles qui fonctionnaient parfaitement dans llama.cpp en amont échouaient dans Ollama
  • Manque de support pour les types de tenseurs requis par les nouvelles versions comme GPT-OSS 20B

Georgi Gerganov a identifié qu'Ollama avait forké et apporté de mauvaises modifications à GGML.

Ad

Benchmarks de performance

Plusieurs tests communautaires montrent que llama.cpp fonctionne 1,8 fois plus vite qu'Ollama sur le même matériel avec le même modèle :

  • 161 tokens par seconde contre 89 tokens par seconde
  • Sur CPU, l'écart de performance est de 30 à 50 %
  • Une comparaison récente sur Qwen-3 Coder 32B a montré un débit environ 70 % plus élevé avec llama.cpp

La surcharge de performance provient de la couche démon d'Ollama, de mauvaises heuristiques de déchargement GPU et d'un backend vendu qui suit en retard les versions en amont.

Problèmes de nommage des modèles

Lorsque DeepSeek a publié sa famille de modèles R1 en janvier 2025, Ollama a listé les versions distillées plus petites (modèles comme DeepSeek-R1-Distill-Qwen-32B) sans indiquer clairement qu'il s'agissait de versions distillées plutôt que des modèles complets.

📖 Read the full source: HN LLM Tools

Ad

👀 See Also

Genèse du Livre Open Source : 20 Compétences de Code Claude pour l'Écriture Autonome de Livres
Tools

Genèse du Livre Open Source : 20 Compétences de Code Claude pour l'Écriture Autonome de Livres

Book Genesis est un système open-source composé de 20 compétences Claude Code spécialisées qui, à partir d'une idée de livre, produit un manuscrit complet et prêt à publier via un pipeline autonome en 14 phases. Il inclut un 'Moteur du Chaos' pour briser les schémas de prédictibilité de l'IA et a généré un mémoire de 68 000 mots obtenant un score de 9,0/10 sur l'Échelle Genesis.

OpenClawRadar
agentmemory V4 atteint 96,2 % au benchmark LongMemEval, surpassant les systèmes de mémoire d'IA commerciaux.
Tools

agentmemory V4 atteint 96,2 % au benchmark LongMemEval, surpassant les systèmes de mémoire d'IA commerciaux.

agentmemory V4 a obtenu un score de 96,2 % sur LongMemEval, surpassant plusieurs entreprises d'IA à mémoire financées, notamment PwC Chronos (95,6 %), Mastra (94,87 %) et OMEGA (93,2 %). Le système a été développé seul en 16 jours sur un PC gaming milieu de gamme avec un budget de 1 000 $.

OpenClawRadar
SDK Claude Code rétro-ingéniéré publié en quatre langues
Tools

SDK Claude Code rétro-ingéniéré publié en quatre langues

Un développeur a rétro-conçu Claude Code et créé des SDKs en un seul fichier pour Node.js, Python, Go et Rust sans aucune dépendance. Ces outils offrent une boucle d'agent complète avec streaming et utilisation d'outils tout en utilisant les abonnements Claude Pro/Max existants.

OpenClawRadar
GitVelocity : L'IA évalue 50 000 PR et révèle des informations sur la complexité du code
Tools

GitVelocity : L'IA évalue 50 000 PR et révèle des informations sur la complexité du code

GitVelocity utilise Claude pour évaluer les pull requests fusionnées sur une échelle de 0 à 100 selon six dimensions : portée, architecture, implémentation, risque, qualité et performance/sécurité. Après avoir analysé plus de 50 000 PR dans les langages TypeScript, Python, Rust, Go, Java et Elixir, l'équipe a découvert des tendances surprenantes concernant la taille des PR, la couverture des tests et l'adoption de l'IA.

OpenClawRadar