Test de δ-Mem sur Apple Silicon : Implémentation MLX et Benchmarks

✍️ OpenClawRadar📅 Publié: May 16, 2026🔗 Source
Test de δ-Mem sur Apple Silicon : Implémentation MLX et Benchmarks
Ad

Un utilisateur de Reddit a implémenté l'article de recherche δ-mem (arXiv 2605.12357) pour Apple Silicon en utilisant mlx et l'intégration OpenClaw. L'article améliore la direction de l'attention du modèle sans contexte ni LoRA, rapportant 20 % de meilleures réponses dans leurs tests. L'implémentation a utilisé Qwen3-4B-Instruct via mlx et des adaptateurs personnalisés.

Résultats des benchmarks (tests mlx normalisés, Qwen3-4B-Instruct sur MacMini 64 Go) :

  • Synthétique style article : Plain 0,5129, δ-mem 0,5129 (1,00x)
  • LoCoMo-10 mini : Plain 0,0500, δ-mem 0,1833 (3,67x)
  • Replay OpenClaw : Plain 0,5701, δ-mem 0,6667 (1,17x)

Coûts en latence (vs plain) :

  • Synthétique : 1,013x
  • LoCoMo-10 mini : 1,33x requête / 1,50x total
  • Replay OpenClaw : 1,30x

Liens clés :

Points clés :

Ad
  • Les sondes synthétiques étaient plates (1,00x), mais LoCoMo-mini a montré de forts gains relatifs (3,67x).
  • Le replay de style OpenClaw a montré une amélioration pratiquement significative (6/8 → 7/8 sondes réussies, 1,17x).
  • L'utilisateur note qu'Apple Silicon ne peut pas exécuter CUDA efficacement, donc les résultats sont inférieurs aux benchmarks de l'article. Les benchmarks de l'article (Qwen3-4B-Instruct) montraient une moyenne de 1,10x vs modèle figé, MemoryAgentBench 1,31x, LoCoMo 1,20x.
  • L'utilisateur cherche de l'aide (ou un financement d'environ 6 000 $) pour entraîner un adaptateur pour des modèles plus grands comme Qwen3.6:27B.

À qui cela s'adresse : Développeurs exécutant des agents LLM locaux sur Apple Silicon qui souhaitent expérimenter la modulation de poids δ-mem pour améliorer les performances mémoire/contexte.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Benchmark : MLX vs Ollama exécutant Qwen3-Coder-Next 8-Bit sur MacBook Pro M5 Max
Tools

Benchmark : MLX vs Ollama exécutant Qwen3-Coder-Next 8-Bit sur MacBook Pro M5 Max

Un benchmark comparant les backends d'inférence MLX et Ollama exécutant la quantification 8 bits de Qwen3-Coder-Next sur un MacBook Pro M5 Max avec 128 Go de RAM montre que MLX atteint environ 72 tokens par seconde, soit environ le double du débit d'Ollama sur diverses tâches de programmation.

OpenClawRadar
SourceBridge : Outil open-source d'analyse de base de code utilisant des LLM locaux
Tools

SourceBridge : Outil open-source d'analyse de base de code utilisant des LLM locaux

SourceBridge est un outil open-source qui indexe des dépôts Git dans des graphes de symboles et utilise des LLM locaux pour générer des résumés de bases de code, des visites guidées de l'architecture et du matériel pédagogique. Il prend en charge plusieurs backends locaux, notamment Ollama, llama.cpp, vLLM, LM Studio et SGLang via des API compatibles OpenAI.

OpenClawRadar
free-claude-code ajoute la prise en charge de GLM-5 via NVIDIA NIM, et s'étend à OpenRouter et Discord
Tools

free-claude-code ajoute la prise en charge de GLM-5 via NVIDIA NIM, et s'étend à OpenRouter et Discord

free-claude-code prend désormais en charge GLM-5 via le niveau gratuit de NVIDIA NIM (40 requêtes/min) et ajoute l'intégration OpenRouter, la prise en charge des bots Discord et la compatibilité avec le fournisseur local LMStudio. L'outil convertit les requêtes API Anthropic de Claude Code pour fonctionner avec des backends de modèles alternatifs.

OpenClawRadar
Trois serveurs MCP pour la recherche e-commerce avec Claude : outils Shopify, Amazon et Google Maps
Tools

Trois serveurs MCP pour la recherche e-commerce avec Claude : outils Shopify, Amazon et Google Maps

Un développeur a créé trois serveurs MCP pour que Claude analyse des boutiques Shopify sans clés API, évalue les opportunités de produits Amazon, et trouve/évalue des prospects commerciaux locaux sur Google Maps. Tous sont disponibles sur Apify.

OpenClawRadar