Évaluation de Nemotron 3 Super 120B avec un contexte de 1 million de tokens sur M1 Ultra

✍️ OpenClawRadar📅 Publié: March 12, 2026🔗 Source
Évaluation de Nemotron 3 Super 120B avec un contexte de 1 million de tokens sur M1 Ultra
Ad

Test local d'un contexte de 1 million de tokens avec Nemotron 3 Super

Un utilisateur de Reddit a réalisé un test de benchmark pour évaluer la faisabilité de traiter localement des contextes d'un million de tokens en utilisant Nemotron 3 Super 120B sur un système M1 Ultra. Le test a tiré parti de l'architecture hybride mamba-2 du modèle, qui offre une efficacité mémoire pour des longueurs de contexte accrues.

Détails du matériel et de la configuration

Le test a été exécuté sur un M1 Ultra en utilisant llama.cpp avec la configuration suivante :

  • Modèle : Nemotron-3-Super-120B-Q4_K.gguf (quantification Q4_K_M)
  • Allocation de contexte : 1 million de tokens complets
  • Utilisation de la VRAM : Environ 90 Go
  • Backend : MTL,BLAS avec 1 thread
  • Taille de lot unifiée : 2048
  • Attention flash : Activée (fa 1)
  • Couches GPU : 99 (-ngl 99)
Ad

Commande de benchmark et résultats

L'utilisateur a exécuté llama-bench avec cette commande :

llama-bench -m ~/ml-models/huggingface/ggml-org/Nemotron-3-Super-120B-GGUF/Nemotron-3-Super-120B-Q4_K.gguf -fa 1 -t 1 -ngl 99 -b 2048 -ub 2048 -d 0,10000,20000,30000,40000,50000,60000,70000,80000,90000,100000,150000,200000,250000,1000000

Résultats de performance clés du benchmark :

  • Traitement de prompt (pp512) à 0 contexte : 255,03 ± 0,36 tokens/seconde
  • Génération de tokens (tg128) à 0 contexte : 26,72 ± 0,02 tokens/seconde
  • Traitement de prompt à 100 000 tokens de contexte : 184,99 ± 0,19 tokens/seconde
  • Génération de tokens à 100 000 tokens de contexte : 22,37 ± 0,01 tokens/seconde
  • Traitement de prompt à 150 000 tokens de contexte : 161,60 ± 0,22 tokens/seconde
  • Génération de tokens à 150 000 tokens de contexte : 20,58 ± 0,01 tokens/seconde
  • Traitement de prompt à 200 000 tokens de contexte : 141,87 ± 0,19 tokens/seconde

Les résultats montrent une dégradation des performances à mesure que la longueur du contexte augmente, avec la vitesse de traitement de prompt passant de 255 t/s sans contexte à environ 142 t/s à 200 000 tokens.

Informations système

L'initialisation du backend Metal a affiché :

  • Nom du GPU : MTL0
  • Famille GPU : MTLGPUFamilyApple7 (1007)
  • Mémoire unifiée : true
  • Support bfloat : true
  • Taille maximale recommandée du jeu de travail : 134 217,73 Mo

Ce test démontre que le traitement local de contextes extrêmement grands (jusqu'à 1 million de tokens) est techniquement possible avec du matériel Apple Silicon haut de gamme et des modèles quantifiés, bien qu'avec des exigences mémoire importantes et des compromis de performance à mesure que le contexte s'étend.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

🦀
Tools

Spine Swarm : Système d'IA Multi-Agents sur Toile Visuelle pour Projets Non-Codés

Spine Swarm est un système multi-agents qui fonctionne sur un canevas visuel infini pour mener à bien des projets complexes non liés au codage, tels que l'analyse concurrentielle, la modélisation financière, les audits SEO, les pitch decks et les prototypes interactifs. Le système utilise des blocs comme abstractions au-dessus des modèles d'IA, qui peuvent être connectés pour transmettre le contexte entre différents types de modèles.

OpenClawRadar
Dépôt de Compétences Awesome OpenClaw Offre Plus de 5 400 Compétences Filtrées
Tools

Dépôt de Compétences Awesome OpenClaw Offre Plus de 5 400 Compétences Filtrées

Un dépôt GitHub appelé awesome-openclaw-skills propose plus de 1 715 compétences prêtes pour la production que les agents IA peuvent installer avec une seule commande CLI, filtrées à partir du registre officiel OpenClaw Skills Registry.

OpenClawRadar
Sx : Un gestionnaire de paquets open source pour compétences IA, MCP et commandes
Tools

Sx : Un gestionnaire de paquets open source pour compétences IA, MCP et commandes

Sx est un gestionnaire de paquets privé de type npm pour les actifs IA — compétences, configurations MCP, commandes, hooks et agents — qui permet aux équipes de partager, versionner et délimiter les configurations IA sur n'importe quel client IA (Claude Code, Cursor, Copilot, Gemini).

OpenClawRadar
Benchmark Flash-MOE sur M5 Max : 12,99 tok/s avec Qwen3.5-397B
Tools

Benchmark Flash-MOE sur M5 Max : 12,99 tok/s avec Qwen3.5-397B

Un benchmark du modèle Qwen3.5 de 397 milliards de paramètres exécuté localement sur un MacBook Pro M5 Max avec 128 Go de RAM a atteint 12,99 tokens par seconde en utilisant une quantification 4 bits et cache-io-split 4, soit trois fois plus rapide que le benchmark original de 48 Go.

OpenClawRadar