Évaluation de Nemotron 3 Super 120B avec un contexte de 1 million de tokens sur M1 Ultra

✍️ OpenClawRadar📅 Publié: March 12, 2026🔗 Source
Évaluation de Nemotron 3 Super 120B avec un contexte de 1 million de tokens sur M1 Ultra
Ad

Test local d'un contexte de 1 million de tokens avec Nemotron 3 Super

Un utilisateur de Reddit a réalisé un test de benchmark pour évaluer la faisabilité de traiter localement des contextes d'un million de tokens en utilisant Nemotron 3 Super 120B sur un système M1 Ultra. Le test a tiré parti de l'architecture hybride mamba-2 du modèle, qui offre une efficacité mémoire pour des longueurs de contexte accrues.

Détails du matériel et de la configuration

Le test a été exécuté sur un M1 Ultra en utilisant llama.cpp avec la configuration suivante :

  • Modèle : Nemotron-3-Super-120B-Q4_K.gguf (quantification Q4_K_M)
  • Allocation de contexte : 1 million de tokens complets
  • Utilisation de la VRAM : Environ 90 Go
  • Backend : MTL,BLAS avec 1 thread
  • Taille de lot unifiée : 2048
  • Attention flash : Activée (fa 1)
  • Couches GPU : 99 (-ngl 99)
Ad

Commande de benchmark et résultats

L'utilisateur a exécuté llama-bench avec cette commande :

llama-bench -m ~/ml-models/huggingface/ggml-org/Nemotron-3-Super-120B-GGUF/Nemotron-3-Super-120B-Q4_K.gguf -fa 1 -t 1 -ngl 99 -b 2048 -ub 2048 -d 0,10000,20000,30000,40000,50000,60000,70000,80000,90000,100000,150000,200000,250000,1000000

Résultats de performance clés du benchmark :

  • Traitement de prompt (pp512) à 0 contexte : 255,03 ± 0,36 tokens/seconde
  • Génération de tokens (tg128) à 0 contexte : 26,72 ± 0,02 tokens/seconde
  • Traitement de prompt à 100 000 tokens de contexte : 184,99 ± 0,19 tokens/seconde
  • Génération de tokens à 100 000 tokens de contexte : 22,37 ± 0,01 tokens/seconde
  • Traitement de prompt à 150 000 tokens de contexte : 161,60 ± 0,22 tokens/seconde
  • Génération de tokens à 150 000 tokens de contexte : 20,58 ± 0,01 tokens/seconde
  • Traitement de prompt à 200 000 tokens de contexte : 141,87 ± 0,19 tokens/seconde

Les résultats montrent une dégradation des performances à mesure que la longueur du contexte augmente, avec la vitesse de traitement de prompt passant de 255 t/s sans contexte à environ 142 t/s à 200 000 tokens.

Informations système

L'initialisation du backend Metal a affiché :

  • Nom du GPU : MTL0
  • Famille GPU : MTLGPUFamilyApple7 (1007)
  • Mémoire unifiée : true
  • Support bfloat : true
  • Taille maximale recommandée du jeu de travail : 134 217,73 Mo

Ce test démontre que le traitement local de contextes extrêmement grands (jusqu'à 1 million de tokens) est techniquement possible avec du matériel Apple Silicon haut de gamme et des modèles quantifiés, bien qu'avec des exigences mémoire importantes et des compromis de performance à mesure que le contexte s'étend.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Inférence LLM souveraine au Royaume-Uni : Relax.ai publie des documents publics
Tools

Inférence LLM souveraine au Royaume-Uni : Relax.ai publie des documents publics

Relax.ai a publié la documentation pour l'inférence de LLM souverain britannique, redirigeant vers /docs/getting-started/introduction. Le service a été partagé sur HN avec 104 points.

OpenClawRadar
Ingénieur du son développe un outil d'analyse de mix avec Claude Code
Tools

Ingénieur du son développe un outil d'analyse de mix avec Claude Code

Un ingénieur du son a créé un outil qui analyse les mixages audio en utilisant l'API Web Audio et Claude pour fournir des retours spécifiques sur des problèmes comme les basses-médiums boueux, le manque de marge de manœuvre et les voix enterrées dans le mix. L'outil propose un niveau gratuit pour une analyse rapide et un rapport pro payant avec des notes détaillées sur les fréquences et des suggestions de plugins.

OpenClawRadar
Google Surf MCP : MCP de recherche Google gratuit avec gestion des PDF et extraction hiérarchisée
Tools

Google Surf MCP : MCP de recherche Google gratuit avec gestion des PDF et extraction hiérarchisée

Google Surf MCP est un serveur MCP gratuit pour la recherche Google et l'extraction d'URL qui gère les PDF et propose un mode d'extraction hiérarchisé (résumé/intégral) pour économiser des tokens.

OpenClawRadar
Claude-Real-Video : Extraction d'images adaptée à la scène + transcription pour tout LLM
Tools

Claude-Real-Video : Extraction d'images adaptée à la scène + transcription pour tout LLM

Un outil open-source qui extrait des images clés et des transcriptions audio de vidéos, permettant à n'importe quel LLM de « regarder » une vidéo localement sans téléchargement. Détection des changements de scène, déduplication par fenêtre glissante et transcription Whisper.

OpenClawRadar