Interface utilisateur et serveur pour les autoencodeurs en langage naturel d'Anthropic sur llama.cpp

✍️ OpenClawRadar📅 Publié: May 13, 2026🔗 Source
Ad

Les premiers modèles à poids ouverts d'Anthropic, les autoencodeurs en langage naturel (NLA), sont des versions affinées d'architectures populaires à poids ouverts. Comme ils ne modifient ni l'architecture sous-jacente du modèle ni le code de modélisation, l'inférence avec llama.cpp est simple. Un développeur a regroupé toutes les fonctionnalités des NLA — extraction d'activations, explication d'activations, reconstruction d'activations et guidage par édition d'explications — dans un serveur llama.cpp personnalisé, associé à une interface Mikupad pour l'explication et le guidage des activations au niveau des tokens.

Fonctionnalités clés

  • Extraction d'activations : Extraire les activations internes de n'importe quelle couche du modèle de base.
  • Explication d'activations : Obtenir des explications lisibles par l'homme pour les activations extraites.
  • Reconstruction d'activations : Reconstruire les activations à partir de leurs explications.
  • Guidage par édition d'explications : Modifier les explications et orienter la sortie du modèle en conséquence.
Ad

Détails techniques

Le serveur est construit sur llama.cpp et nécessite le chargement simultané de trois modèles : le modèle de base, le modèle acteur et le modèle critique. Il s'agit d'une configuration gourmande en mémoire. Le développeur travaille sur une version basée sur LoRA qui permettrait de charger un seul modèle en mémoire, réduisant ainsi considérablement l'empreinte.

L'interface Mikupad offre une interface au niveau des tokens pour l'explication et le guidage des activations. Vous pouvez inspecter quels tokens activent certaines caractéristiques et ajuster le comportement du modèle en éditant les explications en temps réel.

Pour commencer

Le code source et les instructions d'installation sont disponibles sur Reddit. Actuellement, vous devez disposer des trois points de contrôle du modèle NLA (base, acteur, critique) et compiler le serveur llama.cpp personnalisé. La version LoRA est à venir.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Opérateur Kubernetes OpenClaw avec prise en charge intégrée d'Ollama
Tools

Opérateur Kubernetes OpenClaw avec prise en charge intégrée d'Ollama

Un membre de la communauté a créé un opérateur Kubernetes OpenClaw qui inclut un support Ollama intégré, permettant aux agents d'IA de fonctionner avec des modèles locaux dans le même espace de noms. La configuration comprend des commandes d'installation, des détails de configuration pour les modèles Ollama locaux et cloud, ainsi que des instructions d'accès au tableau de bord.

OpenClawRadar
Constrails : Couche de gouvernance externe en phase alpha précoce pour les agents IA
Tools

Constrails : Couche de gouvernance externe en phase alpha précoce pour les agents IA

Constrails est une couche externe de gouvernance d'exécution pour les agents d'IA qui place une couche de contrôle entre les agents et leurs outils, mettant en œuvre des vérifications de capacités, une évaluation des risques, une évaluation des politiques et une journalisation d'audit. Le projet en phase alpha précoce vise à répondre aux préoccupations de sécurité en déplaçant les contrôles en dehors de l'agent lui-même.

OpenClawRadar
Plateforme IA de Cloudflare : Couche d'Inférence Unifiée pour les Agents IA
Tools

Plateforme IA de Cloudflare : Couche d'Inférence Unifiée pour les Agents IA

La plateforme IA de Cloudflare fournit une API unique pour accéder à plus de 70 modèles provenant de plus de 12 fournisseurs, incluant une prise en charge multimodale pour les modèles d'image, vidéo et parole. Elle permet de changer de modèle avec une seule modification de code et offre une surveillance centralisée des coûts avec des métadonnées personnalisées.

OpenClawRadar
Claudetop : Surveillance des Coûts en Temps Réel pour les Sessions de Code Claude
Tools

Claudetop : Surveillance des Coûts en Temps Réel pour les Sessions de Code Claude

Claudetop est un outil similaire à htop qui affiche les dépenses en temps réel, l'efficacité du cache et les comparaisons de modèles pour les sessions Claude Code. Il fournit des commandes slash comme /claudetop:stats et des alertes intelligentes pour les jalons de coût et les problèmes d'efficacité.

OpenClawRadar