Système d'exploitation Création : Un runtime LLM local à porte σ qui permet aux modèles de dire « Je ne sais pas » plutôt que d'halluciner

Creation OS est un runtime IA local-first qui enveloppe les LLM locaux avec une σ-gate — une couche de mesure qui évalue chaque sortie sur plusieurs canaux d'incertitude et décide ACCEPTER, REPENSER ou S'ABSTENIR. L'objectif est de permettre aux modèles locaux de refuser les réponses en cas d'incertitude plutôt que d'halluciner.
Fonctionnalités clés et installation
- Prend en charge BitNet b1.58 2B-4T, Qwen3-8B Q4_K_M, Gemma 3 4B, et tout modèle GGUF.
- Fonctionne sur un MacBook Air M4 8 Go comme machine principale — pas de cloud, pas d'API, rien ne quitte l'appareil.
- Installation :
git clone https://github.com/spektre-labs/creation-ospuiscd creation-os && bash scripts/quickstart.sh - Chemin complet avec poids locaux :
./scripts/install.shpuis./cos chat
Mesures de la σ-Gate
La porte combine logprob, entropie, perplexité, cohérence, σ sémantique, τ conforme, cohérence de session et canaux métacognitifs en un verdict unique :
- ACCEPTER → afficher la réponse
- REPENSER → régénérer
- S'ABSTENIR → refuser
Résultats de benchmark
TruthfulQA (mêmes prompts et graines) :
|Mode |Précision|Couverture| |-------------|---------|----------| |BitNet seul |0.261 |0.136 | |σ-pipeline |0.336 |0.171 |
+28,7% de précision grâce à la régénération sélective sur les lignes incertaines. AUROC de la sonde LSD : 0,982 sur l'ensemble de test TruthfulQA, 0,960 sur TriviaQA. ECE : 0,043. Erreur+confiant : 0. Limite conforme : P(erreur | ACCEPTER) ≤ α à α=0,80.
Résultats négatifs documentés : σ n'est pas dominant sur HellaSwag ou MMLU. Détails complets dans CLAIM_DISCIPLINE.md.
Vérification formelle
Lean 4 : 6/6 sans sorry. Frama-C WP : 15/15 de niveau 1 validés.
Exemple de commande
./cos chat --once --prompt "Que fait 2+2 ?" --multi-sigma --verbose produit une sortie comme σ_peak=0.06 action=ACCEPT route=LOCAL σ_combined=0.184 conformal@α=0.80.
Intégration MCP
Exécutez python3 -m cos.mcp_sigma_server pour exposer σ sur chaque réponse à tout client compatible MCP.
Limitations
σ n'est pas un détecteur d'hallucination universel — le plus efficace sur les QA factuelles ; les réponses longues nécessitent plus d'évaluation. La qualité du modèle local dépend toujours du modèle de base.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

L'extension Compass pour Chrome ajoute des outils de navigation à Claude et ChatGPT
Un développeur a créé une extension Chrome gratuite appelée Compass qui ajoute une mini-carte de prompts, des en-têtes de défilement fixes, des listes de contrôle de session et des modèles de création de prompts aux interfaces Claude et ChatGPT pour résoudre les problèmes de navigation dans les conversations longues.

Réducteur de journaux MCP Server réduit l'utilisation de jetons quand Claude Code lit les journaux
Log Reducer est un serveur MCP qui traite les fichiers journaux côté serveur avant d'envoyer une sortie réduite à Claude Code, évitant ainsi les journaux bruts dans la fenêtre de contexte. Il applique 19 transformations déterministes qui compressent les journaux de 50 à 90 %, avec un journal de 2000 lignes représentant plus de 20 000 jetons retirés des sessions.

À l'intérieur de vLLM : Anatomie d'un système d'inférence LLM à haut débit
Aleksa Gordić décompose les composants clés de vLLM : moteur, gestionnaire de cache KV, attention paginée et batching continu. Couvre des fonctionnalités avancées comme le préremplissage par morceaux et le P/D désagrégé.

CC-Ledger : Suivi des coûts de Claude Code par session et par PR avec SQLite local
CC-Ledger est un binaire Rust qui s'accroche à Claude Code, enregistrant chaque tour dans une base SQLite locale. Repérez les sessions hors de contrôle en direct et obtenez une ventilation des coûts par PR sans clé API. Comprend une barre de menus macOS, un tableau de bord web et une interface CLI.