Sistema Operativo de Creación: Un Entorno de Ejecución Local de LLM con Compuerta σ que Permite a los Modelos Decir 'No Sé' en Lugar de Alucinar

Creation OS es un runtime de IA local-first que envuelve LLMs locales con una σ-gate — una capa de medición que puntúa cada salida a través de múltiples canales de incertidumbre y decide ACEPTAR, REPENSAR o ABSTENERSE. El objetivo es permitir que los modelos locales se nieguen a responder cuando están inseguros, en lugar de alucinar.
Características clave y configuración
- Compatible con BitNet b1.58 2B-4T, Qwen3-8B Q4_K_M, Gemma 3 4B y cualquier modelo GGUF.
- Funciona en un MacBook Air M4 8GB como máquina principal — sin nube, sin API, nada sale del dispositivo.
- Instalación:
git clone https://github.com/spektre-labs/creation-osluegocd creation-os && bash scripts/quickstart.sh - Ruta completa con pesos locales:
./scripts/install.shluego./cos chat
Mediciones de la σ-gate
La compuerta combina logprob, entropía, perplejidad, consistencia, σ semántica, τ conforme, coherencia de sesión y canales metacognitivos en un único veredicto:
- ACEPTAR → mostrar respuesta
- REPENSAR → regenerar
- ABSTENERSE → negarse
Resultados de benchmark
TruthfulQA (mismos prompts y semillas):
|Modo |Precisión|Cobertura| |-------------|---------|---------| |Solo BitNet |0.261 |0.136 | |σ-pipeline |0.336 |0.171 |
+28.7% de precisión gracias a la regeneración selectiva en filas inciertas. AUROC de sonda LSD: 0.982 en TruthfulQA holdout, 0.960 en TriviaQA. ECE: 0.043. Incorrecto+confiado: 0. Límite conforme: P(error | ACEPTAR) ≤ α en α=0.80.
Resultados negativos documentados: σ no es dominante en HellaSwag ni MMLU. Detalles completos en CLAIM_DISCIPLINE.md.
Verificación formal
Lean 4: 6/6 libre de sorry. Frama-C WP: 15/15 de nivel 1 descargados.
Ejemplo de comando
./cos chat --once --prompt "¿Cuánto es 2+2?" --multi-sigma --verbose produce una salida como σ_peak=0.06 action=ACCEPT route=LOCAL σ_combined=0.184 conformal@α=0.80.
Integración MCP
Ejecuta python3 -m cos.mcp_sigma_server para exponer σ en cada respuesta a cualquier cliente compatible con MCP.
Limitaciones
σ no es un detector universal de alucinaciones — es más fuerte en QA factual; la forma larga necesita más evaluación. La calidad del modelo local sigue dependiendo del modelo base.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

AgentMarket: Una Plataforma de Prueba de Concepto para Economías de Agentes de IA
AgentMarket.space es una plataforma de prueba de concepto donde los agentes de IA se registran con capacidades, publican tareas con presupuestos de crédito y se contratan entre sí de forma autónoma utilizando una división de créditos 90/10 y Groq llama-3.3-70b para el emparejamiento.

Infracost reduce el uso de tokens de Claude en un 79% al rediseñar la CLI para agentes de IA
Infracost rediseñó su CLI para agentes de IA, reduciendo los tokens de salida de Claude en un 79% y el costo de API en un 67% en comparación con una línea base de Claude solo. Movimientos clave: pushdown de predicados en la CLI y un formato de salida eficiente en tokens.

Cómo los asistentes de IA obtienen páginas web: Análisis de registros de Nginx de ChatGPT, Claude, Gemini y otros
Un desarrollador probó cinco asistentes de IA principales al proporcionarles URLs únicas y monitorear los registros de Nginx, revelando patrones de recuperación distintos: ChatGPT, Claude y Perplexity utilizan agentes de usuario dedicados, mientras que Gemini respondió desde su índice sin realizar ninguna recuperación.

Construcción de CLIs para Agentes de IA: Principios de Diseño desde la CLI gws de Google
La CLI gws de Google demuestra cómo diseñar interfaces de línea de comandos específicamente para agentes de IA, priorizando cargas útiles JSON sin procesar sobre indicadores amigables para humanos e implementando barreras de seguridad contra alucinaciones.