Creation OS: Локальная σ-затворная среда выполнения LLM, позволяющая моделям говорить «Я не знаю» вместо галлюцинаций

Creation OS — это локальный AI-рантайм, который оборачивает локальные LLM с σ-затвором — измерительным слоем, оценивающим каждый вывод по нескольким каналам неопределенности и принимающим решение ACCEPT, RETHINK или ABSTAIN. Цель — позволить локальным моделям отказываться от ответов при неопределенности вместо галлюцинаций.
Ключевые возможности и установка
- Поддерживает BitNet b1.58 2B-4T, Qwen3-8B Q4_K_M, Gemma 3 4B и любую GGUF модель.
- Работает на MacBook Air M4 8GB в качестве основного устройства — без облака, без API, ничего не покидает устройство.
- Установка:
git clone https://github.com/spektre-labs/creation-os, затемcd creation-os && bash scripts/quickstart.sh - Полный путь с локальными весами:
./scripts/install.sh, затем./cos chat
Измерения σ-затвора
Затвор объединяет logprob, энтропию, перплексию, согласованность, семантическую σ, конформную τ, когерентность сессии и метакогнитивные каналы в единый вердикт:
- ACCEPT → показать ответ
- RETHINK → регенерировать
- ABSTAIN → отказаться
Результаты бенчмарков
TruthfulQA (те же промпты и сиды):
|Mode |Accuracy|Coverage| |-------------|--------|--------| |BitNet only |0.261 |0.136 | |σ-pipeline |0.336 |0.171 |
+28.7% точности за счет селективной регенерации на неопределенных строках. LSD probe AUROC: 0.982 на TruthfulQA holdout, 0.960 на TriviaQA. ECE: 0.043. Ошибочных+уверенных: 0. Конформная граница: P(ошибка | ACCEPT) ≤ α при α=0.80.
Отрицательные результаты задокументированы: σ не доминирует на HellaSwag или MMLU. Полные детали в CLAIM_DISCIPLINE.md.
Формальная верификация
Lean 4: 6/6 без sorry. Frama-C WP: 15/15 tier-1 разряжено.
Пример команды
./cos chat --once --prompt "Сколько будет 2+2?" --multi-sigma --verbose выдает вывод вида σ_peak=0.06 action=ACCEPT route=LOCAL σ_combined=0.184 conformal@α=0.80.
Интеграция с MCP
Запустите python3 -m cos.mcp_sigma_server чтобы предоставить σ для каждого ответа любому MCP-совместимому клиенту.
Ограничения
σ не является универсальным детектором галлюцинаций — наиболее силен на фактологических QA; длинные формы требуют дополнительной оценки. Качество локальной модели по-прежнему зависит от базовой модели.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

claude-powerline v1.20 добавляет режим TUI-панели управления, стили для строки контекста и отображение переменных окружения.
claude-powerline v1.20 представляет режим TUI-панели, который заменяет одиночную строку состояния на полноценную панель с информацией о модели, использованием контекста с индикатором прогресса, затратами, статусом git и другими данными. Обновление добавляет 9 визуальных стилей индикатора прогресса для отображения использования контекста и возможность отображения переменных окружения.

WAYD: 60-секундный социальный перерыв в Claude Code, Cursor и Copilot CLI
WAYD — это плагин для Claude Code, Cursor и Copilot CLI, который позволяет публиковать однострочные заметки о своем кодинге под тегами настроения и листать ленту реакций других разработчиков — всё из терминала, на базе GitHub Issues.

Мобильное приложение QCAI добавляет управление шлюзом OpenClaw с нативным VPN Tailscale
QCAI для iOS и Android теперь интегрируется с OpenClaw Control Center, позволяя напрямую управлять шлюзом с мобильных устройств через защищённые VPN-туннели Tailscale без открытых портов.

Параллельная архитектура чата Claude для разработки на Next.js
Разработчик создал систему для одновременного запуска нескольких чатов Claude AI на одной кодовой базе Next.js с использованием общей таблицы базы данных и опрашивающего агента, достигнув 87% успешных сборок без единого конфликта слияния за одну сессию.