Многоагентная система хайку соответствует Claude Opus в решении сложной задачи по теории чисел при 15-кратном снижении затрат.

Экспериментальная установка и результаты
Пользователь Reddit провёл сравнительный тест между двумя конфигурациями модели Claude на сложной задаче из теории чисел. Задача требовала доказать, что для нечётного простого числа p сумма 1^(p-1) + 2^(p-1) + ... + (p-1)^(p-1) сравнима с -1 (mod p), используя малую теорему Ферма и свойства первообразных корней.
Были протестированы две конфигурации:
- Конфигурация X (Opus соло): Claude Opus 4.5 с max_tokens: 2048, без аудитора
- Конфигурация Y (многоагентная Haiku): Генератор Haiku создаёт полное доказательство, второй аудитор Haiku проверяет каждый шаг, с двумя проходами, если аудитор что-то помечает, max_tokens: 1024 на каждый вызов
Оценка и производительность
Обе конфигурации получили оценку 4/4 по следующей рубрике:
- Корректно применяет малую теорему Ферма
- Корректно работает с аргументом о первообразных корнях
- Суммирование по полной системе вычетов валидно
- Вывод о сравнении следует корректно
Аудитор Haiku вернул статус VERIFIED без разногласий. Метрики производительности:
- Opus соло: ~8.7 секунд, оценка 4/4
- Haiku + аудитор: ~10.9 секунд, оценка 4/4
Анализ стоимости
Экономические последствия значительны:
- Opus соло: $0.075/1000 токенов × ~800 токенов = ~$0.06 за запрос
- Haiku + Haiku: $0.0025/1000 токенов × ~1600 токенов = ~$0.004 за запрос
Это представляет примерно в 15 раз меньшую стоимость при идентичных результатах на данной задаче. Задача была описана как "действительно сложная" и не очевидная из обучающих данных, в отличие от более простых доказательств.
В источнике отмечается, что на чистых задачах, где малая теорема Ферма выполняет основную работу (каждое a^(p-1) ≡ 1, сумма (p-1) единиц, получаем p-1 ≡ -1), паттерн с аудитором добавляет около 17% временных затрат для подтверждения корректности. Этот паттерн особенно ценен для задач, где генератор может споткнуться из-за квантования или галлюцинированной алгебры.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Обновления CodeLedger и Vibecop для отслеживания затрат и качества кодирования в мультиагентном ИИ
CodeLedger теперь отслеживает расходы на Claude Code, Codex CLI, Cline и Gemini CLI, читая локальные файлы сессий, в то время как Vibecop добавляет автоматические проверки качества с новыми детекторами, специфичными для LLM, и настройкой одной командой для нескольких инструментов ИИ-кодирования.

Temporal-MCP: Осведомленность о настенных часах для LLM с поддержкой OAuth
Temporal-MCP — это минимальный MCP-сервер, который предоставляет LLM информацию о реальном времени, решая такие проблемы, как неправильные приветствия и устаревший контекст. Он предлагает два инструмента (temporal_tick и temporal_peek), возвращающих прошедшее время, обнаружение смены дня и флаг нового потока.

Система автоматического исправления использует Claude Code Headless для обнаружения и устранения ошибок в продакшене.
Разработчик создал автоматизированную систему исправления ошибок в продакшене с использованием Claude Code CLI в headless-режиме. Система обнаруживает ошибки из логов, создает изолированные git worktree для каждой проблемы, запрашивает у Claude написание исправлений и требует ручного подтверждения через Telegram перед созданием PR.

Разработчик делится CLI-инструментами, которые хорошо работают с Claude Code.
Разработчик перешёл с MCP на CLI для работы с Claude Code, обнаружив, что Claude эффективно обрабатывает команды CLI благодаря обучению на shell-скриптах и документации. Он поделился конкретными CLI-инструментами, которые использует ежедневно, включая gh, ripgrep, stripe, supabase, vercel, sentry-cli и neon.