Многоагентная система хайку соответствует Claude Opus в решении сложной задачи по теории чисел при 15-кратном снижении затрат.

Экспериментальная установка и результаты
Пользователь Reddit провёл сравнительный тест между двумя конфигурациями модели Claude на сложной задаче из теории чисел. Задача требовала доказать, что для нечётного простого числа p сумма 1^(p-1) + 2^(p-1) + ... + (p-1)^(p-1) сравнима с -1 (mod p), используя малую теорему Ферма и свойства первообразных корней.
Были протестированы две конфигурации:
- Конфигурация X (Opus соло): Claude Opus 4.5 с max_tokens: 2048, без аудитора
- Конфигурация Y (многоагентная Haiku): Генератор Haiku создаёт полное доказательство, второй аудитор Haiku проверяет каждый шаг, с двумя проходами, если аудитор что-то помечает, max_tokens: 1024 на каждый вызов
Оценка и производительность
Обе конфигурации получили оценку 4/4 по следующей рубрике:
- Корректно применяет малую теорему Ферма
- Корректно работает с аргументом о первообразных корнях
- Суммирование по полной системе вычетов валидно
- Вывод о сравнении следует корректно
Аудитор Haiku вернул статус VERIFIED без разногласий. Метрики производительности:
- Opus соло: ~8.7 секунд, оценка 4/4
- Haiku + аудитор: ~10.9 секунд, оценка 4/4
Анализ стоимости
Экономические последствия значительны:
- Opus соло: $0.075/1000 токенов × ~800 токенов = ~$0.06 за запрос
- Haiku + Haiku: $0.0025/1000 токенов × ~1600 токенов = ~$0.004 за запрос
Это представляет примерно в 15 раз меньшую стоимость при идентичных результатах на данной задаче. Задача была описана как "действительно сложная" и не очевидная из обучающих данных, в отличие от более простых доказательств.
В источнике отмечается, что на чистых задачах, где малая теорема Ферма выполняет основную работу (каждое a^(p-1) ≡ 1, сумма (p-1) единиц, получаем p-1 ≡ -1), паттерн с аудитором добавляет около 17% временных затрат для подтверждения корректности. Этот паттерн особенно ценен для задач, где генератор может споткнуться из-за квантования или галлюцинированной алгебры.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Memento Vault: Локальный инструмент для сохранения контекста в сессиях Claude Code
Memento Vault — это набор хуков, которые автоматически захватывают транскрипты сессий, оценивают их и сохраняют атомарные заметки в локальном git-репозитории. Он обеспечивает поиск с нулевой стоимостью через BM25 + векторный поиск со средней задержкой 472 мс и вводит релевантный контекст при запуске сессии, при каждом запросе и при чтении файлов.

Локальная система мониторинга поведения с конвейером MCP и кодом Claude
Разработчик создал локальную систему мониторинга поведения под названием BRAIN, которая отслеживает переключения между приложениями, операции с файлами и сессии разработки, передавая данные через пользовательский MCP-сервер в Claude Code. Система работает на 100% локально без какой-либо зависимости от облачных сервисов.

Использование Claude для автоматизации тестирования мобильных приложений с помощью Capacitor WebViews
Разработчик создал автоматизированную систему контроля качества с использованием Claude для тестирования мобильного приложения на базе Capacitor на Android и iOS. Подход использует Chrome DevTools Protocol для Android WebViews и скриншоты для визуального анализа, при этом настройка Android заняла 90 минут, а iOS — более 6 часов.

Детектор утечек Swarm: Бесплатный инструмент для поиска открытых API-ключей в конфигурациях OpenClaw
Разработчик выпустил swarm-leak-detector — инструмент с лицензией MIT без зависимостей, который сканирует более 21 шаблона учетных данных (OpenAI, Anthropic, OpenRouter, Stripe и др.) в текстовых JSON-файлах конфигурации. Запустите его с помощью npx swarm-leak-detector scan ~/.clawdbot/, чтобы проверить наличие утечек примерно за 30 секунд.