Многоагентная система хайку соответствует Claude Opus в решении сложной задачи по теории чисел при 15-кратном снижении затрат.

Экспериментальная установка и результаты
Пользователь Reddit провёл сравнительный тест между двумя конфигурациями модели Claude на сложной задаче из теории чисел. Задача требовала доказать, что для нечётного простого числа p сумма 1^(p-1) + 2^(p-1) + ... + (p-1)^(p-1) сравнима с -1 (mod p), используя малую теорему Ферма и свойства первообразных корней.
Были протестированы две конфигурации:
- Конфигурация X (Opus соло): Claude Opus 4.5 с max_tokens: 2048, без аудитора
- Конфигурация Y (многоагентная Haiku): Генератор Haiku создаёт полное доказательство, второй аудитор Haiku проверяет каждый шаг, с двумя проходами, если аудитор что-то помечает, max_tokens: 1024 на каждый вызов
Оценка и производительность
Обе конфигурации получили оценку 4/4 по следующей рубрике:
- Корректно применяет малую теорему Ферма
- Корректно работает с аргументом о первообразных корнях
- Суммирование по полной системе вычетов валидно
- Вывод о сравнении следует корректно
Аудитор Haiku вернул статус VERIFIED без разногласий. Метрики производительности:
- Opus соло: ~8.7 секунд, оценка 4/4
- Haiku + аудитор: ~10.9 секунд, оценка 4/4
Анализ стоимости
Экономические последствия значительны:
- Opus соло: $0.075/1000 токенов × ~800 токенов = ~$0.06 за запрос
- Haiku + Haiku: $0.0025/1000 токенов × ~1600 токенов = ~$0.004 за запрос
Это представляет примерно в 15 раз меньшую стоимость при идентичных результатах на данной задаче. Задача была описана как "действительно сложная" и не очевидная из обучающих данных, в отличие от более простых доказательств.
В источнике отмечается, что на чистых задачах, где малая теорема Ферма выполняет основную работу (каждое a^(p-1) ≡ 1, сумма (p-1) единиц, получаем p-1 ≡ -1), паттерн с аудитором добавляет около 17% временных затрат для подтверждения корректности. Этот паттерн особенно ценен для задач, где генератор может споткнуться из-за квантования или галлюцинированной алгебры.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Исправление утечки памяти Claude Code для домашних лабораторий на Linux
Разработчик обнаружил, что у Claude Code есть серьёзная утечка памяти в glibc malloc, которая потребляла 400 ГБ ОЗУ и приводила к сбоям в его Proxmox homelab, после чего он создал двухуровневое решение защиты с помощью LD_PRELOAD shim и watchdog.

OpenHelm: Приложение для macOS для автоматизации задач кодирования с помощью Claude
OpenHelm — это бесплатное локальное приложение для macOS, которое автоматизирует повторяющиеся задачи кодирования в Claude, запуская задания по расписанию, автоматически повторяя неудачные попытки и разбивая работу на части, чтобы избежать ограничений сессий. Оно использует вашу существующую подписку Claude для вызовов LLM.

Открытые ИИ-контекстные пакеты для вопросов в сфере права, соответствия требованиям и финансов
Разработчик использовал Claude для исследования и создания 32 бесплатных, открытых контекстных пакетов, которые предоставляют конкретные ответы на юридические, регуляторные и финансовые вопросы вместо общих рекомендаций «проконсультируйтесь с юристом». Пакеты охватывают GDPR, контракты, биллинг SaaS, Закон ЕС об ИИ и другие темы.

Открытый SDK для AI-работы с знаниями
ClioAI выпустил <strong>kw-sdk</strong>, открытый набор инструментов для разработки программного обеспечения, предназначенный для структурирования работы ИИ-агентов в областях знаний, таких как исследование, анализ, стратегия и написание текстов. В отличие от традиционных кодовых фреймворков, которые имеют естественные сигналы верификации через тестирование, работа с знаниями требует структурированных подходов для проверки и оценки задач.