Многоагентная система хайку соответствует Claude Opus в решении сложной задачи по теории чисел при 15-кратном снижении затрат.

✍️ OpenClawRadar📅 Опубликовано: 7 марта 2026 г.🔗 Source
Многоагентная система хайку соответствует Claude Opus в решении сложной задачи по теории чисел при 15-кратном снижении затрат.
Ad

Экспериментальная установка и результаты

Пользователь Reddit провёл сравнительный тест между двумя конфигурациями модели Claude на сложной задаче из теории чисел. Задача требовала доказать, что для нечётного простого числа p сумма 1^(p-1) + 2^(p-1) + ... + (p-1)^(p-1) сравнима с -1 (mod p), используя малую теорему Ферма и свойства первообразных корней.

Были протестированы две конфигурации:

  • Конфигурация X (Opus соло): Claude Opus 4.5 с max_tokens: 2048, без аудитора
  • Конфигурация Y (многоагентная Haiku): Генератор Haiku создаёт полное доказательство, второй аудитор Haiku проверяет каждый шаг, с двумя проходами, если аудитор что-то помечает, max_tokens: 1024 на каждый вызов

Оценка и производительность

Обе конфигурации получили оценку 4/4 по следующей рубрике:

  • Корректно применяет малую теорему Ферма
  • Корректно работает с аргументом о первообразных корнях
  • Суммирование по полной системе вычетов валидно
  • Вывод о сравнении следует корректно

Аудитор Haiku вернул статус VERIFIED без разногласий. Метрики производительности:

  • Opus соло: ~8.7 секунд, оценка 4/4
  • Haiku + аудитор: ~10.9 секунд, оценка 4/4
Ad

Анализ стоимости

Экономические последствия значительны:

  • Opus соло: $0.075/1000 токенов × ~800 токенов = ~$0.06 за запрос
  • Haiku + Haiku: $0.0025/1000 токенов × ~1600 токенов = ~$0.004 за запрос

Это представляет примерно в 15 раз меньшую стоимость при идентичных результатах на данной задаче. Задача была описана как "действительно сложная" и не очевидная из обучающих данных, в отличие от более простых доказательств.

В источнике отмечается, что на чистых задачах, где малая теорема Ферма выполняет основную работу (каждое a^(p-1) ≡ 1, сумма (p-1) единиц, получаем p-1 ≡ -1), паттерн с аудитором добавляет около 17% временных затрат для подтверждения корректности. Этот паттерн особенно ценен для задач, где генератор может споткнуться из-за квантования или галлюцинированной алгебры.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Исправление утечки памяти Claude Code для домашних лабораторий на Linux
Инструменты

Исправление утечки памяти Claude Code для домашних лабораторий на Linux

Разработчик обнаружил, что у Claude Code есть серьёзная утечка памяти в glibc malloc, которая потребляла 400 ГБ ОЗУ и приводила к сбоям в его Proxmox homelab, после чего он создал двухуровневое решение защиты с помощью LD_PRELOAD shim и watchdog.

OpenClawRadar
OpenHelm: Приложение для macOS для автоматизации задач кодирования с помощью Claude
Инструменты

OpenHelm: Приложение для macOS для автоматизации задач кодирования с помощью Claude

OpenHelm — это бесплатное локальное приложение для macOS, которое автоматизирует повторяющиеся задачи кодирования в Claude, запуская задания по расписанию, автоматически повторяя неудачные попытки и разбивая работу на части, чтобы избежать ограничений сессий. Оно использует вашу существующую подписку Claude для вызовов LLM.

OpenClawRadar
Открытые ИИ-контекстные пакеты для вопросов в сфере права, соответствия требованиям и финансов
Инструменты

Открытые ИИ-контекстные пакеты для вопросов в сфере права, соответствия требованиям и финансов

Разработчик использовал Claude для исследования и создания 32 бесплатных, открытых контекстных пакетов, которые предоставляют конкретные ответы на юридические, регуляторные и финансовые вопросы вместо общих рекомендаций «проконсультируйтесь с юристом». Пакеты охватывают GDPR, контракты, биллинг SaaS, Закон ЕС об ИИ и другие темы.

OpenClawRadar
Открытый SDK для AI-работы с знаниями
Инструменты

Открытый SDK для AI-работы с знаниями

ClioAI выпустил <strong>kw-sdk</strong>, открытый набор инструментов для разработки программного обеспечения, предназначенный для структурирования работы ИИ-агентов в областях знаний, таких как исследование, анализ, стратегия и написание текстов. В отличие от традиционных кодовых фреймворков, которые имеют естественные сигналы верификации через тестирование, работа с знаниями требует структурированных подходов для проверки и оценки задач.

OpenClawRadar