Бенчмарк торговых стратегий: Более дешёвые модели ИИ превосходят Claude Opus 4.6

Пользователь Reddit провёл сравнительный анализ 10 различных крупных языковых моделей на их способность разрабатывать торговые стратегии. Результаты показали, что более дешёвые модели стабильно превосходили более дорогие варианты, причём Claude Opus 4.6 не смог войти в первую четвёрку, несмотря на стоимость в 10 раз выше, чем у некоторых конкурентов.
Протестированные модели
- Claude Opus 4.6
- Gemini 3
- Gemini 3.1 Pro
- GPT-5.2
- Gemini Flash 3
- GPT-5-mini
- Kimi K2.5
- Minimax 2.5
Ключевые выводы
В ходе тестирования всем моделям был задан одинаковый запрос: «создать лучшую торговую стратегию». Модели вроде Minimax 2.5 и Gemini 3.1 возглавили рейтинг, в то время как модели Anthropic показали слабые результаты в сравнении. Kimi K2.5 превзошёл Claude в этом соревновании, будучи в 10 раз дешевле.
Эксперимент проводился трижды для обеспечения стабильности результатов. Автор отметил, что умение хорошо программировать не обязательно означает хорошие результаты в других задачах, таких как разработка стратегий.
Подобные специализированные тесты полезны для разработчиков, которым нужно выбирать модели ИИ для конкретных задач, выходящих за рамки общей помощи в программировании. Результаты показывают, что выбор модели должен быть ориентирован на конкретную задачу, а не основываться только на общей репутации или цене.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Кими k2.5: Прокладывая новые пути в автоматизации ИИ
Kimi k2.5 установила новый стандарт в области автоматизации ИИ, обладая передовыми возможностями, которые привлекают внимание в технологическом сообществе. Узнайте, как она перестраивает ландшафт.

Использование воды в центрах обработки данных ИИ в Калифорнии: оценки на основе физических и ИИ-моделей
Анализ California WaterBlog, использующий физику и четыре модели ИИ, оценивает потребление воды дата-центрами ИИ в Калифорнии в 2300–400 000 акро-футов в год, при реалистичном диапазоне 32 000–290 000 акро-футов в год — скромно по сравнению с сельским хозяйством.

Opus 4.6 превосходит в исследованиях, Gemini 3.1 Pro лучше в прогнозировании
Бенчмарк из 1417 бинарных вопросов для прогнозирования разделяет производительность исследований и суждений: Claude Opus 4.6 лидирует в агентных исследованиях, Gemini 3.1 Pro побеждает в калибровке на фиксированных данных. GPT-5.4 и Grok 4.20 показывают незначительные изменения между условиями.

Статья NYT Magazine о реальном использовании OpenClaw в малом бизнесе — подарок от Reddit
Статья в New York Times Magazine рассказывает о пользователях OpenClaw, которые делятся опытом использования AI-агентов в бизнесе. Материал начинался с поста на Reddit. Включена бесплатная ссылка на статью.