Разработчик рассматривает переход с DeepSeek на Grok для создания финансового AI-агента

Проблемы с производительностью финансового ИИ-агента и возможный переход
Разработчик создал финансовое веб-приложение с ИИ на FastAPI/Python, которое работает аналогично Perplexity, но для акций. Перед обработкой запросов языковой моделью приложение запускает параллельный конвейер, включающий получение актуальных котировок акций из нескольких финансовых API, актуальный веб-поиск через финансовые поисковые API и данные календаря отчетностей. Весь этот структурированный контекст добавляется в системный промпт, при этом модель отвечает только за рассуждения и форматирование, а фактические данные поступают из API, что делает уровень галлюцинаций менее важным для данного случая использования.
Текущие проблемы с производительностью модели
В настоящее время разработчик использует DeepSeek V3.2 Reasoning и сообщает о значительных проблемах с производительностью:
- TTFT (Время до первого токена): ~70 секунд
- Скорость вывода: ~25 токенов в секунду
- Опыт потоковой передачи описан как "ужасный"
- Таймаут начала потока установлен на 75 секунд, чтобы избежать постоянных сбоев
Требования приложения
Финансовый ИИ-агент имеет две основные функции:
- Поток чата: Финансовый анализ в стиле Perplexity со встроенными ссылками на источники
- Поток проверки сделок: Торговый коуч, который выдает рекомендации GO/NO-GO/WAIT с указанием точки входа, стоп-лосса, цели и соотношения риск/прибыль
Требования к модели включают:
- Высокая производительность с низким TTFT и высокой скоростью токенов в секунду для удобства потоковой передачи
- Низкая стоимость для небольшого проекта
- Достаточный интеллект для многошаговых торговых рассуждений
- Хорошее следование инструкциям для строгих форматов вывода при проверке сделок
Рассмотрение Grok 4.1 Fast Reasoning
Разработчик рассматривает переход на Grok 4.1 Fast Reasoning на основе следующих сравнений:
- TTFT: ~15 секунд (против ~70с у DeepSeek)
- Скорость вывода: ~75 токенов в секунду (против ~25 т/с у DeepSeek)
- Оценка интеллекта AA: 64 против 57 у DeepSeek
- Стоимость ввода: $0,20 против $0,28 за миллион токенов
Другие рассматриваемые модели
Разработчик также рассматривал Minimax 2.5, Kimi K2.5, новые модели Qwen 3.5 и Gemini 3 Flash, но отмечает, что большинство из них относительно дорогие и не лучше подходят для их конкретного случая использования.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Claude AI использовался для создания документа оценки производительности на основе истории пользователя
Разработчик использовал Claude AI для заполнения 3-4-страничного документа по оценке эффективности, попросив его «завершить эту документацию, используя информацию, которая у тебя есть обо мне». ИИ сгенерировал подробный документ за 5-6 минут, включив в него рабочие достижения, о которых пользователь почти забыл.

Бот OpenClaw автоматизирует извлечение данных из KMZ и объединение таблиц.
Пользователь сообщает об использовании бота OpenClaw для парсинга файлов KMZ, извлечения восьми конкретных точек данных, включая мильные маркеры, расчета позиций в десятичных милях с высокой точностью и слияния новых данных с существующими таблицами без перезаписи. Процесс занял 5 минут времени обработки и 15% от бюджета сессии максимального плана в $100.

Революция в коммуникациях: разговоры по телефону с использованием ИИ
Погрузитесь в последние обсуждения на r/openclaw о трансформационном влиянии ИИ на телефонное общение. Узнайте о потенциале ИИ-агентов в изменении нашего взаимодействия с голосовыми технологиями.

Процесс разработчика по созданию текстовых игр на основе ИИ с помощью Claude
Разработчик делится своим рабочим процессом создания текстовых игр, которые работают нативно на ИИ-моделях, таких как Claude, включая гармонизацию файлов, уточнение правил и упаковку игр в PDF-промпты. Они выпустили текстовую RTS в стиле StarCraft под названием Kreep.