Разработчик рассматривает переход с DeepSeek на Grok для создания финансового AI-агента

Проблемы с производительностью финансового ИИ-агента и возможный переход
Разработчик создал финансовое веб-приложение с ИИ на FastAPI/Python, которое работает аналогично Perplexity, но для акций. Перед обработкой запросов языковой моделью приложение запускает параллельный конвейер, включающий получение актуальных котировок акций из нескольких финансовых API, актуальный веб-поиск через финансовые поисковые API и данные календаря отчетностей. Весь этот структурированный контекст добавляется в системный промпт, при этом модель отвечает только за рассуждения и форматирование, а фактические данные поступают из API, что делает уровень галлюцинаций менее важным для данного случая использования.
Текущие проблемы с производительностью модели
В настоящее время разработчик использует DeepSeek V3.2 Reasoning и сообщает о значительных проблемах с производительностью:
- TTFT (Время до первого токена): ~70 секунд
- Скорость вывода: ~25 токенов в секунду
- Опыт потоковой передачи описан как "ужасный"
- Таймаут начала потока установлен на 75 секунд, чтобы избежать постоянных сбоев
Требования приложения
Финансовый ИИ-агент имеет две основные функции:
- Поток чата: Финансовый анализ в стиле Perplexity со встроенными ссылками на источники
- Поток проверки сделок: Торговый коуч, который выдает рекомендации GO/NO-GO/WAIT с указанием точки входа, стоп-лосса, цели и соотношения риск/прибыль
Требования к модели включают:
- Высокая производительность с низким TTFT и высокой скоростью токенов в секунду для удобства потоковой передачи
- Низкая стоимость для небольшого проекта
- Достаточный интеллект для многошаговых торговых рассуждений
- Хорошее следование инструкциям для строгих форматов вывода при проверке сделок
Рассмотрение Grok 4.1 Fast Reasoning
Разработчик рассматривает переход на Grok 4.1 Fast Reasoning на основе следующих сравнений:
- TTFT: ~15 секунд (против ~70с у DeepSeek)
- Скорость вывода: ~75 токенов в секунду (против ~25 т/с у DeepSeek)
- Оценка интеллекта AA: 64 против 57 у DeepSeek
- Стоимость ввода: $0,20 против $0,28 за миллион токенов
Другие рассматриваемые модели
Разработчик также рассматривал Minimax 2.5, Kimi K2.5, новые модели Qwen 3.5 и Gemini 3 Flash, но отмечает, что большинство из них относительно дорогие и не лучше подходят для их конкретного случая использования.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Как архитектура централизованного контекста с Claude экономит 10+ часов в неделю
Пользователь Reddit сообщает об экономии более 10 часов в неделю, перенеся стандартные операционные процедуры, заметки с совещаний и CRM в централизованное рабочее пространство Notion и подключив Claude напрямую к этому контексту. Три конкретных рабочих процесса устраняют ручное составление электронных писем, ввод данных в таблицы и создание контента.

Практическое применение OpenClaw для операций компании с одним сотрудником
Разработчик делится своим опытом использования OpenClaw для ведения компании в одиночку, отмечая, что он работает на вашем собственном компьютере в виртуальной машине или на Mac Mini и подключается к существующим инструментам. В посте говорится, что он больше всего подходит для повторяющихся задач и небольших операционных работ, а не для полностью автономного управления компанией.

Ошибка в заказе продуктов OpenClaw: путаница с единицами измерения в MCP-сервере
Пользователь передал OpenClaw свои данные кредитной карты для еженедельных покупок продуктов через MCP-сервер. После трех месяцев безупречных заказов недавно был заказан 2 кг чеснока вместо 2 головок, потому что на странице товара по умолчанию стояли килограммы.

Создание трекера увольнений в сфере ИИ с помощью Claude Cowork: Практические детали реализации
Разработчик создал живой, интерактивный трекер увольнений, который собирает и отображает компании, ссылающиеся на ИИ как на причину сокращения рабочих мест в 2026 году, используя Claude Cowork для генерации структур таблиц, отладки логики фильтров и оптимизации мобильной доступности.