Сравнительный обзор быстрого вывода LLM от Anthropic и OpenAI

Антропик и OpenAI недавно представили функции 'быстрого режима', чтобы повысить скорость вывода своих языковых моделей. Эти режимы предлагают значительно улучшенные показатели токенов в секунду при взаимодействии с их кодирующими моделями, но сильно различаются по подходу и возможностям.
Ключевые детали
Быстрый режим Антропика обеспечивает до 2,5 раз больше токенов в секунду, с увеличением с 65 токенов Opus 4.6 до около 170. Это улучшение достигается за счет приоритета вывода с малым размером пакета. Однако необходимо учитывать, что это требует больших затрат (в шесть раз больше) для более быстрых ответов, так как уменьшенный размер пакета позволяет быстрее обрабатывать данные, подобно автобусной системе, которая уходит немедленно, не дожидаясь заполнения, хотя этот режим все же работает на самой модели Opus 4.6.
С другой стороны, OpenAI демонстрирует заметно другой подход, достигая более 1000 токенов в секунду, что в 15 раз превышает предыдущую скорость базовой модели GPT-5.3-Codex в 65 токенов в секунду. Это достигается с помощью их новой модели GPT-5.3-Codex-Spark, которая специально разработана для скорости с использованием чипов Cerebras. Эти чипы, отличающиеся крупным размером (70 квадратных дюймов по сравнению с одним квадратным дюймом типичного H100), обеспечивают вычисления с очень низкой задержкой, помещая целые модели в свою значительную внутреннюю память.
Хотя система OpenAI предлагает значительное преимущество в скорости функционирования полностью в памяти с минимальными задержками потоковой передачи данных, это происходит с компромиссом по возможности модели. GPT-5.3-Codex-Spark, несмотря на свою скорость, менее способна, чем ее стандартный аналог, особенно когда речь идет о выполнении более сложных задач или вызовах инструментов.
Для кого это
Это сравнение особенно актуально для разработчиков, оптимизирующих производительность AI-систем, и оценивает ключевые аспекты для тех, кто рассматривает скорость против возможностей.
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также

OpenBridge: Бесплатный открытый удаленный контроль для Claude Code через Slack/Discord
OpenBridge — это бесплатный инструмент с открытым исходным кодом, который позволяет управлять Claude Code из Slack или Discord, организуя проекты как каналы, а обсуждения — как ветки. Он работает локально или на VPS и совместим с существующими подписками Claude Code/Codex без дополнительных плат за API.

Chat Saver CG: Браузерное расширение, созданное с помощью Claude, экспортирует беседы с 12 платформ ИИ
Разработчик создал Chat Saver CG — расширение для браузера, которое экспортирует и переносит диалоги между Claude, ChatGPT, Gemini и 9 другими ИИ-платформами, активно используя Claude в процессе разработки, включая принятие архитектурных решений, отладку проблем с парсингом DOM и написание адаптерной логики.

Manifest добавляет поддержку планов токенов MiniMax с моделью M2.7
Manifest, открытый маршрутизирующий слой для OpenClaw, теперь поддерживает тарифные планы MiniMax от $10/месяц. Новая модель MiniMax M2.7 специально обучена для рабочих процессов OpenClaw и набирает 62.7 балла на MM-ClawBench и 56.2 на SWE-Bench Pro.

Инструмент Depct собирает данные во время выполнения, чтобы помочь Claude в отладке проблем в производственной среде.
Depct — это инструмент, который собирает данные инструментирования среды выполнения из приложений Node.js, строит на их основе графы и передаёт их Claude через AWS Bedrock, чтобы помочь в отладке периодических сбоев в продакшене. Он также генерирует архитектурные диаграммы и карты зависимостей на основе поведения в среде выполнения.