Результаты PinchBench: Первый эталонный тест для ИИ-агентов кодирования, специфичных для OpenClaw

✍️ OpenClawRadar📅 Опубликовано: 8 марта 2026 г.🔗 Source
Результаты PinchBench: Первый эталонный тест для ИИ-агентов кодирования, специфичных для OpenClaw
Ad

PinchBench — это первый бенчмарк, специально разработанный для оценки ИИ-агентов, пишущих код, в экосистеме OpenClaw, который ранжирует модели по проценту успешных решений, стоимости и скорости.

Ключевые результаты

Бенчмарк протестировал 32 модели. Лучшие по проценту успешных решений:

  • 1. google/gemini-3-flash-preview: 95,1% успеха, стоимость $0,72, скорость 254,50с
  • 2. minimax/minimax-m2.1: 93,6% успеха, стоимость $0,14, скорость 239,79с
  • 3. moonshotai/kimi-k2.5: 93,4% успеха, стоимость $0,20, скорость 291,67с
  • 4. anthropic/claude-sonnet-4.5: 92,7% успеха, стоимость $3,07, скорость 304,53с
  • 5. google/gemini-3-pro-preview: 91,7% успеха, стоимость $1,48, скорость 239,55с
Ad

Примечательные выводы

  • Flash-модели превосходят Pro-модели при меньшей стоимости: Gemini-3-Flash-Preview (95,1%, $0,72) обходит Gemini-3-Pro-Preview (91,7%, $1,48)
  • Более дорогие модели не обязательно работают лучше
  • Minimax 2.5 занял 31-е место с 35,5% успеха, скорость 105,96с (стоимость не указана)
  • Несколько моделей показывают высокий процент успеха выше 90%, сохраняя стоимость ниже $1

Диапазон производительности

Процент успешных решений варьируется от 95,1% (верх) до 35,2% (низ). К экономичным вариантам относятся:

  • openai/gpt-5-nano: 85,8% успеха за $0,03
  • google/gemini-2.5-flash-lite: 83,2% успеха за $0,05
  • mistralai/devstral-2512: 81,7% успеха за $0,10

Несколько моделей в нижней части рейтинга (позиции 23-32) показывают процент успеха около 40% или ниже, при этом стоимость не указана в предоставленных данных.

📖 Read the full source: r/openclaw

Ad

👀 Смотрите также

Сервер MCP cortex-engine добавляет поддержку постоянной памяти и многозадачных агентов.
Инструменты

Сервер MCP cortex-engine добавляет поддержку постоянной памяти и многозадачных агентов.

cortex-engine v0.4.0 — это open-source MCP-сервер, который предоставляет AI-агентам постоянную долговременную память с такими инструментами, как observe(), query(), believe() и dream(). Теперь он поддерживает несколько агентов с изолированными пространствами имён памяти.

OpenClawRadar
Крэг: Инструмент с открытым исходным кодом создает единые правила для ИИ-агентов на основе конфигураций проектов.
Инструменты

Крэг: Инструмент с открытым исходным кодом создает единые правила для ИИ-агентов на основе конфигураций проектов.

Crag — это компилятор с открытым исходным кодом, который анализирует конфигурации проекта, генерирует единый файл governance.md, а затем компилирует его в несколько файлов правил для ИИ-агентов, чтобы предотвратить расхождение конфигураций в таких инструментах, как Claude Code, Cursor и Copilot.

OpenClawRadar
Холисто Сид: Локальная структура LLM с постоянной идентичностью и консенсусной консолидацией памяти
Инструменты

Холисто Сид: Локальная структура LLM с постоянной идентичностью и консенсусной консолидацией памяти

Holisto Seed — это фреймворк реляционной индивидуации, который предоставляет LLM-агентам постоянную идентичность, биографическую память и коэволюционные отношения с пользователями. Он работает полностью локально с системой версионирования на основе Git и включает согласованный цикл сна для консолидации памяти.

OpenClawRadar
Kontext CLI: Брокер учетных данных для AI-агентов программирования
Инструменты

Kontext CLI: Брокер учетных данных для AI-агентов программирования

Kontext CLI — это брокер учетных данных на основе Go, который предоставляет AI-агентам для программирования кратковременные токены доступа вместо долгоживущих API-ключей. Он использует обмен токенами по RFC 8693, передает аудит-логи для каждого вызова инструмента и уже работает с Claude Code.

OpenClawRadar