Ваш агент — это не модель: объяснение разницы между Harness и Inference Service
Люди часто говорят о Claude как о едином целом, но ИИ-агент — это стек из трёх отдельных уровней. Знание разницы экономит часы отладки: когда что-то идёт не так, нужно знать, винить ли модель, сервис или логику вокруг неё.
Три уровня
- Модель — математическая функция, преобразующая входные токены в выходные. Примеры: Sonnet, Opus, Gemini.
- Сервис инференса — размещённый сервис, который запускает модель и отслеживает использование. Примеры: AWS Bedrock, API Anthropic.
- Обвязка (harness) — логика, формирующая входные данные, интерпретирующая выходные и взаимодействующая с внешним миром. Сюда входят MCP и Skills — модель не знает о них по своей сути.
Вместе система агента — это обвязка, которая вызывает сервис инференса, который запускает модель. Вот и всё.
Реальный разбор
| Агентная система | Обвязка | Сервис инференса | Модель |
|---|---|---|---|
| Claude Desktop | UI + MCP + локальная логика | Сервис инференса Anthropic | Sonnet / Opus / Haiku |
| Claude CLI | Разбор инструментов + файловый ввод/вывод | Сервис инференса Anthropic | Sonnet / Opus / Haiku |
| Cursor | Сборка контекста + маршрутизация инструментов | Инференс-слой Cursor | Sonnet / GPT / Gemini |
| Пользовательский агент LangChain | Шаблоны промптов + определения инструментов | Bedrock, OpenAI и др. | Выбранная вами модель |
Одна и та же модель (например, Sonnet) может вести себя по-разному в зависимости от обвязки — потому что обвязка формирует входы и интерпретирует выходы. Вот почему ваши промпты работают в Claude CLI, но не работают в Cursor.
Отладка с этой ментальной моделью
- Плохие ответы? Посмотрите на обвязку — возможно, она не предоставляет достаточно контекста.
- Слишком медленно или дорого? Проверьте сервис инференса — цена и производительность находятся там.
- Неожиданный вывод? Модель ошибается или обвязка подаёт ей мусор?
В статье также отмечается, что по мере того как модели становятся умнее, некоторая логика обвязки (например, MCP или Skills) может устареть — так что то, как мы сейчас строим обвязки, может не пережить время.
В следующий раз, когда вы скажете «моя модель сделала X», остановитесь и спросите: это была модель или обвязка, которая ею управляла?
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Настройка и тестирование vLLM на сервере с 10x NVIDIA V100 и 320 ГБ видеопамяти
Юрист, создающий локальный сервер ИИ для юридической работы, делится результатами тестирования vLLM на 10x Tesla V100 SXM2 32GB GPU, подробно описывая, что работает (FP16 без квантования, bitsandbytes 4-бит) и что не работает (GPTQ, AWQ, FlashAttention2) на архитектуре Volta.

OpenClaw 102: Обновленные рекомендации по настройке для безопасности и эффективности
Пользователь Reddit делится обновленными рекомендациями по настройке OpenClaw, включая шифрование API-ключей с помощью скриптов Windows PowerShell, защиту от инъекций промптов в AGENTS.md, использование Tailscale для удаленного доступа и правила против зацикливания для предотвращения повторяющихся сбоев.

OpenClaw Memory Journey: Встроенный поиск против MemPalace для мгновенного воспроизведения сессий
Разработчик тестирует встроенный memorySearch, QMD и MemPalace на Intel Mac. Индексация в реальном времени дает сбои; в итоге выбрана стратегия раздельного извлечения с переиндексацией по cron.

Масштабирование агентного кодирования до 150+ PR в неделю: уроки от $85K токенов в Lovable
Александр Лебедев рассказывает, как он масштабировал процесс с 20–30 PR в неделю с одним человеком до 150+ PR в неделю с роем ИИ-агентов, потратив $85K на токены с января. Ключевые уроки: классификация рисков, замена ручного код-ревью на ИИ и проблема сохранения распространения знаний.