Ваш агент — это не модель: объяснение разницы между Harness и Inference Service
Люди часто говорят о Claude как о едином целом, но ИИ-агент — это стек из трёх отдельных уровней. Знание разницы экономит часы отладки: когда что-то идёт не так, нужно знать, винить ли модель, сервис или логику вокруг неё.
Три уровня
- Модель — математическая функция, преобразующая входные токены в выходные. Примеры: Sonnet, Opus, Gemini.
- Сервис инференса — размещённый сервис, который запускает модель и отслеживает использование. Примеры: AWS Bedrock, API Anthropic.
- Обвязка (harness) — логика, формирующая входные данные, интерпретирующая выходные и взаимодействующая с внешним миром. Сюда входят MCP и Skills — модель не знает о них по своей сути.
Вместе система агента — это обвязка, которая вызывает сервис инференса, который запускает модель. Вот и всё.
Реальный разбор
| Агентная система | Обвязка | Сервис инференса | Модель |
|---|---|---|---|
| Claude Desktop | UI + MCP + локальная логика | Сервис инференса Anthropic | Sonnet / Opus / Haiku |
| Claude CLI | Разбор инструментов + файловый ввод/вывод | Сервис инференса Anthropic | Sonnet / Opus / Haiku |
| Cursor | Сборка контекста + маршрутизация инструментов | Инференс-слой Cursor | Sonnet / GPT / Gemini |
| Пользовательский агент LangChain | Шаблоны промптов + определения инструментов | Bedrock, OpenAI и др. | Выбранная вами модель |
Одна и та же модель (например, Sonnet) может вести себя по-разному в зависимости от обвязки — потому что обвязка формирует входы и интерпретирует выходы. Вот почему ваши промпты работают в Claude CLI, но не работают в Cursor.
Отладка с этой ментальной моделью
- Плохие ответы? Посмотрите на обвязку — возможно, она не предоставляет достаточно контекста.
- Слишком медленно или дорого? Проверьте сервис инференса — цена и производительность находятся там.
- Неожиданный вывод? Модель ошибается или обвязка подаёт ей мусор?
В статье также отмечается, что по мере того как модели становятся умнее, некоторая логика обвязки (например, MCP или Skills) может устареть — так что то, как мы сейчас строим обвязки, может не пережить время.
В следующий раз, когда вы скажете «моя модель сделала X», остановитесь и спросите: это была модель или обвязка, которая ею управляла?
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Сократите затраты на токены на 95% с помощью семи техник оптимизации OpenClaw
Подробное руководство, описывающее семь методов снижения потребления токенов AI-агентами на 95%+, включая древовидные загрузочные файлы, автосжатие AI, перенос задач на локальную модель и фоновые задачи CPU по расписанию.

Проект OpenClaw: Операционная система для управления несколькими проектами (фреймворк)
Фреймворк, который изолирует проекты с помощью стандартизированных директорий, использует cron для автоматизации вместо агентов для предсказуемых задач и реализует обязательные протоколы резервного копирования для снижения расхода токенов и повышения согласованности выполнения.

Обходной путь в iOS Shortcuts для отправки фотографий с iPhone в Cowork через синхронизацию iCloud
Разработчик создал iOS-ярлык под названием "PhoPo", который преобразует фотографии с iPhone в JPEG, изменяет их размер и сохраняет в папку, синхронизируемую через iCloud, доступную для Cowork, что позволяет Claude анализировать скриншоты и фотографии с мобильных устройств.

Создание полностью локального мультиагентного ассистента с OpenClaw и Ollama
Разработчик делится своим стеком для полностью локального персонального AI-ассистента с использованием OpenClaw и Ollama, включая модели qwen3.5:35b-a3b, gemma3:4b, mistral:7b, MCP-серверы для Home Assistant и Gmail, а также интерфейс Telegram Bot.