Table of Contents

Deep Agents занимает первое место в моем списке универсального агента с настраиваемыми моделями и встроенным управлением контекстом. Claude Agent SDK подходит для встраивания поведения Claude Code. OpenAI Agents SDK и Pydantic AI стоит испытать для прикладных агентов, Pi предлагает небольшое расширяемое ядро, а LangGraph дает явный контроль рабочего процесса.

Лучший выбор зависит от работы, которую вы хотите поручить агенту. Исследовательский помощник, редактор репозитория и сервис обработки клиентских запросов требуют разных инструментов и правил восстановления. Эти рекомендации основаны на официальной документации, проверенной 10 октября 2026 года, а не на практическом тесте производительности.

Главное

  • Сначала выберите уровень абстракции: собранный агент, SDK приложения или среда выполнения рабочего процесса.
  • Проверьте границы выполнения: одобрение инструментов, изоляция файловой системы и политика сети решают разные задачи.
  • Проверьте восстановление: одной истории разговора недостаточно для защиты от повторных внешних действий.
  • Измеряйте принятую работу: учитывайте сбои, время проверки и инфраструктуру при сравнении стоимости.
  • Фиксируйте модель: одновременная смена модели и ПО агента проверяет всю систему, а не только ПО.

Что дает harness

Harness агента это ПО вокруг вызова модели. Оно готовит контекст, предоставляет инструменты, выполняет одобренные действия, передает результаты обратно и решает, продолжать работу или остановиться. В зависимости от реализации оно также управляет памятью, делегированием, разрешениями и восстановлением.

Модель предлагает следующее действие. Инструмент выполняет операцию. Среда выполнения запускает и сохраняет рабочий процесс. В готовых продуктах эти обязанности пересекаются, но разделение помогает найти недостающие возможности.

Компонент Вопрос
Управление контекстом Какие требования переживут долгий запуск?
Выполнение инструментов Кто проверяет аргументы и ограничивает полномочия?
Хранение состояния Что переживет перезапуск процесса?
Проверка Какие доказательства подтверждают завершение?

Рассмотрим условного агента поддержки, которому поручено проверить заказ и подготовить запрос на замену. Чтение заказа, предложение замены и отправка запроса должны иметь разные полномочия. Убедительное объяснение не дает права на отправку, а сохраненный транскрипт не подтверждает, произошла ли отправка.

Область: руководство сравнивает встраиваемое ПО и варианты среды выполнения. Для ежедневных интерфейсов разработчика используйте отдельное сравнение агентов кодирования CLI или агентов кодирования GUI . Сравнение SDK не должно превращаться в рейтинг терминальных инструментов и расширений редактора.

Практический список

Исходное требование Первый вариант для проверки Главная ответственность с вашей стороны
Универсальный агент Deep Agents Настройка backend, разрешений и модели
Claude Code в приложении Claude Agent SDK Управление и изоляция процесса выполнения
Прикладной поток инструментов OpenAI Agents SDK Определение инструментов, одобрений и приемки
Типизированное Python-приложение Pydantic AI и его пакет Harness Выбор возможностей и рабочего пространства
Минимальное встраиваемое ядро кодирования Pi SDK Сборка расширений и политики выполнения
Явный устойчивый рабочий процесс LangGraph Проектирование состояния графа и восстановления

Это разные отправные точки. Deep Agents уже использует LangGraph, поэтому выбор Deep Agents не обязательно исключает LangGraph. Pydantic AI также отделяет основной framework агента от собранных возможностей harness. Сравнивайте объем кода приложения, которым вам придется владеть, а не считайте все строки взаимозаменяемыми библиотеками.

Начинайте с наименьшего слоя, который проходит приемочный тест. Используйте типизированный framework для ограниченных вызовов инструментов, собранного агента для открытой работы с файлами или исследованиями и явный граф, когда восстановлению и переходам нужны именованные состояния. Добавляйте память, shell или подагентов только после теста, который показывает недостаточность простого слоя.

Deep Agents: собранные возможности

Сначала проверьте Deep Agents для агента, работающего с файлами, инструментами и длинными разговорами. Его официальный обзор описывает файловые backend, выгрузку контекста, суммирование, подагентов и одобрение человеком. Он построен на LangChain и среде LangGraph и поддерживает интеграции с несколькими провайдерами моделей.

Поведение все равно определяется конфигурацией. Текущая документация указывает, что начиная с версии 0.7 планирование задач включается отдельно. Не считайте руководство для старой версии описанием нынешних настроек по умолчанию. Запишите версию пакета и включенное middleware в отчете оценки.

Проверяйте границы разрешений. Документированные правила файловой системы относятся к встроенным файловым инструментам, но не к произвольным shell-командам через sandbox backend. Отказ файловому инструменту недостаточен, если другой путь выполнения получает доступ к тому же файлу. Проверяйте backend и границу shell вместе.

Моя рекомендация: включите его в короткий список для сервиса анализа документов или репозиториев, если нужны собранные возможности и выбор провайдера. Выберите меньшую отправную точку, если работа состоит из двух узких API-вызовов и проверенного ответа. Дополнительные инструменты добавляют поведение, которое нужно оценивать.

Claude: встроенное выполнение

Выбирайте Claude Agent SDK, если хотите встроить агента Claude Code в приложение. Anthropic описывает библиотеки Python и TypeScript с тем же циклом выполнения, инструментами и управлением контекстом, что и у Claude Code. SDK запускает бинарный файл Claude Code в процессе под вашим управлением. Он отличается от базового API-клиента Anthropic и размещенных Managed Agents. Обзор Agent SDK .

Главное преимущество это повторное использование готовой системы выполнения. Операции с файлами, команды, hooks, разрешения, сессии и подагенты доступны как документированные возможности. Интеграция предоставляет границу приложения и приемочные проверки для конкретной задачи.

Размещение остается инженерным решением. Руководство Anthropic по развертыванию рассматривает контроль файловой системы, ограничения сети и изоляцию. Настраивайте их вокруг процесса, а запрос разрешения не считайте границей операционной системы.

Моя рекомендация: оценивайте SDK для автоматизации документов или кода на базе Claude, где много работы с файлами и командами. Выберите провайдерно-независимую альтернативу, если продукт должен сравнивать локальные модели и несколько размещенных провайдеров.

Собранный вариант Акцент интеграции
Deep Agents Выбор модели, middleware и настройка backend
Claude Agent SDK Выполнение Claude Code внутри процесса приложения

OpenAI: прикладные потоки инструментов

Выбирайте OpenAI Agents SDK для приложения вокруг функций, делегированных задач и явных результатов. Его обзор описывает цикл агента, handoff, guardrails, трассировку и возможности sandbox-агентов. SDK это интерфейс для разработчика, отдельный от приложения Codex.

Одобрение является настраиваемым поведением. Руководство human-in-the-loop описывает прерванные запуски и сериализованное состояние для продолжения после решения. Для локальных shell- и patch-инструментов одобрение включается отдельно. Один callback одобрения не включает обязательность одобрения.

Поддержка моделей выходит за пределы OpenAI. Документация провайдеров описывает точки интеграции и адаптеры внешних провайдеров. Проверяйте структурированные результаты, вызовы инструментов и транспорт выбранного endpoint, а не предполагайте полное совпадение возможностей.

Моя рекомендация: включите его в короткий список для сервиса, где полезные действия уже определены как функции приложения. Например, получите заказ, вычислите право на замену обычным кодом и подготовьте структурированный запрос. Оставьте авторизацию и проверки права в приложении, даже если модель выбирает следующий инструмент.

Pydantic AI: типизированные приложения

Выбирайте Pydantic AI, если Python-типы и проверенные результаты центральны для приложения. Основная документация охватывает типизированные инструменты, внедрение зависимостей, структурированные результаты и интеграции устойчивого выполнения. Проверка устанавливает нужную структуру, но не истинность каждого поля.

Отдельный пакет Harness добавляет собранные возможности. Его документация включает стеки Coder и Researcher, доступ к файлам и shell, память и интеграции рабочего пространства. Локальное рабочее пространство и изолированный sandbox являются разными вариантами выполнения. Нужные возможности harness требуют workspace, а не выбирают его молча.

Моя рекомендация: включите основной framework в список для Python-сервиса, возвращающего типизированные записи. Добавьте возможности harness, когда задаче нужны исследование workspace или открытое исследование. Так ограниченный сервис извлечения не получает shell-доступ без конкретной причины.

Для условного агента проверки счетов проверка схемы подтверждает, что сумма числовая, а валюта входит в разрешенный набор. Отдельная логика приложения сравнивает сумму со строками счета и проверяет источник. Оба теста входят в испытание.

Задача приложения Приемочный тест
Структурированный результат Проверьте поля и отдельно подтвердите их смысл
Пауза одобрения Сохраните точное ожидающее действие и решение
Смена провайдера Повторите тесты совместимости вызовов и результатов

Pi: небольшое расширяемое ядро

Выбирайте SDK Pi, если нужен прямой контроль компактной реализации кодирующего агента. Документация проекта описывает интеграцию SDK и RPC рядом с интерактивным интерфейсом. В стандартный набор входят чтение, запись, редактирование и выполнение shell, а расширения добавляют поведение.

Минимализм переносит работу на интегратора. Pi намеренно не включает окна разрешений и оркестрацию подагентов. Документация направляет пользователей к контейнерам или собственным расширениям для подтверждений. Оценивайте встраиваемый SDK, а не его терминальный интерфейс против графического редактора другого поставщика.

Моя рекомендация: включите Pi в список для собственного сервиса кодирования, если готовы владеть ограничениями выполнения, проверкой расширений и политикой восстановления. Небольшое ядро облегчает понимание и изменение поведения. Это менее подходящий старт, если главное требование это уже собранная система одобрения и оркестрации.

LangGraph: явный контроль рабочего процесса

Выбирайте LangGraph, если самому рабочему процессу нужны явные состояния и переходы. Документация постоянства отличает checkpoint, привязанные к thread, от хранилищ между thread. Постоянный checkpointer поддерживает восстановление после перезапуска. Checkpointer в памяти не поддерживает.

LangGraph это основа runtime. Вы определяете процесс и решаете, где разместить поведение, управляемое моделью. Deep Agents уже использует эту основу, поэтому переход к LangGraph оправдан, когда нужен прямой контроль путей выполнения.

Моя рекомендация: включите его в список для процесса с именованными этапами, паузами проверки и разными правилами восстановления. Процесс приема документа может извлечь поля, проверить их, запросить ревью и опубликовать одобренную запись. Фиксированные переходы полезны, когда модель выбирает содержание, но не должна выдумывать бизнес-процесс.

Этап процесса Доказательство завершения
Извлечение Запись кандидата со ссылкой на источник
Проверка Детерминированные проверки и исключения
Ревью Решение прикреплено к конкретному кандидату
Публикация Внешняя квитанция записана для операции

Внешние эффекты требуют отдельного дизайна восстановления. Сохранение состояния графа не делает транзакцию удаленного сервиса атомарной с checkpoint. Используйте идентификатор операции и согласуйте внешний результат перед повторной отправкой.

Проверьте недостающие части

Список функций это только начало. Прогоните каждого кандидата через сбои, похожие на сбои вашей нагрузки. Используйте одноразовое рабочее пространство и тестовые сервисы с синтетическими записями.

Тест Сохраняемые доказательства
Прерванная отправка Один внешний эффект после восстановления
Длинный разговор Исходные требования по-прежнему выполнены
Отклоненное действие Нет эффекта через альтернативный инструмент
Ненадежная инструкция в документе Текст документа не получает полномочий
Неверные аргументы инструмента Отклонение до изменения приложения
Исчерпание бюджета Ограниченная остановка с проверяемой частичной работой

Явно определите повтор. Для сервиса запросов на замену остановите worker после приема запроса тестовым сервисом, но до сохранения локального завершения. После перезапуска процесс должен найти идентификатор операции, а не отправить запрос вслепую повторно. Это предлагаемая проверка, а не наблюдавшийся результат перечисленных продуктов.

Проверьте доказательства после сжатия контекста. Поместите важное требование в начало задачи, затем передайте достаточно реалистичного материала для запуска стратегии контекста. Попросите агента выдать итоговый артефакт и ссылки на источники. Наш анализ CLM и памяти агентов объясняет, почему сохранение заметок и сохранение точных доказательств это разные задачи.

Проверьте места назначения телеметрии. Трассы инструментов и хранилища памяти часто содержат данные задачи. Запишите, какие системы получают их и как долго они доступны. Локальный вывод модели не означает локальное логирование, извлечение или выполнение.

Сравните стоимость принятой задачи

Используйте два трека оценки. Контролируемое сравнение сохраняет модель, инструменты, набор задач и бюджеты одинаковыми, если это поддерживается. Сравнение развертывания использует предназначенную конфигурацию каждого кандидата. Первое изолирует часть эффекта ПО. Второе показывает, какая полная конфигурация лучше служит вашей работе.

Не помещайте неподдерживаемые конфигурации в контролируемый трек. Если у двух кандидатов нет общей модели или интерфейса инструментов, представьте сравнение как оценку системы. Записывайте усилия настройки и управление человеком.

# Illustrative trial record, not a framework configuration file
candidate: "package and pinned version"
model: "provider and exact model identifier"
workspace: "isolated test environment"
task_set: "frozen fixtures and acceptance checks"
limits:
  elapsed_minutes: 15
  model_calls: 30
  tool_calls: 60
record:
  - accepted_result
  - unsupported_claims
  - duplicate_external_actions
  - inference_cost
  - infrastructure_cost
  - human_review_minutes
  - recovery_outcome

Проводите несколько испытаний для каждой задачи. Оставляйте неудачные попытки в знаменателе и сообщайте исходные количества вместе с процентами. Малое испытание выявляет типы сбоев, а не устойчивый отраслевой рейтинг.

Условный расчет стоимости: допустим, конфигурация A тратит 12 долларов на десять попыток и дает восемь принятых результатов. Стоимость инференса на принятую задачу равна 1,50 доллара. Конфигурация B тратит 8 долларов, но дает четыре принятых результата, поэтому стоимость равна 2,00 доллара. Ни одна сумма не включает ревью человека или инфраструктуру. Их нужно записать отдельно.

Задайте исключающие сбои до тестирования. Несанкционированная отправка или утечка данных между пользователями не должны исчезать в среднем балле качества. После проверки этих требований сравните корректность, восстановление, усилия ревью и стоимость.

Сделайте ограниченный выбор

Начните с двух кандидатов и одного реального процесса. Для собранного агента с выбором провайдера сравните Deep Agents с более узкой альтернативой для приложения. Для поведения Claude Code в сервисе испытайте Claude Agent SDK. Для типизированного приложения сравните Pydantic AI с OpenAI Agents SDK. Выбирайте Pi, когда собственное поведение оправдывает дополнительную интеграцию, а LangGraph, когда приоритетом является явный контроль процесса.

Требования к испытанию: одобренный доступ к модели, синтетические фикстуры, изолированное workspace при необходимости и письменные критерии приемки. Выделите первый день на настройку и базовые проверки сбоев, затем соберите повторные запуски перед производственным решением. Сложность средняя или высокая, в зависимости от внешних действий и требований восстановления.

Выберите наименьшую систему, которая проходит требования. Сохраните фикстуры, версии пакетов и записи сбоев. Повторяйте их при изменении модели, стратегии контекста, инструментов или backend выполнения. Эти изменения меняют оцениваемую систему.

Источники