Агентный поиск с дополненной генерацией (Agentic RAG): применение в корпоративном ИИ
Оставить заявку

Агентный поиск с дополненной генерацией (Agentic RAG): что это такое и какую роль он играет в корпоративном ИИ

Большие языковые модели (Large Language Model – LLM) хорошо справляются с обобщением информации, но значительно хуже – с доступом к знаниям. Спросите: «Какая у нас была выручка вчера?», и базовая большая языковая модель (LLM) столкнётся с ограничением своих знаний, после чего может уверенно выдать предположение. Поиск с дополненной генерацией (Retrieval-Augmented Generation – RAG) частично решил эту проблему, предоставив доступ к релевантной информации для формирования более точных ответов. Тем не менее базовая архитектура поиска с дополненной генерацией (RAG) по-прежнему испытывает трудности, когда запросы неоднозначны, состоят из нескольких этапов или требуют работы с данными из разных систем.

Агентный поиск с дополненной генерацией (Agentic RAG) устраняет этот недостаток, дополняя архитектуру поиска с дополненной генерацией (RAG) агентами ИИ, благодаря чему система может планировать действия: определять, какие данные получить, откуда их извлечь, как проверить результаты и когда выполнить повторный поиск. Иными словами, подход развивается от схемы «поиск + обобщение» к схеме «рассуждение + действие». Специалисты Cronit по искусственному интеллекту разбирают этот подход и делятся практическими рекомендациями по внедрению агентных архитектур поиска с дополненной генерацией.

Краткий обзор: что такое поиск с дополненной генерацией (RAG) и в чём его ограничения

Поиск с дополненной генерацией (Retrieval-Augmented Generation, RAG) – это архитектура, которая позволяет языковой модели получать необходимую информацию из внешних источников знаний. Вместо того чтобы формировать ответ исключительно на основе собственной внутренних знаний модели, модель с поддержкой поиска с дополненной генерацией (RAG) направляет запрос в компонент поиска информации. Затем релевантные данные, полученные из документов, внутренних данных компании или специализированных наборов данных, передаются генератору – второму компоненту поиска с дополненной генерацией (RAG), который объединяет их со знаниями модели для формирования ответа.

Архитектура технологии RAG

Таким образом, поиск с дополненной генерацией (RAG) позволяет большим языковым моделям (LLM) формировать ответы на основе актуальных данных.

При типичной реализации поиска с дополненной генерацией (RAG) для одного приложения, например чат-бота службы поддержки клиентов, вся информация хранится в одной векторной базе данных. Как поиск информации, так и генерация ответов выполняются исключительно в рамках этого хранилища. В подобных случаях, когда все необходимые знания уже собраны в одном месте, простая схема «поиск → генерация ответа» становится самым быстрым и экономичным способом внедрения решения в промышленную эксплуатацию.

Ограничения традиционного поиска с дополненной генерацией (RAG)

Хотя системы поиска с дополненной генерацией (RAG) отлично справляются с простыми и однозначными вопросами, задачи, требующие сложных рассуждений, по-прежнему могут вызывать у модели так называемые галлюцинации. Это связано с рядом ограничений:

  • Ограниченные возможности многоэтапного анализа. Хотя большие языковые модели (LLM) используют поиск с дополненной генерацией (RAG) для получения дополнительной информации, одного поиска недостаточно для объединения пересекающихся или противоречивых фактов из разных источников данных. Запросы, выходящие за рамки одного факта (или сформулированные иначе, чем представлены данные в базе знаний), часто выявляют пробелы или противоречия.
  • Статический одноэтапный поиск. Информация, найденная компонентом поиска, напрямую используется для формирования ответа. Если она окажется неверной или устаревшей, система не сможет автоматически обнаружить проблему.
  • Ограниченная прослеживаемость источников. Ссылки на источники не формируются автоматически и не всегда надёжны, поскольку большая языковая модель (LLM) может перефразировать, объединять или игнорировать части извлечённой информации.
  • Ограничения контекстного окна. В системе поиска с дополненной генерацией (RAG) найденные документы передаются модели вместе с запросом пользователя. Если таких документов слишком много или они слишком объёмны, может быть превышен размер контекстного окна, из-за чего часть информации будет отброшена или проигнорирована.

Что такое агентный поиск с дополненной генерацией (Agentic RAG) и как он работает?

Когда стандартная архитектура поиска с дополненной генерацией (RAG) дополняется различными типами агентов искусственного интеллекта, она превращается в агентный поиск с дополненной генерацией (Agentic RAG). Память агентов, механизмы планирования и многоэтапной обработки, а также принятие решений с учётом контекста повышают эффективность архитектуры поиска с дополненной генерацией (RAG), благодаря чему система вызывает внешние инструменты не только по заранее заданным правилам, но и на основе промежуточного анализа задачи.

Таким образом, вместо простого извлечения документов и передачи их модели без дополнительного анализа после поступления запроса система проходит несколько этапов:

  1. Предварительная обработка запроса

Перед выполнением поиска агенты планирования запросов, с помощью методов обработки естественного языка, уточняют неоднозначные запросы, дополняют их синонимами, связанными терминами или контекстом, разбивают сложные запросы на более простые подзапросы и добавляют контекст сеанса или метаданные для повышения точности поиска.

  1. Маршрутизация и поиск информации

Агенты маршрутизации определяют, какие источники знаний и внешние инструменты (векторные базы данных, базы данных SQL, калькуляторы, программные интерфейсы приложений (API), поиск в интернете и другие) следует использовать для обработки пользовательского запроса. После этого агенты поиска информации ранжируют документы и фрагменты по степени релевантности, удаляют дубликаты, группируют схожий контент и объединяют сведения из нескольких источников для формирования согласованного контекста.

  1. Многоэтапная обработка полученного контекста

Агенты анализа выполняют более сложные операции над найденными фрагментами данных: ранжирование, кластеризацию и объединение информации из нескольких документов вместо прямой передачи исходного контекста модели. Это снижает уровень шума и количество противоречий, благодаря чему ответы становятся более обоснованными и надёжными.

  1. Проверка и контроль

Агенты проверки выполняют проверку согласованности данных, проверку источников, оценку достоверности и другие процедуры контроля качества, чтобы отфильтровать и уточнить полученный контекст до его использования при формировании ответа. Это снижает риск возникновения галлюцинаций и повышает фактическую достоверность результатов.

  1. Управление формированием ответа

Чтобы итоговый ответ представлял собой не просто набор найденных данных, а целостный ответ с учётом контекста, использующий несколько источников информации и минимизирующий противоречия или галлюцинации, агенты управляют процессом формирования ответа большой языковой моделью (LLM). Они определяют структуру ответа (краткое изложение, пошаговое объяснение, маркированный список), выбирают наиболее важные подтверждающие данные и при необходимости инициируют дополнительный поиск информации.

Таким образом, после интеграции агентов в процессы поиска и генерации многие ограничения традиционного поиска с дополненной генерацией (RAG), о которых говорилось ранее, существенно ослабевают.

Стоит отметить, что распределение функций между интеллектуальными агентами является архитектурным решением. Некоторые реализации агентного поиска с дополненной генерацией (Agentic RAG) используют одного агента, который последовательно выполняет планирование, поиск информации, рассуждение и проверку результатов. Такой подход называется одноагентной системой поиска с дополненной генерацией (RAG). Он упрощает архитектуру и облегчает её сопровождение, однако уступает мультиагентным системам по уровню модульности и возможностям параллельной обработки. В мультиагентных системах используется группа специализированных агентов, каждый из которых отвечает за определённую функцию в рамках процесса обработки запроса. Как правило, именно сложность задачи определяет необходимое количество задействованных агентов.

Например, в службе поддержки клиентов на вопрос вроде «Как сбросить пароль, если я потерял доступ к электронной почте?» достаточно ответа из одной базы знаний, поэтому одноагентная система успешно справится с такой задачей. Однако если запрос становится более сложным, затрагивает несколько систем или содержит несколько требований одновременно, например: «В прошлом месяце с меня дважды списали оплату за подписку, и мне также необходимо изменить платёжный адрес. Можете помочь решить эту проблему и сообщить, когда поступит возврат средств?», – одного агента уже может быть недостаточно. В таких случаях мультиагентная система способна распределить задачи между специализированными агентами, обработать каждый аспект запроса отдельно и предоставить клиенту более точный и полный ответ.

Сравнение традиционного и агентного поиска с дополненной генерацией (RAG)

Оба подхода улучшают качество ответов больших языковых моделей (LLM), однако делают это по-разному. Если классический поиск с дополненной генерацией (RAG) обеспечивает линейный доступ к внешним источникам знаний, то агентный поиск с дополненной генерацией (Agentic RAG) работает динамически благодаря тому, что агенты способны самостоятельно выполнять различные задачи. Агентный поиск с дополненной генерацией (RAG) стал следующим логическим этапом развития архитектуры поиска с дополненной генерацией, позволяющим преодолеть многие ограничения традиционного подхода. Ниже приведено сравнение этих двух технологий.
Возможности Традиционный поиск с дополненной генерацией (RAG) Агентный поиск с дополненной генерацией (Agentic RAG)
Предварительная обработка запроса (агент самостоятельно уточняет, расширяет и адаптирует исходный запрос пользователя для последующего поиска информации) +
Доступ к нескольким источникам данных и внешним инструментам (система векторного поиска, поиск в интернете, калькуляторы, программные интерфейсы приложений (API)) +
Многоэтапный поиск информации (рассуждение агента → поиск → оценка результатов → уточнение → повторный поиск → генерация ответа) +
Проверка достоверности найденной информации (агент проверяет и фильтрует найденные данные до их передачи генератору) +

Преимущества агентного поиска с дополненной генерацией (Agentic RAG) для корпоративного ИИ

Главным преимуществом агентного поиска с дополненной генерацией (Agentic RAG) является высокая точность ответов, которая расширяет возможности корпоративного ИИ и позволяет переходить от простых вопросов к сложным запросам, требующим глубокого анализа и высокой достоверности результатов. Такие возможности выходят далеко за рамки того, что способны обеспечить традиционный поиск с дополненной генерацией (RAG) или базовые большие языковые модели (LLM) без технологий RAG. Это достигается благодаря повторному самостоятельному поиску информации, динамическому объединению структурированных и неструктурированных данных, автономному использованию инструментов и встроенным механизмам проверки.

Кроме того, агентный поиск с дополненной генерацией (Agentic RAG) легко масштабируется. Без перестройки инфраструктуры можно подключать дополнительных агентов для решения более сложных задач, требующих параллельной обработки или специализированных компетенций, а затем отключать их по мере снижения нагрузки. Вернёмся к примеру со службой поддержки клиентов. Предположим, что текущая мультиагентная система поиска с дополненной генерацией (RAG) включает двух агентов: один отвечает на часто задаваемые вопросы (сброс пароля, настройка учётной записи), а другой занимается вопросами оплаты (возврат средств, проверка платежей).

Теперь компания запускает программу лояльности. Вскоре клиенты начинают задавать вопросы вроде: «Как использовать накопленные баллы?» или «Можно ли одновременно применять купоны и бонусы программы лояльности?». Благодаря модульной архитектуре системы для обработки таких запросов можно быстро добавить специализированного агента.

При этом каждый дополнительный агент увеличивает объём обрабатываемого текста и количество обращений к внешним инструментам. Затраты будут расти практически линейно, а со временем система может столкнуться с ограничениями размера контекстного окна. Поэтому агентный поиск с дополненной генерацией (Agentic RAG) действительно легко масштабируется с точки зрения эксплуатации, однако такое масштабирование требует дополнительных ресурсов и имеет ограничения.

Где агентный поиск с дополненной генерацией (Agentic RAG) уже приносит результаты

Обеспечивая более быстрые и точные ответы практически без участия человека, агентный поиск с дополненной генерацией (Agentic RAG) постепенно становится основой надёжных решений на базе искусственного интеллекта в различных отраслях.

Автоматизация поддержки клиентов

Агентный поиск с дополненной генерацией (Agentic RAG) можно считать одним из наиболее значимых достижений в области персонализированной поддержки клиентов. Анализируя намерения клиента, его эмоциональное состояние и контекст обращения, агенты одновременно получают данные из системы управления взаимоотношениями с клиентами (CRM-системы) и неструктурированных источников, таких как электронные письма, документы PDF и другие материалы, формируя целостное представление о клиенте. Такой подход, учитывающий контекст обращения позволяет создавать ответы, которые не просто решают проблему клиента, а повышают качество обслуживания и укрепляют лояльность.

Оптимизация поддержки сотрудников

Для повышения эффективности ИТ-поддержки компании внедряют помощников на основе поиска с дополненной генерацией (RAG) в системы обработки обращений. Это позволяет быстрее решать проблемы сотрудников и сокращать время простоя. Например, если сотрудник сообщает, что соединение с виртуальной частной сети (Virtual Private Network – VPN) регулярно разрывается во второй половине дня, система самостоятельно определяет, необходимо ли проанализировать журналы сети VPN, данные о назначении IP-адресов по протоколу динамической настройки узла (DHCP) или историю событий на устройстве пользователя. После этого она автоматически формирует заявку с наиболее вероятным вариантом решения и связанными инцидентами.

Клинические системы поддержки принятия решений

Агенты поиска информации помогают медицинским специалистам анализировать большие объёмы медицинских данных, научных публикаций, историй болезни и справочников лекарственных препаратов, формируя более точные рекомендации с учётом контекста. Простые запросы к большим языковым моделям (LLM) или традиционный поиск с дополненной генерацией (RAG) часто испытывают трудности при многоэтапном анализе, сопоставлении симптомов, методов лечения и противопоказаний.

Поддержка юридических исследований

С внедрением агентного поиска с дополненной генерацией (Agentic RAG) задачи, которые ранее занимали несколько дней, могут быть выполнены за считаные минуты. Большая языковая модель (LLM) с поддержкой агентного поиска с дополненной генерацией (Agentic RAG) анализирует законодательство, судебные решения и процессуальные документы, выявляет наиболее значимые прецеденты, устанавливает связи между ними и предоставляет юристу готовую основу для построения правовой позиции.

Инвестиционный анализ

Несколько специализированных агентов анализируют корпоративную финансовую отчётность, публикации Банка России, макроэкономические показатели и внутренние модели оценки рисков, сопоставляют выявленные тенденции и формируют краткий аналитический отчёт с объяснением причин изменения рыночных показателей. После этого аналитики могут быстро проверить выводы и использовать их в дальнейшей работе.

Два подхода к внедрению агентного поиска с дополненной генерацией (Agentic RAG)

Существует два основных подхода к построению архитектур агентного поиска с дополненной генерацией (Agentic RAG): прямой вызов функций в больших языковых моделях (LLM) и использование оркестраторов. Выбор подхода зависит от сложности сценария применения и требуемого уровня контроля над внутренними процессами системы.

Вызов функций в больших языковых моделях (LLM)

Некоторые современные большие языковые модели (LLM), такие как GPT-4 Turbo и GPT-5, позволяют вызывать внешние функции непосредственно в процессе формирования ответа. Если задача заключается в максимально быстром получении результата без дополнительных уровней координации и сложного управления процессом, прямой вызов функций становится оптимальным решением. Его основным преимуществом является высокая скорость работы: модель может обращаться к необходимым инструментам практически мгновенно, без дополнительных промежуточных этапов.

При этом участие разработчиков минимально. После определения набора доступных функций большая языковая модель (LLM) самостоятельно решает, когда и какой инструмент следует использовать, основываясь на запросе пользователя и промежуточных этапах рассуждения. После получения результата от внешней функции модель продолжает формирование ответа с использованием полученных данных.

Платформы для оркестрации

Более сложные мультиагентные рабочие процессы обычно выигрывают от использования специализированных платформ для управления агентами ИИ. Они особенно эффективны в сценариях с большим количеством внешних инструментов, разветвлённой логикой выполнения и требованиями к детальному контролю над работой системы.

  • Платформа LangChain широко используется для объединения больших языковых моделей (LLM) с инструментами, механизмами планирования и памятью. Библиотека LangGraph позволяет создавать агентные архитектуры поиска с дополненной генерацией (RAG).
  • Платформа LlamaIndex предоставляет средства подключения к источникам данных и компонент обработки запросов для поиска с дополненной генерацией (RAG). Поддерживает поиск по нескольким индексам и агентные сценарии работы.
  • Платформа DSPy относительно новая, ориентированная на агентов, использующих подход ReAct. Поддерживает создание многоагентных процессов и инструменты оптимизации, включая агентов ReAct и механизм оптимизации запросов Avatar.
  • Платформа IBM watsonx Orchestrate служит для управления работой корпоративных ИИ-систем, включая архитектуры агентного поиска с дополненной генерацией (Agentic RAG).
  • Платформа LangGraph – графовый механизм управления процессами с открытым исходным кодом от разработчиков платформы LangChain, предназначенный для создания мультиагентных систем.
  • Платформы CrewAI и MetaGPT служат для построения сложных мультиагентных рабочих процессов. Платформа CrewAI обеспечивает взаимодействие между агентами, а платформа MetaGPT предоставляет шаблоны для решения инженерных задач.
  • Платформа Swarm – экспериментальная многоагентная платформа от компании OpenAI, ориентированная на удобное использование инструментов и взаимодействие между агентами.

Некоторые компании предпочитают разрабатывать собственную логику оркестрации с нуля. Чаще всего такие решения создаются на языке программирования Python и включают правила маршрутизации, параллельное выполнение задач и механизмы объединения результатов. Несмотря на более высокую сложность разработки, такой подход обеспечивает полный контроль над системой и позволяет:

  • заменять методы поиска информации, способы представления данных и механизмы проверки результатов;
  • реализовывать собственные средства ведения журналов, мониторинга и отладки многоэтапных процессов поиска;
  • настраивать взаимодействие между несколькими агентами в соответствии с требованиями конкретного проекта.

Практические рекомендации по внедрению агентного поиска с дополненной генерацией (Agentic RAG)

Чтобы повысить эффективность корпоративных решений на базе больших языковых моделей (LLM), используйте следующие проверенные на практике рекомендации по внедрению архитектур агентного поиска с дополненной генерацией (Agentic RAG).

  1. Ключевой задачей при внедрении поиска с дополненной генерацией (RAG) является построение надёжного конвейера обработки данных и обеспечение безопасного хранения информации. Всегда контролируйте защиту баз данных и строго ограничивайте доступ к ним.
  2. Уделите внимание тому, чтобы агенты имели полное представление о возможностях каждого доступного инструмента. Необходимо чётко определить назначение инструментов, принципы их работы и сценарии применения, чтобы агенты могли выбирать наиболее подходящий вариант для решения конкретной задачи.
  3. Регулярно анализируйте часть решений, принимаемых агентами, чтобы убедиться, что их логика соответствует бизнес-требованиям. Если агент не уверен в выборе инструмента или оценке релевантности документа, следует предусмотреть проверку человеком либо использование резервного сценария обработки.
  4. Помните принцип «мусор на входе – мусор на выходе»: если внешние данные не содержат достаточного контекста и качественной информации, даже самый совершенный агент будет выдавать неудовлетворительные результаты. Для повышения точности ответов необходимо контролировать качество данных и обеспечивать достаточную информативность документов базы знаний.
  5. Чем выше уровень автономности системы, тем важнее контроль её работы. Настройте подробное журналирование, мониторинг и оповещения в системе поиска с дополненной генерацией (RAG), чтобы отслеживать действия агентов, своевременно выявлять проблемы и постоянно повышать эффективность решения.

Даже хорошо настроенная архитектура агентного поиска с дополненной генерацией (Agentic RAG) не гарантирует полного отсутствия фактических ошибок. Агенты могут выполнять одни и те же действия, создавать конфликты при обращении к ресурсам и усложнять работу всей системы. Кроме того, по мере увеличения числа агентов возрастает сложность управления, отладки и сопровождения решения. Поэтому на практике рекомендуется использовать минимально необходимое количество агентов, достаточное для выполнения поставленной задачи.

Как внедрить агентный поиск с дополненной генерацией в корпоративную ИИ-систему

Агентный поиск с дополненной генерацией (Agentic RAG) уже сегодня позволяет заметно повысить качество ответов и скорость работы систем ИИ. Однако он по-прежнему сталкивается с типичными для корпоративного ИИ ограничениями: низким качеством данных, недостаточной надёжностью инструментов, требованиями информационной безопасности и нормативного соответствия, а также ограничениями по стоимости внедрения и эксплуатации.

Специалисты Cronit помогут адаптировать архитектуру агентного поиска с дополненной генерацией (Agentic RAG) к вашей ИТ-инфраструктуре, настроить интеграцию с корпоративными системами, обеспечить соответствие требованиям безопасности и определить ключевые показатели эффективности проекта. Мы также можем разработать прототип решения и подготовить его к промышленному внедрению за несколько недель, а не месяцев.

Часто задаваемые вопросы

Что такое агентный поиск с дополненной генерацией (Agentic RAG)?

Агентный поиск с дополненной генерацией (Agentic RAG) дополняет большую языковую модель (LLM) автономными механизмами взаимодействия с инструментами, которые по запросу выполняют поиск, отбор и интеграцию внешних данных. Благодаря этому система способна формировать ответы с учётом актуального контекста.

В чём разница между традиционным и агентным поиском с дополненной генерацией (RAG)?

Традиционный поиск с дополненной генерацией (RAG) выполняет поиск информации один раз и формирует ответ на основе найденных данных. Агентный поиск с дополненной генерацией (Agentic RAG) действует более активно: он может выполнять дополнительные поисковые запросы, обращаться к нескольким источникам данных и уточнять результаты до тех пор, пока не получит достаточную информацию для решения задачи. Поэтому технология Agentic RAG подходит для сложных сценариев, а традиционный вариант эффективен для простых запросов и ответов.

Что такое агент поиска с дополненной генерацией (RAG)?

Агент поиска с дополненной генерацией (RAG) – это программа, которая находит наиболее релевантную информацию во внешних источниках данных и передаёт её большой языковой модели (LLM). Благодаря этому итоговый ответ основывается не только на знаниях модели, полученных во время обучения, но и на актуальной информации из внешних источников.

В чем разница между протоколом контекста модели (Model Context Protocol – MCP) и агентным поиском с дополненной генерацией (Agentic RAG)?

Протокол контекста модели (Model Context Protocol, MCP) представляет собой стандарт взаимодействия между большими языковыми моделями (LLM), источниками данных и внешними инструментами. Он определяет способ обмена информацией между ними.

Агентный поиск с дополненной генерацией (Agentic RAG) – это архитектурный подход, который использует такие механизмы взаимодействия для самостоятельного выбора инструментов, поиска данных, анализа результатов и решения поставленных задач.

Каково назначение поиска с дополненной генерацией (RAG)?

Большие языковые модели (LLM) ограничены данными, на которых они были обучены. Поиск с дополненной генерацией (RAG) позволяет получать актуальную информацию из внешних источников и использовать её при формировании ответа, устраняя ограничения, связанные с датой завершения обучения модели.

Готов ли агентный поиск с дополненной генерацией (Agentic RAG) к промышленному внедрению в крупных компаниях?

Традиционный поиск с дополненной генерацией (RAG) уже широко используется в крупных организациях. Агентный поиск с дополненной генерацией (Agentic RAG) также активно внедряется, однако требует дополнительной настройки механизмов контроля, оценки качества работы, мониторинга и сопровождения. Поэтому перед полномасштабным внедрением обычно проводится этап пилотной эксплуатации и тестирования.

Существуют ли инструменты с открытым исходным кодом для создания систем с технологией Agentic RAG?

Да. Для создания систем с технологией Agentic RAG доступны различные инструменты и библиотеки с открытым исходным кодом, включая платформы LangGraph, LlamaIndex, LangChain и другие. Они позволяют реализовать поиск информации, взаимодействие агентов, управление рабочими процессами и интеграцию с внешними источниками данных.

Как технология Agentic RAG работает с динамически изменяющимися данными?

При обработке каждого пользовательского запроса система обращается к актуальным источникам данных – базам данных, поисковым индексам, программным интерфейсам приложений (API) и другим системам. После получения информации агент анализирует её и только затем формирует ответ. Благодаря этому результаты отражают текущее состояние данных на момент выполнения запроса.