RAG и зачем он нужен
Реальный кейс и описание ценности рага.
Привет.
Вообще, RAG это самое популярное и распространённое ИИ-решение для бизнеса. Оно даёт предсказуемую пользу и не сложно для продуктивизации в корпоративной среде.
Самое понятие RAG — Retrieval Augmented Generation, можно адаптировать на русский язык как «Генерация усиленная поиском».
Такой перевод на русский язык сразу передаёт основной смысл данного архитектурного решения — поискать, усилить генерацию результатом, сгенерировать.
— Давай начнём с ответа на самый важный вопрос. Зачем он нужен?
Ранее в статье Как делается GPT-5 мы читали про этапы обучения модели, где она получают эрудицию и паттерн ответов на вопросы. Предназначение рага же проще — он нужен чтобы усилить эрудицию модели в конкретной прикладной области, о которой модель вряд ли узнала на этапах обучения.
Бизнес-кейс.
Представь, есть руководитель команды инженеров-монтажников. Работа команды заключается в подъёме на высокие опоры-столбы и установки коммутаторов, джуниперов и прочего оборудования, связанного со стабильной работой сети связи в городе.
И вот проблема, началось импортозамещение и опытные ребята, привыкшие работать с иностранным оборудованием, получили задания подняться на вышку и установить отечественное, своё, родное. Они понятия не имеют как его корректно установить и тем более настроить.
Как продвинутый руководитель этих ребят, идущий в ногу со временем, он приходит в ИИ-команду для решения проблемы — как спецам быстро понимать, куда какой кабель вставлять, какие настройки вбивать, как отлаживать работу оборудования, находясь в подвешенном состоянии на верху вышки связи. Времени на чтение всей той документации, что было получена вместе с оборудованием нет, как и нет желания в ней разбираться, блин.

Проблема ясна и понятна, а это уже круто!
Переговоры шли-шли, БФТ формировалось-формировалось и сформировалось.
Прения завершились успешно, бюджет защищён и согласован финансами, ИБ смилостивились и не стали блокировать разработку. В общем, прошло полгода с момента начала переговоров и AI-инженеры приступили к написанию кода.
— В чём будет заключаться наше решение?
Смотри, наврятли из коробки ллмки будут знать что такое «Оптический абонентский терминал Netlink C-data xpon fd511g-x port» или смогут правильно объяснить:
«Как установить комплект KSS-Pot MIMO для 3G/4G USB модема в спутниковую тарелку?»
Но знаешь где должны быть ответы на эти вопросы? Так в документации, которую передала нам отечественная компании-производитель в момент приобретения их прекрасных комплектующих.
Давай представим что так и случилось. Вместе с дорогостоящим оборудованием мы получили пару десятков .pdf файлов, в каждом страниц по 100, где объяснены нюансы установки, интеграции и настройки.
— И теперь наша задача, как ИИ-команды, заключается в том, чтобы обработать, векторизовать эти файлы, разместить их в векторную базу данных.
Далее сформируем ДС-пайплайн, в рамках которого будет анализироваться вопрос пользователя, находится релевантные куски этих документов, добавляться в контекстное окно модели и генерироваться простой и чёткий ответ на его вопрос.
Всё.

Вывод.
В этом и есть предназначение рага. Улучшать используемую ллмку, чтобы она давала правильный ответ на основе точечно дозагруженных данных, а не галлюцинировала или не говорила что не знает.
Перед тем как продолжить углублять знания в области рага, давай разберём вот то интересное словосочетание выше — «контекстное окно».
Без технических усложнений, читай что же это за штука в следующей статье.