Усиленное обучение модели RL

Пост-обучение нейросети.

11 мин
По колено
30.11.2025

Прошлые две статьи рассказали нам, что такое пре-обучение (напомню, это формирование эрудиции) и описали этап пост-обучения, называемый «обучение под присмотром» (а это формирование паттерна ответа).

Теперь переходим к самому сложному, спорному, тайному этапу улучшения больших языковых моделей, называемому — Reinforcement Learning (усиленное обучение или обучение с подкреплением 🤮).

Нейросети ни при чём.

На самом деле, этот этап появился уже давненько. Слышали про ИИ именуемый AlphaGO, который в 2016 году победил чемпиона Китая по игре в го? Это было круто!

Почему.

В отличии от шахмат, в этой игре есть доля абстрактного мышления, интуиции и везения, типо как в покере. Поэтому исследователи и разработчики ИИ сомневались, а получится ли придумать искусственный интеллект, который станет лучшим в мире по игре го.

Отметим. В шахматах это сделать оказалось сильно проще — игра-то про алгоритмы и последовательности.
Тут компьютер крут и уже давно!

Так вот, с применением концепции усиленного обучения, известного как «Reinforcement Learning», учёным и исследователям из Google Deepmind удалось достигнуть поставленной цели.
И они пошли дальше. Они сделали ИИ, который уверенно соревновался с лучшими в мире игроками в Starcraft 2. А это уже и стратегия и тактика и творчество.

— Как бывший игрок SC2 из мастер лиги, отмечу.
Этот ИИ был лишен читерских приёмов, типо как видеть всю карту и добывать больше ресурсов, которые характерны для встроенных в саму игру «компьютеров» максимальной сложности. Конкурировал чисто за счёт софтов, хех.

Классический RL.

Так что это за волшебный магический приём, твоё усиленное обучение и как оно работает?

Смари.
В классических компьютерных гонках Trackmania, ИИ, подкованный усиленным обучением, побил мировой рекорд 🏁

Он управлял машинкой 🚗 и смог пройти трассу быстрее самого быстрого игрока.

Добиться этого получилось грубо и неэффективно: в тупую запускать миллион попыток ИИ пройти трассу.
В каждой попытке машика просто произвольно двигается в случайную сторону. Мы отслеживаем попытки и запоминаем ту, где машинка проехала дальше. В следующий раз ИИ начнёт с неё, как с лучшей на текущий момент. В упрощённой форме, это и есть тот самый RL.

Так, через миллион попыток, путём перебора, он случайно сможет добраться до фишина.
Вот и научился наш маленьких ИИ приходить к правильному решению — доставить машинку от старта к финишу.

Используя такой же метод, в течении следующего миллиона попыток ИИ научится лучше срезать углы, правильно тормозить и ускоряться где надо, найти и эксплуатировать гличи чтоб улучшать время.
Вот так.
В тупую, неэффективно и в правду 🖕

В современных играх типа Starcraft 2 процесс обучения конечно сложней, содержит несколько фундаментальных алгоритмов-последовательностей. Но. Всё равно зиждется на тупом переборе всех вариантов и выборе лучшего.

— Понятненько с играми, а как этот приём обучения используется с большими языковыми моделями?

RL и нейросети.

Применительно к нейросетям, усиленное обучение настраивает веса модели так, что она учится последовательно, детерминировано (на сколько это возможно для генеративного ИИ) и прозрачно приходить к нужному результату. Эта техника называется «Reasoning», то есть умение размышлять. Обычно этот режим работы включается отдельной иконкой.

Режим тратит очень много токенов для инфиренса, по этому его бесплатное использование может быть ограниченно.

Далее, когда этот режим активирован, ты можешь видеть процесс прихода нейросети к правильному выводу. По сути, видишь как она размышляет, проверяет свои собственные выводы, анализирует промежуточные ответы. Всё это делается на человеческом языке — мыслит вслух.
Замечал такое?

Говорят, это повышает качество ответа.
Соглашусь, действительно повышает, но скорее этот эффект заметен при решении аналитических задач, где нужно плавно, поэтапно приходить к ответу 🪜

В обычной работе с запросами пользователей, включение этого режима может скорее навредить качеству или привести к излишним рублёвым затратам на использование модели, чем повысить качество прогноза.

Что важно сейчас запомнить — есть RL, а есть его имитация RLHF (Reinforcement Learning with Human Feedback).

— Ещё есть PPO, GRPO, GRPO + RLVR и др — но это всё уже задротская тема, скучная нудятина, которую мы, слава Богу, опустим, да?

Да.

И что ещё важно запомнить.

Компания OpenAI не раскрывает, как она делает этап RL, говорят это как раз технология RLVR, а Deepseek же открыто рассказал и показал как это происходит у них. Олимпиадная математика китайского уровня.

В следующей части разберём, чем отличается классический RL от RLHF и как строится сам процесс обучения, применительно к ЛЛМкам.