
Понятный вход в Reinforcement Learning: агент и среда, возврат, политики и ценности, исследование, MDP, Q-learning и SARSA. Практикуемся на небольших Python-средах, знакомимся с Deep RL и Gymnasium, разбираем безопасность, reward hacking и случаи, где RL не нужен.
Отличаем RL от обучения по примерам и поиска закономерностей.
Собираем основной цикл RL из шести терминов.
Учимся формулировать задачу так, чтобы агент мог учиться.
Почему будущая награда важна, но не всегда равна сегодняшней.
Отделяем правило выбора действия от оценки перспектив.
Балансируем проверку неизвестного и выбор лучшего известного.
Тренируем идею исследования на задаче без состояния.
Формализуем последовательное решение без тяжёлой математики.
Храним Q-оценки там, где состояний и действий немного.
Разбираем off-policy обновление и маленькую реализацию.
Сравниваем on-policy обновление с Q-learning.
Запускаем табличного агента и учимся читать результаты.
Переходим от запоминания к приближению функций.
Знакомимся с двумя семьями методов без ложной простоты.
Ориентируемся в современном интерфейсе учебных сред.
Учимся замечать расхождение метрики и реальной цели.
Выбираем метод по задаче, а не по модному названию.
Собираем постановку, baseline, проверку и ограничения в один проект.
Войдите и запишитесь, чтобы открывать уроки и сохранять прогресс.
Запишитесь на созвон с ментором: разбор кода, проекта, карьерного плана или практики с материалами платформы. Это часть консультационной услуги, не массовый онлайн-курс.