← Программа курса
Занятие 20 · Модуль 5 · Генерация, объяснимость, агенты · 45 мин чтения

Обучение с подкреплением

Агент, среда и награда; дилемма исследование/использование и ε-жадная стратегия; Q-learning с уравнением Беллмана — и реально обучающаяся Q-таблица на сетке (чистый numpy), а затем по-настоящему обученный Deep Q-Learning на CartPole (torch + gymnasium).

агент/средаε-жадностьQ-learningБеллманCartPole
Платный урок

Этот урок — часть полного курса

Первые четыре урока открыты. Остальные шестнадцать — с полным разбором, кодом, формулами и скачиваемыми ноутбуками — в платном курсе. Одна покупка открывает все уроки навсегда.

  • Полные тексты всех платных уроков
  • Скачиваемые Jupyter-ноутбуки к каждому уроку
  • Доступ навсегда, без подписки
Нужен разбор?

Застрял на теме — разберём один на один

Объясню сложное на пальцах и доведу до результата: код, формулы, проект.

Записаться на разбор