← Программа курса
Занятие 16 · Модуль 4 · Последовательности и язык · 48 мин чтения

Трансформеры и большие модели

Attention как «на что я смотрю»: Q/K/V на бытовом примере и в виде тепловой матрицы. Трансформер и параллельность, позиционное кодирование, BERT vs GPT, LLM и законы масштабирования, ViT.

attentionQ/K/VBERT/GPTLLMViT
Платный урок

Этот урок — часть полного курса

Первые четыре урока открыты. Остальные шестнадцать — с полным разбором, кодом, формулами и скачиваемыми ноутбуками — в платном курсе. Одна покупка открывает все уроки навсегда.

  • Полные тексты всех платных уроков
  • Скачиваемые Jupyter-ноутбуки к каждому уроку
  • Доступ навсегда, без подписки
Нужен разбор?

Застрял на теме — разберём один на один

Объясню сложное на пальцах и доведу до результата: код, формулы, проект.

Записаться на разбор