Валентин Мамедов. Путешествие в мир LLM pretrain:топовые кластеры, неочевидные ускорения и трудности
Расскажу о том, как устроено обучение нейронных сетей, которые не помещаются на одну видеокарту. Поговорим о таких техниках, как ZeRO и Tensor / Pipeline /.../ Sequence Parallel. Затронем влияние вычислительной точности на модель. Поговорим о важности инфраструктуры и оптимизации скорости перезапуска обучения. А также обсудим, как грамотная работа с видеопамятью повышает скорость обучения, в том числе подсветим тонкости работы с кэширующим аллокатором памяти в PyTorch. Сайт – https://codefest.ru Презентация – https://disk.yandex.ru/i/5YHQjnW7SQHrlA
Расскажу о том, как устроено обучение нейронных сетей, которые не помещаются на одну видеокарту. Поговорим о таких техниках, как ZeRO и Tensor / Pipeline /.../ Sequence Parallel. Затронем влияние вычислительной точности на модель. Поговорим о важности инфраструктуры и оптимизации скорости перезапуска обучения. А также обсудим, как грамотная работа с видеопамятью повышает скорость обучения, в том числе подсветим тонкости работы с кэширующим аллокатором памяти в PyTorch. Сайт – https://codefest.ru Презентация – https://disk.yandex.ru/i/5YHQjnW7SQHrlA
