Treinamento PyTorch rápido e tolerante a falhas no AI Runtime
Traduzido do original em inglês por IA. Ver em inglês
O treinamento PyTorch rápido e tolerante a falhas no AI Runtime trata as falhas de GPU como o caso esperado, usando os salvamentos de checkpoint assíncronos e distribuídos do torch para tornar o checkpointing frequente praticamente gratuito e reduzir o custo de recuperação. Também argumenta que fazer checkpoint do pipeline de dados junto com o modelo é essencial, já que checkpoints apenas do modelo podem corromper silenciosamente os dados de treinamento na retomada.
* Em grande escala, falhas de GPU são o caso esperado, não a exceção; o código precisa ser construído para sobreviver a elas. * Os salvamentos de checkpoint assíncronos e distribuídos do torch tornam o checkpointing frequente praticamente gratuito, permitindo checkpoints mais frequentes e reduzindo o custo de recuperação. * O checkpoint apenas do modelo não é suficiente; fazer checkpoint do pipeline de dados evita a corrupção silenciosa dos dados de treinamento na retomada.
