Schnelles, fehlertolerantes PyTorch-Training auf AI Runtime
Von KI aus dem englischen Original übersetzt. Auf Englisch ansehen
Schnelles, fehlertolerantes PyTorch-Training auf AI Runtime behandelt GPU-Ausfälle als Regelfall und nutzt Torchs verteilte asynchrone Checkpoint-Speicherung, um häufiges Checkpointing nahezu kostenlos zu machen und die Wiederherstellungskosten zu senken. Zudem wird argumentiert, dass das Checkpointing der Datenpipeline neben dem Modell unerlässlich ist, da rein modellbezogene Checkpoints beim Fortsetzen des Trainings die Trainingsdaten unbemerkt beschädigen können.
* In großem Maßstab sind GPU-Ausfälle der Regelfall, nicht die Ausnahme – der Code muss so gebaut sein, dass er sie übersteht. * Torchs verteilte asynchrone Checkpoint-Speicherung macht häufiges Checkpointing nahezu kostenlos, ermöglicht so häufigeres Checkpointing und senkt die Wiederherstellungskosten. * Modell-Checkpointing allein reicht nicht aus – das Checkpointing der Datenpipeline verhindert eine unbemerkte Beschädigung der Trainingsdaten beim Fortsetzen.
