Pular para o conteúdo
← Todas as notícias
Databricks Blog28 de agosto de 2026

Treinamento PyTorch rápido e tolerante a falhas no AI Runtime

Traduzido do original em inglês por IA. Ver em inglês

Resumo

O treinamento PyTorch rápido e tolerante a falhas no AI Runtime trata as falhas de GPU como o caso esperado, usando os salvamentos de checkpoint assíncronos e distribuídos do torch para tornar o checkpointing frequente praticamente gratuito e reduzir o custo de recuperação. Também argumenta que fazer checkpoint do pipeline de dados junto com o modelo é essencial, já que checkpoints apenas do modelo podem corromper silenciosamente os dados de treinamento na retomada.

* Em grande escala, falhas de GPU são o caso esperado, não a exceção; o código precisa ser construído para sobreviver a elas. * Os salvamentos de checkpoint assíncronos e distribuídos do torch tornam o checkpointing frequente praticamente gratuito, permitindo checkpoints mais frequentes e reduzindo o custo de recuperação. * O checkpoint apenas do modelo não é suficiente; fazer checkpoint do pipeline de dados evita a corrupção silenciosa dos dados de treinamento na retomada.

Artigos relacionados

News

Construindo para a era da IA: inovações em Lakebase, streaming e Lakehouse na VLDB 2026

databricks-blog14h ago
News

O que os relatórios QSR deixam passar sobre as decisões que mais importam

databricks-blog15h ago
News

Aprimorando a recuperação de agentes com extração estruturada de gráficos

databricks-blog15h ago
News

Vantagem vertical: transformando setores com Lakebase e IA agêntica

databricks-blog17h ago