Escalando e operando um grande projeto dbt no Databricks: a equipe de dados da IFCO sobre performance, visibilidade e depuração
Traduzido do original em inglês por IA. Ver em inglês
O ajuste de modelos incrementais do dbt com liquid clustering, dynamic file pruning e estratégias de mesclagem deliberadas reduziu o tempo de execução do job principal da IFCO em mais de 60% e eliminou a necessidade de atualizações completas noturnas. Ao diagnosticar planos de consulta reais executados e orquestrar modelos como tarefas discretas do Databricks Jobs por meio do projeto open-source databricks-dbt-factory, a equipe obteve visibilidade por modelo, reexecuções direcionadas e testes obrigatórios.
* Ajuste de modelos incrementais do dbt para que cada execução grave apenas as linhas alteradas, utilizando liquid clustering, uma estratégia de mesclagem deliberada e dynamic file pruning. Isso reduziu o tempo de execução do job principal da IFCO em mais de 60% e aposentou a atualização completa noturna. * Diagnóstico de modelos lentos a partir do plano de consulta real executado, e não do SQL compilado, pois é aí que aparecem as causas reais. A IFCO empacotou esse diagnóstico em uma habilidade repetível que é executada em cada modelo. * Execução do projeto dbt como uma tarefa por modelo no Databricks Jobs com o databricks-dbt-factory open-source, em vez de um único job opaco. Isso proporciona visibilidade por modelo, reexecuções direcionadas e testes obrigatórios.
