Pular para o conteúdo
← Todas as notícias
Databricks Blog27 de maio de 2026

Inferência LLM Confiável em Escala

Traduzido do original em inglês por IA. Ver em inglês

Resumo

A Databricks agora oferece unidades de modelo, uma abstração semelhante a uma VM para alocar e escalar recursos de GPU por cliente, permitindo balanceamento de carga e autoescalonamento conscientes dos custos que economizaram mais de 80% nos custos de GPU. Mecanismos de confiabilidade em tempo de execução, como verificações de saúde de caixa preta e perfil de gargalos multimodais, melhoram ainda mais o throughput e se recuperam automaticamente de falhas silenciosas.

* O serviço LLM multi-tenant exige raciocínio sobre a capacidade em todas as cargas de trabalho. As "unidades de modelo" fornecem uma abstração semelhante a uma VM que possibilita alocar, rotear e escalar recursos de GPU por cliente. * O balanceamento de carga e o autoescalonamento conscientes dos custos, construídos sobre unidades de modelo, economizaram mais de 80% nos custos de GPU em comparação com o provisionamento estático, mantendo os alvos de latência. * Mecanismos de confiabilidade em tempo de execução, como verificações de saúde de caixa preta, detectam e se recuperam automaticamente de falhas silenciosas, enquanto o perfil de gargalos multimodais desbloqueou ganhos de throughput de 3x.

Artigos relacionados

News

How Databricks Feature Store serves features with sub-second freshness

databricks-blog4h ago
News

The prototyping tax is killing your AI roadmap

databricks-blog7h ago
News

Usando AI_Functions no seu data warehouse: principais casos de uso

databricks-blog3d ago
News

Como a Scottish Water tornou seus dados de investimento de capital conversacionais com o Databricks Genie

databricks-blog4d ago