Zum Inhalt springen
← Alle News
Databricks Blog27. Mai 2026

Zuverlässige LLM-Inferenz im großen Maßstab

Von KI aus dem englischen Original übersetzt. Auf Englisch ansehen

Zusammenfassung

Databricks bietet jetzt Modelleinheiten an, eine VM-ähnliche Abstraktion zur Zuweisung und Skalierung von GPU-Ressourcen pro Kunde, die eine kostenbewusste Lastverteilung und Autoskalierung ermöglicht, wodurch über 80 % der GPU-Kosten eingespart wurden. Laufzeit-Zuverlässigkeitsmechanismen wie Black-Box-Gesundheitsprüfungen und multimodales Engpass-Profiling verbessern den Durchsatz weiter und stellen die automatische Wiederherstellung von stillen Fehlern sicher.

* Multi-Tenant LLM-Serving erfordert die Berücksichtigung der Kapazität über verschiedene Workloads hinweg. „Modelleinheiten“ bieten eine VM-ähnliche Abstraktion, die es ermöglicht, GPU-Ressourcen pro Kunde zuzuweisen, zu routen und zu skalieren. * Kostenbewusste Lastverteilung und Autoskalierung, die auf Modelleinheiten aufbauen, sparten über 80 % der GPU-Kosten im Vergleich zur statischen Bereitstellung, während die Latenzziele eingehalten wurden. * Laufzeit-Zuverlässigkeitsmechanismen wie Black-Box-Gesundheitsprüfungen erkennen stille Fehler automatisch und stellen die Wiederherstellung sicher, während das Profiling multimodaler Engpässe eine 3-fache Steigerung des Durchsatzes ermöglichte.

Ähnliche Artikel

News

Wie der Databricks Feature Store Features mit Aktualität in Bruchteilen einer Sekunde bereitstellt

databricks-blog6h ago
News

Die Prototyping-Steuer ruiniert Ihre KI-Roadmap

databricks-blog9h ago
News

AI_Functions im Data Warehouse nutzen: die wichtigsten Anwendungsfälle

databricks-blog3d ago
News

Wie Scottish Water seine Investitionsdaten mit Databricks Genie dialogfähig machte

databricks-blog4d ago