Zum Inhalt springen
← Alle News
Databricks Blog27. Mai 2026

Zuverlässige LLM-Inferenz im großen Maßstab

Von KI aus dem englischen Original übersetzt. Auf Englisch ansehen

Zusammenfassung

Databricks bietet jetzt Modelleinheiten an, eine VM-ähnliche Abstraktion zur Zuweisung und Skalierung von GPU-Ressourcen pro Kunde, die eine kostenbewusste Lastverteilung und Autoskalierung ermöglicht, wodurch über 80 % der GPU-Kosten eingespart wurden. Laufzeit-Zuverlässigkeitsmechanismen wie Black-Box-Gesundheitsprüfungen und multimodales Engpass-Profiling verbessern den Durchsatz weiter und stellen die automatische Wiederherstellung von stillen Fehlern sicher.

* Multi-Tenant LLM-Serving erfordert die Berücksichtigung der Kapazität über verschiedene Workloads hinweg. „Modelleinheiten“ bieten eine VM-ähnliche Abstraktion, die es ermöglicht, GPU-Ressourcen pro Kunde zuzuweisen, zu routen und zu skalieren. * Kostenbewusste Lastverteilung und Autoskalierung, die auf Modelleinheiten aufbauen, sparten über 80 % der GPU-Kosten im Vergleich zur statischen Bereitstellung, während die Latenzziele eingehalten wurden. * Laufzeit-Zuverlässigkeitsmechanismen wie Black-Box-Gesundheitsprüfungen erkennen stille Fehler automatisch und stellen die Wiederherstellung sicher, während das Profiling multimodaler Engpässe eine 3-fache Steigerung des Durchsatzes ermöglichte.

Ähnliche Artikel

News

Real-Time Retail Intelligence: E-Commerce-Empfehlungen mit Lakebase und AI Search auf Databricks entwickeln

databricks-blog15h ago
News

Lesebeschränkungen und Katalog-Labels: Vereinheitlichung der Governance über Engines und Kataloge hinweg

databricks-blog1d ago
News

Lakebase Postgres: Branch-basierte Wiederherstellungen für schnelle Wiederherstellung im großen Maßstab

databricks-blog1d ago
News

Verknüpfung von Kundenkontext mit messbarem ROI durch Agentic Marketing

databricks-blog1d ago