Zum Inhalt springen
← Alle News
Databricks Blog22. Mai 2026

Beschleunigung der LLM-Inferenz mit Prompt-Caching für Open-Source-Modelle auf Databricks

Von KI aus dem englischen Original übersetzt. Auf Englisch ansehen

Zusammenfassung

Databricks unterstützt jetzt Prompt-Caching für Open-Source-Modelle über alle Workloads hinweg, wodurch die LLM-Inferenz durch die Wiederverwendung wiederholter Prompt-Präfixe automatisch beschleunigt wird. Diese Funktion steigert den Durchsatz um das 2,5-fache und reduziert die P50-Latenz um das 3-fache für Modelle wie GPT-OSS, ohne dass eine Einrichtung erforderlich ist.

* Prompt-Caching nutzt wiederholte Prompt-Präfixe wieder, damit LLMs schneller laufen. Es reduziert die Latenz und steigert den Durchsatz automatisch. * Databricks unterstützt jetzt Prompt-Caching für Open-Source-Modelle über Batch-, Pay-per-Token- und bereitgestellte Workloads hinweg. Es ist keine Einrichtung erforderlich. * Im Produktionseinsatz mit GPT-OSS erhöhte Prompt-Caching den Durchsatz um das 2,5-fache und reduzierte die P50-Latenz um das 3-fache.

Ähnliche Artikel

News

Lesebeschränkungen und Katalog-Labels: Vereinheitlichung der Governance über Engines und Kataloge hinweg

databricks-blog8h ago
News

Lakebase Postgres: Branch-basierte Wiederherstellungen für schnelle Wiederherstellung im großen Maßstab

databricks-blog11h ago
News

Verknüpfung von Kundenkontext mit messbarem ROI durch Agentic Marketing

databricks-blog16h ago
News

IP-Funktionen sind allgemein verfügbar und bringen High-Performance-Netzwerkanalytik in das Lakehouse

databricks-blog1d ago