Pular para o conteúdo
← Todas as notícias
Databricks Blog4 de setembro de 2026

Alcançando eficiência extrema por meio da geração de kernels de GPU especializados

Traduzido do original em inglês por IA. Ver em inglês

Resumo

A geração automatizada de kernels de GPU produziu kernels para o Qwen 3.5 122B que são de 1,8 a 5,2 vezes mais rápidos do que as principais implementações disponíveis no vLLM. Alcançar esses ganhos de eficiência exige o pareamento da exploração de agentes irrestrita com um sistema externo de verificação rigoroso para detectar erros de medição e validar ganhos de velocidade no mundo real.

* Rascunhos de novos kernels são baratos e fáceis de produzir em paralelo. A confiança não é. O sistema só progride tão rápido quanto conseguimos verificar esses rascunhos. * Um número que parece milagrosamente rápido costuma ser um erro de medição: trabalho residual de uma execução anterior, uma comparação onde os dois lados não estavam fazendo a mesma coisa ou um kernel que só parece bom sob uma premissa oculta. * Contexto é um compromisso, não uma pilha a ser maximizada. Mais texto dá ao modelo mais material para trabalhar, mas custa mais caro, e notas extras facilitam o desvio da próxima tentativa. Pouco texto e o loop não consegue avançar. * Um agente que pode explorar livremente escreve kernels melhores. Um sistema externo rigoroso precisa definir o feedback e decidir o que pode ser liberado. Um bom design precisa de ambos. * Os kernels individuais gerados para o Qwen 3.5 122B foram de 1,8 a 5,2 vezes mais rápidos do que as melhores implementações disponíveis no vLLM.

Artigos relacionados

News

Cinco maneiras de profissionais de marketing usarem o Genie One

databricks-blog1d ago
News

Governança além da segurança: conhecimento, contexto e ontologia no lakehouse

databricks-blog1d ago
News

Construindo produtos de dados de alta qualidade e confiáveis com o Databricks

databricks-blog1d ago
News

O que é transformação de dados?

databricks-blog1d ago