Alcançando eficiência extrema por meio da geração de kernels de GPU especializados
Traduzido do original em inglês por IA. Ver em inglês
A geração automatizada de kernels de GPU produziu kernels para o Qwen 3.5 122B que são de 1,8 a 5,2 vezes mais rápidos do que as principais implementações disponíveis no vLLM. Alcançar esses ganhos de eficiência exige o pareamento da exploração de agentes irrestrita com um sistema externo de verificação rigoroso para detectar erros de medição e validar ganhos de velocidade no mundo real.
* Rascunhos de novos kernels são baratos e fáceis de produzir em paralelo. A confiança não é. O sistema só progride tão rápido quanto conseguimos verificar esses rascunhos. * Um número que parece milagrosamente rápido costuma ser um erro de medição: trabalho residual de uma execução anterior, uma comparação onde os dois lados não estavam fazendo a mesma coisa ou um kernel que só parece bom sob uma premissa oculta. * Contexto é um compromisso, não uma pilha a ser maximizada. Mais texto dá ao modelo mais material para trabalhar, mas custa mais caro, e notas extras facilitam o desvio da próxima tentativa. Pouco texto e o loop não consegue avançar. * Um agente que pode explorar livremente escreve kernels melhores. Um sistema externo rigoroso precisa definir o feedback e decidir o que pode ser liberado. Um bom design precisa de ambos. * Os kernels individuais gerados para o Qwen 3.5 122B foram de 1,8 a 5,2 vezes mais rápidos do que as melhores implementações disponíveis no vLLM.
