Atteindre une efficacité extrême grâce à la génération de kernels GPU spécialisés
Traduit de l'original anglais par IA. Voir en anglais
La génération automatisée de kernels GPU a produit des kernels pour Qwen 3.5 122B qui sont 1,8 à 5,2 fois plus rapides que les meilleures implémentations disponibles dans vLLM. L'obtention de ces gains d'efficacité nécessite d'associer une exploration d'agents sans contrainte à un système de vérification externe strict pour détecter les erreurs de mesure et valider les accélérations dans le monde réel.
* Les nouveaux projets de kernels sont bon marché et faciles à produire en parallèle. La confiance, elle, ne l'est pas. Le système progresse seulement aussi vite que nous pouvons vérifier ces projets. * Un chiffre qui a l'air miraculeusement rapide cache souvent une erreur de mesure : un travail résiduel d'une exécution précédente, une comparaison où les deux parties ne faisaient pas la même chose, ou un kernel qui n'a l'air performant que sous une hypothèse cachée. * Le contexte est un compromis, pas un tas à maximiser. Plus de texte donne au modèle plus d'éléments avec lesquels travailler, mais cela coûte plus cher, et des notes supplémentaires facilitent la dérive de la tentative suivante. Trop peu, et la boucle ne peut pas avancer. * Un agent capable d'explorer librement écrit de meilleurs kernels. Un système externe strict doit définir le rétrocontrôle et décider ce qui peut être publié. Une bonne conception exige les deux. * Les kernels individuels Qwen 3.5 122B générés étaient 1,8 à 5,2 fois plus rapides que les meilleures implémentations disponibles dans vLLM.
