AWS a publié une étude détaillant l’usage combiné de NVIDIA CUDA Multi-Process Service (MPS) et du serveur Triton Inference pour réduire significativement les coûts d’inférence des modèles de reconnaissance vocale automatique (ASR) sur les instances GPU Amazon EC2. Cette optimisation permet de diminuer de 75 % la quantité de GPU nécessaire tout en maintenant une latence inférieure à la seconde.
Le défi principal dans le déploiement à grande échelle de modèles ASR réside dans l’utilisation inefficace des ressources GPU, chaque requête exploitant souvent une faible fraction de la capacité disponible. NVIDIA MPS adresse ce problème en permettant la cohabitation simultanée de multiples processus GPU, améliorant ainsi l’occupation et la rentabilité des instances.
Optimiser l’usage GPU grâce à NVIDIA MPS et Triton Inference Server
NVIDIA MPS est une technologie qui permet de multiplexeur plusieurs processus CUDA sur un même GPU, évitant que les requêtes ASR sous-utilisent la puissance du matériel. Associée à Triton Inference Server, une plateforme open source de déploiement de modèles d’IA, cette combinaison facilite la gestion efficace des charges d’inférence sur Amazon EC2.
Dans les tests menés, cette architecture a permis de traiter 92,1 requêtes par seconde par GPU avec une latence sous la seconde, ce qui est compatible avec les exigences des applications en temps réel, tout en réduisant drastiquement le nombre de GPU nécessaires.
Répercussions économiques pour les opérateurs de services vocaux
Pour les entreprises exploitant des services de reconnaissance vocale, la réduction de 75 % des coûts d’inférence GPU représente un levier important pour maîtriser les dépenses d’infrastructure cloud. Cela peut rendre économiquement viable le déploiement à grande échelle de modèles ASR complexes et gourmands en calcul.
Cette optimisation ouvre aussi la porte à des architectures plus flexibles, où la capacité GPU peut être mieux partagée entre différents modèles ou clients, améliorant la rentabilité des ressources cloud.
Limites techniques et conditions d’application
L’efficacité de NVIDIA MPS dépend toutefois du profil des requêtes et de la charge de travail. Les gains observés s’appliquent principalement lorsque les requêtes individuelles n’exploitent pas pleinement un GPU. Dans des scénarios où les modèles sont très lourds ou les requêtes très intensives, la mutualisation peut être moins avantageuse.
De plus, la configuration et la gestion de MPS nécessitent une expertise technique pour éviter des conflits entre processus et garantir la stabilité des services.
Comparaison avec d’autres solutions d’inférence cloud
Par rapport à des approches classiques où chaque requête monopolise un GPU, l’utilisation de MPS sur EC2 se distingue par une meilleure densité d’utilisation. D’autres fournisseurs cloud proposent des optimisations similaires, mais l’intégration native de NVIDIA MPS avec Triton sur EC2 offre une solution clé en main pour les utilisateurs déjà investis dans cet environnement.
Cette approche peut aussi être mise en regard avec des alternatives comme les TPU ou des architectures CPU optimisées, mais pour les charges ASR nécessitant des GPU, elle reste une des plus économes en ressources.
L’évolution des workflows ASR en cloud : prochaines étapes
La démonstration d’AWS souligne l’importance croissante des optimisations d’infrastructure dans le déploiement des modèles d’IA. En réduisant les coûts d’inférence, les acteurs peuvent envisager des déploiements plus larges, des mises à jour plus fréquentes des modèles et une meilleure qualité de service.
À terme, ces avancées pourraient influencer la conception même des modèles ASR, en favorisant des architectures compatibles avec la mutualisation des ressources GPU, et en incitant les fournisseurs cloud à proposer des offres dédiées intégrant ces technologies.
Sources
Articles et annonces consultés
Passer à l'action



