Actualités
ActualitéModèles & plateformes13 septembre 2026

Amazon SageMaker réduit la latence des LLM avec le routage intelligent par préfixe

AWS introduit le routage aware du préfixe sur SageMaker Inference, diminuant jusqu'à 77 % la latence initiale sur Llama 3.1 70B et optimisant l’utilisation du cache KV pour les applications IA.

Par François MariFondateur, ligne8 Studio3 min de lecture1 source
Create a realistic editorial news photograph for a serious AI and technology publication.
The image must look like a real photo shot for a business/technology n

Amazon Web Services a annoncé une nouvelle fonctionnalité sur sa plateforme SageMaker Inference : le routage aware du préfixe. Cette technique consiste à acheminer les requêtes partageant un même préfixe de prompt vers la même instance de calcul, afin de maintenir le cache clé-valeur (KV) actif et ainsi réduire la latence lors de l’inférence de grands modèles de langage (LLM).

Les premiers benchmarks réalisés avec le modèle Llama 3.1 70 milliards de paramètres montrent une réduction significative du temps avant la génération du premier token (P50 time-to-first-token) pouvant atteindre 77 %. Parallèlement, le taux de hit sur le cache KV grimpe de 25 % à plus de 80 %, ce qui traduit une meilleure exploitation des données en mémoire pour accélérer les réponses.

Un mécanisme de routage qui optimise la gestion du cache KV sur SageMaker

Le cache clé-valeur est un composant essentiel dans l’inférence des LLM, permettant de stocker temporairement des informations intermédiaires pour éviter de recalculer des parties du prompt déjà traitées. Cependant, dans un contexte multi-utilisateurs ou multi-requêtes, le cache peut rapidement devenir froid si les requêtes sont dispatchées aléatoirement entre différentes instances, ce qui augmente la latence.

Le routage aware du préfixe proposé par AWS consiste à identifier les requêtes qui commencent par le même segment de texte et à les diriger vers la même instance. Cette approche garantit que le cache KV reste chaud et pertinent, améliorant la rapidité de traitement des requêtes suivantes avec des préfixes similaires.

Impact mesuré sur Llama 3.1 70B : vers une inférence plus fluide

Les tests effectués sur Llama 3.1 70B, un modèle de grande taille développé par Meta, montrent que le temps médian pour générer le premier token peut être réduit de 77 % grâce à cette optimisation. Ce gain est particulièrement pertinent pour les applications interactives où la réactivité est déterminante, comme les assistants virtuels ou les outils de génération de contenu en temps réel.

En augmentant le taux de cache KV de 25 % à plus de 80 %, le système diminue la charge de calcul répétée, ce qui peut aussi contribuer à réduire les coûts d’infrastructure en limitant le besoin de ressources supplémentaires pour maintenir des performances élevées.

Conséquences opérationnelles pour les entreprises utilisant SageMaker

Pour les entreprises qui déploient des LLM via SageMaker, cette nouvelle fonctionnalité peut améliorer l’expérience utilisateur en rendant les interactions plus rapides et plus fluides. Elle facilite également la gestion des ressources cloud en optimisant l’usage du cache, ce qui peut se traduire par une meilleure maîtrise des coûts.

Toutefois, cette approche suppose que les requêtes présentent des préfixes similaires de manière régulière, ce qui dépend fortement des cas d’usage et des patterns d’interaction. Les applications avec des prompts très variés ou aléatoires pourraient ne pas bénéficier pleinement de cette optimisation.

Positionnement de SageMaker face aux autres solutions d’inférence LLM

Le routage aware du préfixe illustre la volonté d’AWS de se différencier sur le marché des plateformes d’inférence LLM en proposant des optimisations spécifiques au fonctionnement des modèles à grande échelle. D’autres acteurs, comme Google Cloud ou Microsoft Azure, investissent également dans des mécanismes pour réduire la latence et améliorer l’efficacité des déploiements.

Cette innovation souligne l’importance croissante du software d’inférence et des stratégies de gestion des ressources pour maximiser les performances des LLM, au-delà des seules améliorations des modèles eux-mêmes.

L’intégration de cette fonctionnalité dans les workflows IA : prochaines étapes

À court terme, les développeurs et data scientists utilisant SageMaker pourront activer ce routage pour optimiser leurs déploiements, notamment dans les contextes où les prompts suivent des schémas récurrents. Cela peut concerner des chatbots, des outils de rédaction assistée ou des systèmes de recommandation.

Sur le plan technique, cette fonctionnalité invite à repenser la conception des requêtes et des prompts pour tirer parti du cache KV, en structurant les interactions de manière à favoriser la réutilisation des préfixes. Cela pourrait aussi influencer les architectures des agents IA et workflows automatisés qui exploitent les LLM.

Sources

Articles et annonces consultés

Passer à l'action

Vous voulez identifier les workflows IA qui peuvent transformer votre entreprise ? Parlons-en.

Identifier mes workflows IA