AWS a annoncé en août 2026 plusieurs mises à jour notables pour ses services dédiés aux développeurs d'intelligence artificielle, notamment via Amazon Bedrock et son composant AgentCore. Ces nouveautés incluent un contexte étendu à un million de tokens pour les modèles OpenAI, la capacité d'exécuter des agents IA autonomes jusqu'à 14 jours sur des ressources dédiées, ainsi qu'une extension de la disponibilité d'AWS GovCloud.
Ces évolutions illustrent la volonté d'AWS de renforcer son positionnement sur le marché des infrastructures IA en cloud, en facilitant des cas d'usage plus complexes et durables, tout en répondant aux exigences de sécurité et de conformité des secteurs publics et réglementés.
Un contexte million de tokens pour les modèles OpenAI dans Bedrock
Amazon Bedrock, la plateforme d'AWS qui permet d'accéder à plusieurs modèles de fond, intègre désormais un contexte pouvant atteindre un million de tokens pour les modèles OpenAI. Cette extension dépasse largement les limites classiques, ouvrant la voie à des interactions plus longues et complexes avec les modèles de langage.
Sur le plan produit, cela signifie que les développeurs peuvent concevoir des applications nécessitant une mémoire contextuelle étendue, comme des assistants virtuels capables de conserver l'historique de conversations très longues, ou des outils d'analyse documentaire approfondie. En termes d'architecture, ce changement implique une gestion optimisée de la mémoire et des coûts associés à l'inférence sur de très longues séquences.
Agents IA autonomes sur 14 jours avec Bedrock AgentCore
La plateforme Bedrock AgentCore introduit la possibilité d'exécuter des agents intelligents de manière autonome pendant une durée pouvant aller jusqu'à 14 jours sur des ressources de calcul dédiées. Cette capacité est significative pour les cas d'usage nécessitant une continuité opérationnelle sans interruption, comme la surveillance automatisée, la gestion de workflows complexes ou les interactions prolongées avec des utilisateurs.
D'un point de vue technique, maintenir un agent actif aussi longtemps requiert une orchestration fine des ressources et une gestion robuste des états internes de l'agent. Cela ouvre aussi des questions sur la consommation énergétique, la sécurité des données sur la durée et la fiabilité des systèmes d'inférence à long terme.
Extension d'AWS GovCloud pour répondre aux besoins des secteurs régulés
AWS a élargi la disponibilité de ses services IA dans AWS GovCloud, une région cloud spécialement conçue pour les clients gouvernementaux et les organisations soumises à des exigences réglementaires strictes. Cette extension facilite l'adoption des technologies IA dans des environnements où la conformité et la sécurité sont prioritaires.
Pour les entreprises et administrations, cela signifie un accès plus large à des outils IA avancés tout en respectant les cadres légaux et normatifs. Ce mouvement d'AWS répond à une demande croissante de solutions cloud capables de concilier innovation IA et contraintes réglementaires.
Strands Robots : déploiement physique d'agents IA
Parallèlement aux services cloud, AWS a annoncé Strands Robots, une offre destinée au déploiement d'agents IA dans des environnements physiques. Ces robots exploitent les capacités d'inférence et d'autonomie développées dans Bedrock AgentCore pour interagir dans le monde réel.
Cette intégration produit ouvre des perspectives concrètes pour les secteurs de la logistique, de la maintenance ou de la gestion d'infrastructures, où des agents intelligents peuvent agir directement sur site. Elle pose cependant des défis opérationnels liés à la robustesse matérielle, à la sécurité physique et à la gestion des données en temps réel.
Cross-Region inference : optimiser la latence et la résilience
Enfin, AWS a introduit la possibilité d'effectuer des inférences IA en cross-region, c’est-à-dire en répartissant les traitements sur plusieurs régions géographiques. Cette fonctionnalité vise à réduire la latence pour les utilisateurs finaux et à améliorer la résilience des applications IA face aux pannes localisées.
Pour les entreprises, cela représente une opportunité d'optimiser leurs architectures cloud en fonction de leurs besoins géographiques et de leurs contraintes de continuité d'activité. Néanmoins, cette approche nécessite une orchestration complexe des données et des modèles pour garantir la cohérence des résultats.
Sources
Articles et annonces consultés
Passer à l'action



