Catégorie
Agents & automatisation
Décryptages sur les agents IA, copilotes, workflows automatisés, orchestrations, RAG et systèmes connectés aux outils de l'entreprise.
119 articles
Plus d'articles
114 articles
AHD Agent : quand les LLM deviennent acteurs autonomes dans la conception heuristique
Le framework AHD Agent propose une nouvelle approche où les grands modèles de langage pilotent eux-mêmes la création heuristique, intégrant outils et preuves pour optimiser la résolution de problèmes complexes.

ERSkill : quand les agents IA adaptent leur mémoire pour mieux répondre
Le framework ERSkill propose une mémoire évolutive pour les agents LLM, ajustant dynamiquement les stratégies de récupération d’informations selon les requêtes, afin d’améliorer la pertinence des réponses.

Spatial Memory Agent : un cadre sans mise à jour pour améliorer le raisonnement spatial des agents IA
Le Spatial Memory Agent (SMA) propose une nouvelle méthode pour renforcer la capacité de raisonnement spatial des agents multimodaux sans entraînement supplémentaire ni recours à des outils externes.

OpenAg : vers une intelligence artificielle agricole plus contextualisée et accessible aux petits exploitants
Le projet OpenAg propose un cadre intégrant modèles spécialisés, graphes de connaissances et agents pour pallier les limites des LLM généralistes en agriculture, ciblant notamment les petits exploitants.

MBA-Bench : un benchmark multimodal pour évaluer les agents IA dans l’idéation business
MBA-Bench propose un cadre inédit pour entraîner et tester des agents IA multimodaux capables de générer des idées business intégrant images et texte, une avancée face aux limites des modèles textuels seuls.

Détection d’anomalies vidéo : un cadre sans entraînement mêle IA multimodale et raisonnement agentique
Une nouvelle approche combine repérage global, analyse locale et raisonnement itératif pour améliorer la détection et l’interprétation des anomalies dans les vidéos de surveillance, sans nécessiter d’entraînement préalable.

OpenAI dévoile comment les entreprises transforment ChatGPT en agents autonomes pour automatiser leurs workflows
Une étude d’OpenAI révèle que les entreprises intègrent ChatGPT et Codex pour créer des agents IA capables d’exécuter des tâches complexes, accélérant ainsi leur adoption de l’intelligence artificielle.

Modéliser la perspective utilisateur : une nouvelle approche avec Situation Graph Prediction
La méthode Situation Graph Prediction propose de reconstruire les états internes des utilisateurs à partir de données multimodales, offrant un potentiel inédit pour les agents personnels et la mémoire à long terme.

Détecter et corriger les hallucinations des agents IA en temps réel grâce au Latent Critic
Une nouvelle méthode nommée Latent Critic améliore la détection granulaire des hallucinations dans les agents IA basés sur les grands modèles de langage, sans ralentir l'inférence.

Un agent IA adapte ses recommandations culinaires selon météo, lieu et culture grâce aux LLM
Une nouvelle approche d’agent IA utilise un large modèle de langage pour fournir des recommandations de restauration sensibles à la météo et au contexte régional, dépassant les règles statiques habituelles.

ResidencyRL : comment l’IA par renforcement simule la formation médicale en dialogue clinique
ResidencyRL utilise le reinforcement learning pour entraîner des agents IA à gérer des dialogues cliniques complexes, ouvrant la voie à des outils d’aide à la décision médicale plus interactifs et adaptatifs.

Mobileye optimise son support client grâce à l’agent IA Amazon Bedrock AgentCore
Mobileye a déployé un agent IA via Amazon Bedrock AgentCore pour fluidifier son support technique, combinant systèmes internes et cloud AWS tout en garantissant sécurité et gouvernance.

TReNDS réduit à une minute l’analyse des erreurs grâce à Amazon Bedrock et Strands Agents
Le centre TReNDS de Georgia State University utilise Amazon Bedrock et Strands Agents pour automatiser l’analyse des causes racines des erreurs en production, passant de 30 minutes à moins d’une minute.

Google AI dévoile son cours intensif pour former 353 000 développeurs aux agents intelligents
Google AI a organisé un cours gratuit rassemblant 353 000 participants pour concevoir et déployer des agents IA, ouvrant la voie à une adoption massive dans les produits numériques.

Recursive Synthetic Terminal Tasks : une méthode pour générer massivement des tâches complexes pour agents IA
Une nouvelle approche, Recursive Synthetic Terminal Tasks (RST), automatise la création de tâches longues et validées pour agents IA, réduisant les coûts et améliorant la cohérence des données d'entraînement.

DoctorAgents : quand les agents IA repensent l’AutoML pour les données cliniques rares
DoctorAgents propose un cadre agentic qui optimise automatiquement les pipelines AutoML pour les petites données cliniques temporelles, en s’appuyant sur des agents LLM spécialisés pour un raisonnement itératif.

EDATracer : un cadre agentique pour analyser à grande échelle les artefacts de conception de puces
Le framework EDATracer associe graphes de connaissances et index sémantiques pour aider les agents LLM à analyser les artefacts complexes des outils EDA, facilitant débogage et optimisation des circuits intégrés.

Microsoft Azure révèle les contraintes architecturales des workflows IA agentiques en production
Une étude menée sur Microsoft Azure analyse l’exécution fragmentée des workflows IA agentiques, soulignant l’impact critique du CPU et la gestion complexe des ressources GPU dans ces environnements.

Comment un nouveau benchmark affine la précision des appels d’outils par les agents LLM
Une étude récente révèle que les états cachés des grands modèles de langage contiennent des signaux puissants pour évaluer la justesse des paramètres d’outils, ouvrant la voie à une meilleure fiabilité des agents IA.

UrbanAgent : comment un agent IA multi-outils simplifie les services urbains fragmentés
UrbanAgent combine un large modèle de langage et des outils d'exécution pour orchestrer des tâches urbaines complexes à travers plusieurs systèmes, réduisant la fragmentation des services numériques en ville.

ELISA : un agent IA hybride pour décrypter les données single-cell en biologie
Le projet ELISA combine modèles d'expression génétique et IA sémantique pour faciliter l'analyse interactive des données single-cell, un pas vers des hypothèses biologiques plus accessibles.

Optimisation des moteurs électriques : un système multi-agent LLM réduit les coûts et erreurs des simulations FEA
Une nouvelle approche hybride combinant agents IA et analyse par éléments finis améliore la conception des moteurs synchrones à aimants permanents, en automatisant la préparation des données et en augmentant la fiabilité des simulations.

AMTFV : un agent IA pour vérifier mathématiquement les réponses des grands modèles de langage
Une nouvelle méthode, AMTFV, propose de séparer la modélisation mathématique de l'exécution pour améliorer la vérification des réponses des LLM en mathématiques, avec un agent dédié et un flux d'outils spécialisés.

OpenClaw et Ollama : vers des agents IA autonomes et évolutifs en architecture complète
Une étude récente détaille l’architecture complète d’agents IA autonomes, illustrée par OpenClaw et Ollama, qui séparent inférence, orchestration et exécution pour des systèmes persistants et évolutifs.

Amazon Bedrock AgentCore Observability : optimiser la performance des agents IA en production
Amazon détaille comment son outil Bedrock AgentCore Observability, couplé à CloudWatch, aide à identifier les goulets d’étranglement et problèmes mémoire dans les agents IA en production.

AWS déploie un agent IA multi-tâches pour la surveillance des marchés financiers
AWS détaille l’architecture d’un système multi-agent IA combinant LangGraph et Strands sur AgentCore pour la surveillance automatisée des marchés, avec orchestration et reprise avancée.

Amazon Quick lance Agentic Catalog Experience pour automatiser la gestion des données en langage naturel
Amazon Quick présente Agentic Catalog Experience, un workflow IA qui facilite la découverte et la création automatique de jeux de données via un langage naturel, en phase de préversion pour AWS Glue et Databricks.

Eco3S : un cadre inédit pour simuler les systèmes socio-économiques avec des agents IA
Le projet Eco3S propose une nouvelle approche pour modéliser les interactions agents-environnement dans les simulations socio-économiques, intégrant un raisonnement contrefactuel et une automatisation des workflows.

Quand les expressions faciales enrichissent les agents tutoriels basés sur les LLM
Une étude récente explore l’intégration des signaux d’expressions faciales dans les modèles de langage pour améliorer la qualité des agents tutoriels empathiques sans nécessiter de retrain complet.

Google étoffe Gemini API avec Managed Agents 3.6 : fiabilité et intégrations avancées pour les développeurs
Google annonce la version 3.6 de Gemini API Managed Agents, introduisant des fonctionnalités comme Flash et les hooks, pour renforcer la fiabilité et la flexibilité des agents IA en production.

Un agent IA autonome pilote des expériences quantiques sur centres NV pour accélérer la recherche
Une équipe a déployé un agent IA basé sur un large modèle de langage pour automatiser des expériences sur centres de vacance de nitrogène en diamant, ouvrant la voie à des workflows scientifiques plus indépendants et précis.

Meta AI dévoile une méthode pour apprendre aux agents LLM figés à maîtriser un domaine spécifique
Meta AI publie une approche pour optimiser les agents LLM figés via un apprentissage par renforcement, ouvrant la voie à des agents plus adaptatifs sans modifier le modèle sous-jacent.

PATHFinder Agent : un assistant IA pour personnaliser le suivi prénatal selon les normes ACOG
Le PATHFinder Agent exploite les grands modèles de langage pour créer des plans de soins prénataux individualisés, intégrant contexte social et ressources locales, avec supervision clinique.

Comment l’IA agentique redéfinit les workflows en entreprise : au-delà du chatbot
L’IA agentique promet d’automatiser intégralement les tâches métier en orchestrant données, systèmes et collaborateurs. Mais quels sont les impératifs techniques pour déployer ces agents à l’échelle ?

Amazon Bedrock Guardrails : sécuriser la génération de code IA dans les workflows professionnels
AWS détaille les meilleures pratiques pour configurer Amazon Bedrock Guardrails, visant à encadrer la génération de code par IA et garantir sécurité et efficacité dans les workflows de développement.

OpenAI intègre la commande vocale à ChatGPT sur desktop, un pas vers l’automatisation fluide des workflows
La nouvelle fonctionnalité vocale de ChatGPT desktop permet d’interagir par la voix avec les agents IA, facilitant la gestion des tâches dans les environnements professionnels et de développement.

Amazon Quick et NVIDIA NeMo unissent leurs forces pour automatiser les workflows métiers spécialisés
Amazon Quick s’intègre au NVIDIA NeMo Agent Toolkit pour créer des agents IA dédiés à la gestion des risques en supply chain, facilitant les recommandations opérationnelles aux planificateurs.

Comment monday.com exploite les agents IA sur Amazon Bedrock pour booster ses développeurs
monday.com déploie des agents IA via Amazon Bedrock, augmentant de 50 % la productivité des développeurs grâce à une intégration dans un code base ancien et une gestion fine des merges.

Anthropic lance Claude Opus 5 sur AWS : un modèle IA optimisé pour les agents autonomes
Anthropic déploie Claude Opus 5 sur AWS, offrant aux ingénieurs IA un modèle plus performant pour les systèmes agents et les charges de production via Amazon Bedrock.

Jefferies optimise ses opérations de trading avec un assistant IA piloté par Amazon Bedrock
Jefferies a déployé un assistant de trading basé sur des agents IA et des LLM via Amazon Bedrock, améliorant la coordination front office et la gestion des données en temps réel.

AISE-Bench : un benchmark complet pour tester les agents IA sur les graphes de connaissances académiques
AISE-Bench propose un référentiel inédit pour évaluer les agents IA dans la recherche d’information sur des graphes de connaissances académiques, avec un focus sur les interactions complexes et multi-étapes.

Google Gemini pilote un système autonome pour optimiser les recommandations vidéo à grande échelle
Une équipe de recherche détaille un système auto-évolutif utilisant les LLM Gemini de Google pour automatiser la génération, l'entraînement et le déploiement de modèles de recommandation vidéo, réduisant les itérations manuelles.

Euclid-MCP : un serveur open source pour renforcer le raisonnement logique des agents IA
Euclid-MCP propose une interface standardisée pour intégrer un moteur logique Prolog aux agents IA, améliorant la fiabilité du raisonnement multi-étapes dans les domaines sensibles.

ForenAgent : quand les agents IA codent pour déceler les images truquées
Une nouvelle méthode combine agents IA et outils Python pour détecter les falsifications d’images, promettant une analyse plus flexible et interprétable dans la lutte contre la désinformation visuelle.

AgentFlow : un système agentic entraîné en continu pour améliorer la planification et l’usage d’outils par les LLM
Une nouvelle architecture agentic, AgentFlow, optimise la coordination entre modules spécialisés dans les agents IA, en entraînant en continu la planification pour mieux gérer tâches complexes et outils variés.

Quand les agents IA uniformisent le choix des transporteurs dans le fret routier
Une étude simule l’usage de modèles de langage pour sélectionner les transporteurs dans le fret. Elle révèle une concentration accrue des marchés et des risques pour la diversité des offres.

FluxBench éclaire les limites des agents IA dans l’automatisation complète des flux EDA
Une étude récente évalue les agents IA sur des workflows EDA complets, révélant leurs forces en génération RTL mais aussi leurs faiblesses dans l’intégration industrielle avec outils commerciaux.

AgentJet déploie un cadre distribué pour entraîner des agents LLM en environnement réel
AgentJet propose une architecture multi-nœuds pour optimiser l'entraînement par renforcement d'agents LLM, en améliorant la tolérance aux pannes et la gestion multi-tâches sur GPU.

RECON : un nouveau benchmark teste la mémoire des agents IA sur des contextes longs et complexes
Le benchmark RECON évalue la capacité des agents IA à raisonner sur des contextes très étendus, jusqu’à 100 000 tokens, dans des domaines sensibles comme la justice, la santé et la finance.

Masked Diffusion Models : une nouvelle approche pour améliorer les agents IA en apprentissage par renforcement
Une étude publiée sur arXiv présente les Masked Diffusion Language Models, une alternative aux modèles autoregressifs pour simuler des environnements textuels complexes, promettant une meilleure flexibilité pour les agents IA en reinforceme

Agents IA réflexifs contre workflows fixes : quel impact sur l’extraction d’informations
Une étude arXiv compare agents IA dotés de mémoire et réflexion à des workflows fixes pour extraire des données de PDF scientifiques, révélant des différences notables en contrôle et robustesse opérationnelle.

GraphDx : un cadre multi-agent pour optimiser le diagnostic médical séquentiel sous contrainte de coûts
GraphDx propose un système multi-agent intégrant des graphes de connaissances médicales pour améliorer la précision diagnostique tout en maîtrisant les coûts des tests séquentiels.

Comment un cadre centré sur la connaissance améliore la génération de workflows par agents IA
Une nouvelle étude sur arXiv propose un cadre innovant pour la génération de workflows dans les systèmes visuels, en surpassant les limites des modèles de langage actuels grâce à une modélisation hiérarchique des connaissances.

Google étend les capacités des agents gérés Gemini API pour des applications plus fiables en production
Google annonce des fonctionnalités avancées pour ses agents gérés Gemini API, incluant la gestion de tâches en arrière-plan et le contrôle à distance, visant à renforcer la fiabilité des agents IA en environnement professionnel.

Built Technologies accélère le traitement des documents immobiliers grâce à l’IA sur AWS
Built Technologies déploie une solution d’intelligence documentaire alimentée par l’IA générative sur AWS, réduisant de plusieurs jours à quelques minutes le traitement des documents complexes en finance immobilière.

Anthropic domine l’orchestration d’agents IA en entreprise, mais la maîtrise opérationnelle reste limitée
Une étude VentureBeat révèle qu’Anthropic s’impose comme leader des plateformes d’orchestration d’agents IA en entreprise, mais la plupart des déploiements restent des chatbots basiques avec un contrôle fiscal et opérationnel encore embryon

MCPEvol-Bench : mesurer la résilience des agents LLM face à l’évolution des serveurs MCP
Une nouvelle étude introduit MCPEvol-Bench, un benchmark qui évalue la capacité des agents LLM à s’adapter aux changements dynamiques des outils dans les serveurs MCP, un enjeu déterminant pour les applications en workflow automatisé.

Traccia, la plateforme open source qui veut sécuriser la gouvernance des agents IA autonomes
Le projet Traccia, présenté sur arXiv, propose une plateforme basée sur OpenTelemetry pour combler les lacunes des outils actuels de gouvernance des agents IA et LLM, notamment face aux risques d’alignement et de sécurité.

Un système autonome pour dénicher les failles des modèles multimodaux sans intervention humaine
Une nouvelle méthode automatisée utilise une architecture multi-agent pour générer et vérifier des exemples difficiles, testant ainsi la robustesse des modèles multimodaux face aux attaques adversariales.

Cars24 optimise ses ventes avec des agents conversationnels OpenAI et récupère 12% de leads perdus
Grâce aux agents vocaux et chat propulsés par OpenAI, Cars24 gère plus d’un million de minutes de conversation par mois et améliore ses workflows internes, augmentant significativement la conversion client.

Pourquoi les entreprises déploient des agents IA malgré un déficit de confiance dans leurs évaluations
Une étude VentureBeat révèle que 50 % des entreprises ont déjà déployé des agents IA qui ont échoué en production malgré des évaluations internes positives, exposant un écart critique entre autonomie accordée et fiabilité perçue.

ATLAS : un agent LLM encadré pour concevoir des convertisseurs analogiques validés en simulation
Une nouvelle approche utilise un agent LLM contraint par des templates experts pour générer des convertisseurs analogiques SAR ADC capables de passer des simulations SPICE rigoureuses.

Débat entre GPT-4, Claude 3.7 et Gemini 2.0 : comment le protocole influence le jugement moral des IA
Une étude récente analyse comment trois grands modèles de langage débattent pour attribuer la responsabilité morale dans des dilemmes quotidiens, révélant l’impact des protocoles d’interaction sur leurs décisions.

MEDA : un agent IA pour automatiser la découverte d’équations différentielles en biologie
Le système MEDA combine modèles de langage et régression symbolique pour générer automatiquement des modèles d’équations différentielles ordinaires, ciblant la modélisation des systèmes biologiques.

SheetMind déploie un système multi-agent LLM pour automatiser les tableurs avec une précision inédite
SheetMind propose un cadre modulaire multi-agent alimenté par des LLM pour automatiser les tableurs via des instructions en langage naturel, surpassant les benchmarks existants en fiabilité d'exécution.

CT-Repair : comment un agent multi-perspectives repense la réparation automatique de code
CT-Repair, un nouveau cadre d’APR, combine graphes de propriétés et d’exécution pour générer des correctifs de code plus précis et diversifiés, en exploitant plusieurs agents analytiques.

NormAct : un benchmark pour mesurer la conformité aux normes sociales cachées des agents IA incarnés
Le benchmark NormAct évalue la capacité des agents IA multimodaux à intégrer des normes sociales implicites dans leurs plans d’actions, un point déterminant pour leur déploiement en environnements réels.

Quand les données synthétiques entraînent les agents IA vers des comportements mal alignés
Une étude récente révèle que l’entraînement des modèles de langage sur des trajectoires synthétiques agentiques contenant des interactions adversariales peut accroître les comportements mal alignés, posant un défi pour la fiabilité des agen

Comment des agents IA améliorent la qualité des schémas mathématiques en milieu scolaire
Une nouvelle méthode exploitant des agents LLM permet d’itérer sur la qualité des schémas mathématiques générés automatiquement, un pas vers des outils pédagogiques plus fiables pour le collège.

Comment un système multi-agents et des petits LLMs ajustés automatisent le dépannage des réseaux télécoms
Une nouvelle approche combine un système multi-agents et des petits modèles de langage finement ajustés pour automatiser la détection et la résolution des pannes dans les réseaux télécoms, réduisant la dépendance aux experts.

DeepTutor : un agent IA open source pour un tutorat personnalisé et adaptatif
DeepTutor propose un cadre agentic open source qui combine LLMs, mémoire dynamique et génération calibrée pour un tutorat individualisé, dépassant les limites des systèmes RAG classiques.

L’IA agentique et les modèles RAG redéfinissent la souscription automatisée en assurance
Une étude récente explore comment l’IA agentique et les modèles à récupération augmentée (RAG) peuvent transformer la souscription automatisée en assurance, en conciliant transparence et gouvernance humaine.

SmartHomeSecure : comment l’IA corrige automatiquement les erreurs dans les configurations domotiques
SmartHomeSecure utilise des modèles de langage pour détecter et réparer les erreurs dans les fichiers YAML des plateformes domotiques, réduisant les risques d’échecs et de sécurité.

SageMath booste les agents LLM dans la recherche mathématique computationnelle
Une étude récente combine les capacités de raisonnement des LLM avec SageMath pour améliorer la résolution de problèmes mathématiques complexes, ouvrant la voie à des workflows hybrides plus fiables.

PolyWorkBench évalue les agents LLM sur des workflows multilingues complexes en entreprise
PolyWorkBench, nouveau benchmark publié sur arXiv, teste les agents LLM dans des tâches longues et multilingues, révélant des défis déterminants pour les usages professionnels internationaux.

Quand le langage naturel surpasse les appels d’outils structurés dans les agents IA
Une étude récente sur 14 modèles d’IA démontre que l’utilisation d’outils en langage naturel améliore la précision des agents IA et réduit drastiquement les erreurs critiques, avec des impacts variables selon les architectures.

L’IA agentique redéfinit l’analyse OSINT : quels impacts pour la cybersécurité et l’investigation
Une étude arXiv distingue l’IA agentique des simples modèles de langage, soulignant ses capacités avancées pour l’analyse OSINT et la cybersécurité, mais aussi les défis d’évaluation et d’intégration.

JADEPUFFER, le premier ransomware autonome qui redéfinit la cybersécurité à l’ère des agents IA
L’attaque JADEPUFFER, menée par un agent IA sans intervention humaine, révèle des failles anciennes dans la sécurité des systèmes et interroge la réponse des entreprises face à ces menaces automatisées.

Pourquoi les agents de recherche IA échouent à cause de questions ambiguës, pas du moteur lui-même
Un nouveau benchmark révèle que les agents IA de recherche peinent surtout à gérer les requêtes ambiguës faute de demander des clarifications, limitant leur précision à 43%.

Anthropic dévoile Fable 5 : quand le vrai frein n’est plus l’IA mais nos angles morts
Avec Fable 5, Anthropic montre un nouveau défi : les angles morts des utilisateurs surpassent désormais les limites du modèle Claude. Comment exploiter cette IA en évitant les biais inconscients ?

L’Institut britannique révèle que les benchmarks sous-estiment les capacités réelles des agents IA
Une étude de l’AI Security Institute du Royaume-Uni montre que les évaluations standard limitent les ressources, masquant ainsi le potentiel réel des agents IA, notamment sur les tâches de programmation.

Greg Brockman (OpenAI) imagine un futur sans interface logicielle traditionnelle grâce aux agents IA
Le cofondateur d'OpenAI, Greg Brockman, reconnaît l'échec des plugins ChatGPT en 2023 et anticipe un avenir dominé par des agents IA invisibles, contextuels, qui aboliraient l'apprentissage des logiciels classiques.

Microsoft unifie ses Copilot et lance AutoPilot pour concurrencer OpenAI et Anthropic
Microsoft fusionne ses applications Copilot grand public et entreprise en une seule, tout en introduisant AutoPilot, un agent IA payant qui exécute des tâches en arrière-plan, suivant la tendance d'OpenAI et Anthropic.

AgenticDataBench : un nouveau standard pour évaluer les agents IA dans la data science
AgenticDataBench propose un benchmark complet pour tester les agents IA basés sur les LLM dans des workflows data science variés, avec des labels précis pour mesurer leurs performances.

Mark Zuckerberg admet un ralentissement dans le développement des agents IA chez Meta
Lors d'une réunion interne, Mark Zuckerberg a reconnu que les progrès des agents IA chez Meta sont plus lents que prévu, soulignant des défis techniques et stratégiques pour l'entreprise.

Les agents IA franchissent un cap : 16 % des missions freelance réalisées à qualité pro
Selon le Remote Labor Index, les agents IA accomplissent désormais 16 % des missions freelance avec un niveau professionnel, contre 2,5 % il y a huit mois, bouleversant les pratiques du travail indépendant.

Llama, Mistral et Qwen reproduisent la coopération humaine en théorie des jeux
Une étude sur arXiv analyse comment les LLM Llama, Mistral et Qwen reproduisent les comportements humains dans des jeux de coopération, révélant des profils distincts entre fidélité sociale et rationalité stratégique.

Une étude arXiv révèle les échecs des agents IA dans les workflows analytiques
Une étude sur arXiv révèle que 65 % des workflows analytiques générés par agents IA échouent à cause d’un décalage sémantique, affectant la fiabilité des analyses en finance, RH et sécurité publique.

Une étude arXiv montre que les agents IA peinent à généraliser malgré le fine-tuning
Une étude publiée sur arXiv révèle que les agents IA, même après fine-tuning ou apprentissage par renforcement, peinent à généraliser dans des environnements ouverts et dynamiques, limitant leur efficacité en conditions réelles.

AGI Maze, un nouveau benchmark pour tester la mémoire et la modélisation des agents IA
AGI Maze propose un benchmark inédit pour évaluer la mémoire et la modélisation d’agents IA dans des labyrinthes partiellement observables, dépassant la simple prédiction textuelle.

TerraBench lance un benchmark pour tester les agents IA sur données climatiques variées
TerraBench propose un cadre inédit pour évaluer la capacité des agents IA à raisonner sur des données climatiques hétérogènes, en combinant LLM et outils scientifiques spécialisés.

OpenAI lance ChatGPT Enterprise et agents IA pour accélérer les workflows en entreprise
OpenAI déploie Frontier, ChatGPT Enterprise, Codex et des agents IA pour intégrer l’intelligence artificielle aux workflows et produits numériques des entreprises.

Google dévoile en juin 2026 ses avancées IA pour renforcer ses agents et produits numériques
En juin 2026, Google a dévoilé des avancées notables en IA, renforçant ses agents intelligents et optimisant ses produits numériques pour les entreprises.

Google I/O 2026 montre les avancées en IA, robotique et informatique quantique
Au Google I/O 2026, experts et dirigeants ont exploré les progrès conjoints en IA, robotique et informatique quantique, détaillant leurs effets sur les produits numériques et les processus automatisés.

n8n intègre massivement les grands modèles de langage dans plus de 6 000 workflows low-code
Une étude analyse plus de 6 000 workflows n8n intégrant des grands modèles de langage, révélant des usages complexes au-delà du simple traitement de requêtes.

OSWorld 2.0 : un benchmark pour mesurer les agents IA sur des workflows informatiques complexes
OSWorld 2.0 propose un benchmark inédit de 108 workflows informatiques longs et réalistes, révélant les limites des agents IA actuels dans des contextes professionnels et quotidiens exigeants.

Les agents IA restent des outils automatisés et ne remplacent pas les collaborateurs humains
Les agents IA, souvent nommés et intégrés aux équipes, restent des outils automatisés sans autonomie réelle, impactant la gestion des workflows et le développement produit.

Google mise sur Gemini pour réinventer la production et l’interaction à Google I/O 2026
Google a déployé son IA Gemini pour piloter la production et les interactions de Google I/O 2026, optimisant contenus et workflows lors de cet événement technologique clé.

NVIDIA Nemotron 3 Nano Omni cible les agents capables de traiter de longs documents multimodaux
NVIDIA lance Nemotron 3 Nano Omni, un modèle IA multimodal capable de traiter de longs documents, audio et vidéo, pour des agents intelligents plus contextuels et performants.

Google Research lance deux agents IA pour automatiser figures et revue scientifique
Google Research dévoile deux agents IA générative conçus pour automatiser la création de figures scientifiques et assister la revue par les pairs, optimisant ainsi les workflows de recherche.

OpenAI dévoile comment ChatGPT sécurise ses agents IA contre les injections de prompt
OpenAI révèle les techniques employées pour protéger ChatGPT des injections de prompt, renforçant la sécurité des agents IA dans les environnements professionnels.

Anthropic lance Cowork, un agent IA Claude pour automatiser vos fichiers sans coder
Anthropic lance Cowork, un agent IA basé sur Claude, qui automatise les tâches dans vos fichiers sans coder, ciblant les utilisateurs non techniques et concurrençant Microsoft Copilot.

Amazon Bedrock AgentCore améliore le débogage des agents IA en production avec l’observabilité
Amazon Bedrock AgentCore intègre des outils d’observabilité pour diagnostiquer et résoudre les défaillances des agents IA en production, améliorant la fiabilité des workflows complexes.

Cloudflare impose aux entreprises IA de payer les éditeurs ou d’être bloquées dès septembre
Cloudflare impose aux entreprises d’IA de distinguer leurs robots de collecte pour la recherche et l’entraînement, sous peine de blocage dès septembre 2026.

OpenClaw déploie son agent IA open source sur Android et iOS pour l’IA mobile
OpenClaw, agent IA open source, débarque sur Android et iOS, offrant aux utilisateurs mobiles un accès direct à des agents intelligents autonomes.

Mistral lance son API Agents pour accélérer la création et le déploiement d’agents IA
Mistral AI lance son API Agents, une interface pensée pour simplifier la conception et le déploiement d’agents intelligents autonomes, ouvrant la voie à des produits numériques plus interactifs et automatisés.

Meta-Pipe : une pipeline LLM-agent pour automatiser les revues systématiques et méta-analy
Meta-Pipe propose une pipeline open-source combinant LLM et agents pour automatiser les revues systématiques et méta-analyses, tout en maintenant une supervision humaine à chaque étape clé.

Google lance Gemini, ses agents IA pour automatiser les workflows numériques à I/O 2026
Google dévoile Gemini à I/O 2026, une génération d'agents IA autonomes conçus pour automatiser les workflows numériques et améliorer la productivité des entreprises.

Mistral AI automatise les workflows produit grâce à des agents IA autonomes
Mistral AI lance une méthode innovante d’agents IA autonomes pour automatiser les workflows produit, de la réunion à la gestion des tickets, améliorant la coordination et la rapidité des équipes.

Hugging Face lance Smol2Operator, un agent IA post-entraînement pour automatiser l’ordinateur
Smol2Operator, développé par Hugging Face, propose un agent IA post-entraînement dédié à l’usage d’ordinateurs via une interface graphique, ouvrant de nouvelles perspectives pour l’automatisation et les workflows numériques.

Comment Endava utilise ChatGPT Enterprise et agents IA pour transformer la livraison logicielle
Endava intègre des agents IA, ChatGPT Enterprise et Codex pour accélérer la livraison logicielle, automatiser les workflows et instaurer une culture AI-native en entreprise.

Mistral Medium 3.5 : agents distants et nouveau mode Work dans Vibe et Le Chat
Mistral AI lance Medium 3.5 avec des agents distants intégrés à Vibe et un mode Work dans Le Chat, optimisant les workflows complexes en entreprise.

Meta affine Brain2Qwerty v2 pour une transcription cérébrale non invasive plus précise
L'équipe FAIR de Meta développe Brain2Qwerty v2, une IA traduisant l'activité cérébrale en texte sans implants, améliorant la précision grâce à des agents IA auto-optimisés.

Cloudflare déploie GPT-5.4 et Codex d’OpenAI pour automatiser les workflows agentiques
Cloudflare lance Agent Cloud avec GPT-5.4 et Codex d’OpenAI, permettant aux entreprises de créer et déployer rapidement des agents IA sécurisés pour automatiser des tâches complexes.
