Agents IA & automatisation20 juillet 2026

Agents IA autonomes : MCP, tool use et orchestration

MCP, tool use, patterns multi-agents : comment passer d'un POC LangChain à des agents fiables en production, sans exploser la facture OpenAI.

Depuis fin 2024, le paysage des agents IA s'est stabilisé autour de trois briques : le tool use natif des LLM (function calling), le protocole MCP (Model Context Protocol) publié par Anthropic, et des frameworks d'orchestration matures comme LangGraph, CrewAI ou OpenAI Agents SDK. Le POC de démo est facile ; ce qui l'est moins, c'est de tenir en production avec des SLA, un budget maîtrisé et une observabilité correcte. Voici ce que nous constatons sur nos missions.

Le socle : tool use, pas prompt engineering

Un agent, techniquement, c'est une boucle : le LLM reçoit un objectif, choisit un outil parmi une liste, exécute, observe le résultat, recommence jusqu'à terminaison. Le tool use (function calling) est aujourd'hui supporté nativement par GPT-4.1, Claude 3.5/4 Sonnet, Gemini 2.5 et Mistral Large. Fini les regex sur du texte libre.

from openai import OpenAI
client = OpenAI()

tools = [{
  "type": "function",
  "function": {
    "name": "get_invoice_status",
    "description": "Retourne le statut d'une facture SAP",
    "parameters": {
      "type": "object",
      "properties": {"invoice_id": {"type": "string"}},
      "required": ["invoice_id"]
    }
  }
}]

resp = client.responses.create(
    model="gpt-4.1",
    input="Statut de la facture INV-2847 ?",
    tools=tools
)

Règle empirique issue de nos audits : au-delà de 15-20 outils exposés simultanément, la précision du choix chute nettement. Il faut alors segmenter par sous-agent spécialisé ou introduire un routeur.

MCP : le port USB-C des agents

Le Model Context Protocol, ouvert par Anthropic en novembre 2024 et adopté depuis par OpenAI, Google DeepMind et Microsoft Copilot Studio, standardise la manière dont un agent découvre et appelle des outils externes. Concrètement, un serveur MCP expose trois primitives : resources (données lisibles), tools (actions) et prompts (templates réutilisables).

L'intérêt pour une DSI est direct : au lieu de recoder l'intégration Jira, GitHub, Snowflake ou SharePoint pour chaque framework d'agent, on écrit un serveur MCP réutilisable côté Claude Desktop, Cursor, ou une app maison. L'écosystème compte déjà plus de 200 serveurs open source (Postgres, Sentry, Linear, Kubernetes…).

Point d'attention sécurité : un serveur MCP mal configuré = injection d'outil. Signez vos serveurs, isolez-les par tenant, et journalisez chaque appel.

Orchestration multi-agents : quand et comment

Le réflexe « multi-agents » est souvent prématuré. Anthropic elle-même recommande de commencer par un agent unique bien outillé. On passe au multi-agents quand :

  • Les rôles sont cognitivement disjoints (rechercheur vs rédacteur vs vérificateur)
  • Le parallélisme apporte un gain de latence mesurable
  • Le contexte d'un agent unique dépasserait 100k tokens

Comparatif des frameworks (état T4 2025)

| Framework | Modèle | Point fort | Limite | |---|---|---|---| | LangGraph | Graphe explicite | Contrôle fin, checkpointing | Courbe d'apprentissage | | CrewAI | Rôles + tâches | Prise en main rapide | Debugging opaque | | OpenAI Agents SDK | Handoffs légers | Traces natives, guardrails | Couplé à l'écosystème OpenAI | | AutoGen 0.4 | Acteurs asynchrones | Multi-agents distribués | API encore mouvante |

Pour des workflows d'entreprise avec branches conditionnelles, retry et human-in-the-loop, LangGraph reste notre choix par défaut. Pour du prototypage rapide, CrewAI. Pour rester dans l'écosystème OpenAI de bout en bout, l'Agents SDK avec ses handoffs fait le job.

Cas d'usage entreprise qui tiennent la route

En 2025, les déploiements que nous voyons réellement en production tournent autour de quatre familles :

  1. Support N1 augmenté : agent qui lit le ticket, interroge la KB via RAG, consulte l'état du système (MCP → Datadog/ServiceNow) et propose une réponse. Taux de résolution automatique observé : 30-45 % sur des périmètres bien cadrés.
  2. Ingénierie logicielle : Cursor, Cline, Devin, Claude Code. Génération de PR, migration de code, revue automatisée. ROI concret sur les migrations Java 8→21 ou Angular→React.
  3. Analyse financière et procure-to-pay : agents qui rapprochent factures/bons de commande via MCP sur SAP ou Coupa. Gain typique : 60-70 % du temps de traitement manuel.
  4. Ops et FinOps : agents qui investiguent une alerte Prometheus, corrèlent avec les déploiements Argo CD et proposent un rollback. À déployer en dry-run pendant plusieurs semaines avant toute action.

Checklist de mise en production

  • [ ] Observabilité : LangSmith, Langfuse ou Arize Phoenix branchés dès le jour 1
  • [ ] Budget par run : hard cap en tokens et en $, pas juste un warning
  • [ ] Guardrails : validation entrée/sortie (Pydantic, Guardrails AI), filtrage PII
  • [ ] Human-in-the-loop sur toute action irréversible (paiement, suppression, email externe)
  • [ ] Évaluation continue : jeu de tests versionné, mesuré à chaque changement de prompt ou de modèle
  • [ ] Fallback déterministe : si l'agent échoue 2 fois, escalade vers un humain ou un workflow classique
  • [ ] Isolation : sandbox pour l'exécution de code (E2B, Modal, Firecracker)

À retenir

  • Le tool use natif des LLM modernes a rendu obsolètes les patterns ReAct textuels de 2023.
  • MCP devient le standard d'intégration ; investir dans des serveurs MCP internes réutilisables est un pari raisonnable.
  • Un agent unique bien outillé bat souvent une architecture multi-agents mal cadrée. Le multi-agents se justifie par des rôles disjoints, pas par mimétisme.
  • La production impose observabilité, plafonds de coût et human-in-the-loop : ce sont ces trois éléments qui distinguent un POC d'un système fiable.
  • Le vrai coût d'un agent en prod n'est pas les tokens, c'est la maintenance des prompts, des évaluations et des intégrations. Budgétez en conséquence.
Partager cet article

Lire aussi