On vous a vendu le débat ChatGPT contre Claude contre Mistral comme s'il scellait le sort de votre produit IA. C'est faux. La démo qui a impressionné votre board ne dit rien de ce qui vous attend en production. Le modèle n'explique pas l'écart entre les deux. Une discipline d'ingénierie, rarement visible sur les slides, décide si votre agent crée de la valeur ou détruit la confiance.
Je construis des agents IA en production, pas en présentation. Sur Capston, l'IA n'est pas un gadget posé sur le produit. C'est le cœur de la valeur. J'y ai passé bien plus de temps sur l'évaluation et la récupération de contexte que sur le choix du fournisseur. En audit, je vois toujours le même scénario : une démo bluffante, un budget qui fond, et plus personne capable de dire si la dernière mise à jour a amélioré ou cassé le produit. Mes missions d'intégration IA pour SaaS et produits commencent par remettre cette mesure en place.
Pourquoi la démo tient et la production casse
Une démo, c'est un seul chemin heureux. Vous tapez la question pour laquelle l'agent a été réglé, devant des gens bienveillants. Ça marche. La production, c'est l'inverse. Des milliers d'utilisateurs posent la question de travers, dans un ordre imprévu, avec des données que vous n'aviez pas anticipées. C'est cette longue traîne qui fait gagner ou perdre.
Le rapport State of AI in Business 2025, mené par l'initiative NANDA du MIT, donne un chiffre brutal. 95 % des organisations n'obtiennent aucun retour mesurable de leurs pilotes d'IA générative, malgré 30 à 40 milliards de dollars investis. En réunion, les dirigeants accusent la réglementation ou la performance des modèles. L'étude pointe plutôt l'approche d'intégration. Un agent construit avec les mêmes raccourcis sera encore plus difficile à fiabiliser qu'un simple pilote.
Le modèle reste un composant interchangeable. Il change tous les trois mois et vos concurrents peuvent le brancher aussi vite que vous. Votre avantage vient du cadre construit autour : la mesure de la qualité, le contexte fourni et la gestion des erreurs. Un concurrent ne copie pas ce travail en une après-midi.
Ce que l'absence de cadre vous coûte vraiment
Un agent mal cadré crée d'abord un risque commercial. La facture arrive de trois côtés.
La confiance part en premier. On pardonne à un agent qui hésite. Lorsqu'il se trompe avec aplomb devant un client, la confiance disparaît aussi pour le produit. Une seule réponse fausse, assénée avec assurance, peut annuler cent réponses justes. Je me souviens d'un assistant qui passait toutes les démos. En production, il citait des montants erronés à des clients. Le modèle fonctionnait. Le système récupérait le mauvais document avant de l'interroger.
Ensuite le budget. Un agent qu'on ne mesure pas dérive en silence. Les appels se multiplient. Les coûts par requête grimpent. Vous le découvrez sur la facture trois mois plus tard. Sans visibilité sur ce que fait votre IA, vous payez le double pour une qualité que vous ne savez même pas évaluer.
La dépendance vient ensuite. Construire tout son produit sur un seul fournisseur lui confie votre marge et votre disponibilité. S'il augmente ses prix, dégrade un modèle ou tombe en panne, vous n'avez pas de plan B. Votre produit s'arrête avec lui. Ce risque stratégique reste invisible pendant une démo.
Les quatre piliers qui font tenir un agent
Quand on me demande de fiabiliser un agent, je ne commence jamais par changer de modèle. Je regarde quatre choses, dans un ordre précis.
Les évaluations viennent d'abord. Une eval est un jeu de tests réels qui mesure la qualité des réponses à chaque modification. Sur Capston, nous gardons une centaine de requêtes réelles représentatives. À chaque changement de prompt, de modèle ou de récupération, nous les rejouons. On vérifie que la qualité monte au lieu de baisser. Sans ce filet, vous pilotez à l'aveugle. Vous changez un mot dans une instruction, vous croyez améliorer et vous cassez dix cas sans le savoir.
La récupération de contexte vient ensuite, avec un RAG bien conçu. Le traiter comme une case à cocher mène vite à « on a branché du RAG, c'est bon ». Un agent ne vaut pourtant que ce qu'on lui donne à lire. S'il récupère le mauvais document, il répond faux avec une confiance parfaite. Dans la plupart des cas que j'ai vus, la qualité se joue sur la pertinence du contexte, bien avant le modèle qui le lit.
Les garde-fous et l'observabilité suivent. Un agent en production doit laisser une trace pour chaque appel, avec sa latence, son coût et sa qualité. Il lui faut un comportement prévu quand il ne sait pas, des limites claires et un humain dans la boucle lorsque l'enjeu l'exige. Sans ces protections, une plainte client vous apprendra la dérive avant vos alertes.
L'orchestration multi-modèles arrive en dernier. Une fois les trois premiers piliers en place, elle rend l'agent plus rentable. Classer une demande et rédiger une réponse nuancée exigent des capacités différentes. Routez chaque tâche vers le bon modèle, un petit et bon marché lorsqu'il suffit, un gros lorsque la nuance compte. Vous réduisez les coûts et la dépendance à un seul fournisseur. Personne ne le remarque en démo, mais cette architecture sépare le prototype du produit capable de tenir à l'échelle.
Par où commencer, et dans quel ordre
Si vous lancez un projet d'agent, inversez l'ordre habituel. Ne commencez pas par choisir le modèle. Commencez par définir ce qu'« une bonne réponse » veut dire pour vous. Puis construisez l'eval qui le mesure. Tant que vous ne mesurez pas la qualité, changer de modèle revient à régler un moteur les yeux bandés.
Soignez ensuite le contexte avant la puissance. Un modèle moyen bien nourri bat un modèle excellent mal nourri. À chaque fois. Investissez dans la récupération avant de payer le fournisseur le plus cher. Le multi-modèles vient en dernier, car il n'a de sens qu'une fois la qualité mesurable.
Et quand vous recrutez quelqu'un pour construire ça, la bonne question n'est pas « quel modèle utilisez-vous ? ». C'est « comment mesurez-vous que ça marche, et que se passe-t-il quand ça ne marche pas ? ». La plupart des entreprises n'échouent pas pour avoir choisi le mauvais modèle. Elles échouent parce que personne, chez elles, n'est responsable de mesurer, surveiller et améliorer le système. Cette fonction n'a souvent pas de propriétaire. C'est elle qu'il faut installer avant d'écrire la première ligne.
Ce qu'il faut retenir
- Le modèle est interchangeable, pas un avantage. Ce qui vous appartient, c'est le cadre autour.
- Une démo réussie ne prédit rien. La valeur se joue sur les cas réels, là où la plupart des projets d'IA échouent faute d'intégration, pas faute de modèle.
- Quatre leviers font la différence : evals, qualité de récupération, garde-fous, orchestration multi-modèles. Dans cet ordre, en commençant par savoir mesurer.
Questions fréquentes
Faut-il choisir le meilleur modèle du marché pour son agent IA ?
Non, et c'est rarement la bonne question. Le modèle est interchangeable, et le marché en change tous les trois mois. La fiabilité d'un agent vient du cadre autour : la mesure de la qualité, la pertinence du contexte, l'encadrement des erreurs. Un modèle moyen bien intégré bat un modèle de pointe mal intégré.
Pourquoi mon agent IA fonctionne en démo mais pas en production ?
Parce qu'une démo teste un seul chemin idéal. La production, elle, expose l'agent à tous les usages réels, imprévus et mal formulés. L'écart ne se comble pas en changeant de modèle. Il se comble avec des évaluations systématiques, une récupération de contexte fiable et des garde-fous pour les cas d'échec.
Qu'est-ce qu'une eval et pourquoi est-ce indispensable ?
Une eval est un jeu de tests réels. Elle mesure objectivement la qualité des réponses de votre agent à chaque modification. Sans elle, vous ne savez pas si un changement améliore ou dégrade votre produit. Vous avancez à l'aveugle. C'est le premier investissement à faire, avant même de choisir un modèle.
Conclusion
Le débat sur le meilleur modèle est confortable, parce qu'il promet une réponse simple. Demandez plutôt comment vous savez que votre agent tient et ce qui se passe quand il déraille. Cette réponse sépare un gadget d'un produit.
Si vous construisez un agent et que vous voulez qu'il survive à vos vrais utilisateurs, commencez par cadrer l'intégration IA dans votre produit, puis parlons-en : 30 minutes pour cadrer ce qui compte vraiment dans votre cas.
