Choisir son agence IA en 2026 : les 7 critères qu'un CTO doit exiger
En bref
Choisir une agence IA : 7 critères de décision pour sécuriser votre budget, comparer les prestataires et éviter les pièges avant de signer.
Pourquoi choisir une agence IA est différent de choisir une agence dev
Choisir une agence IA engage davantage qu’un budget de développement. Vous lui confiez des données, une partie de vos décisions opérationnelles et parfois une promesse faite à vos clients. Le risque n’est pas seulement qu’une fonction tombe en panne : une réponse plausible mais fausse peut être utilisée pendant des semaines avant d’être repérée.
La décision doit partir du métier : quel résultat, pour quels utilisateurs, avec quelle erreur acceptable et quel retour économique ? Sinon, deux devis au même intitulé peuvent couvrir une démonstration ou un service réellement exploitable.
Ces sept critères comparent les agences sur des preuves, sans demander au dirigeant de devenir expert technique.
Critère 1 — La capacité à relier l’IA à un résultat métier
Une agence compétente ne commence pas par choisir un modèle. Elle clarifie la décision à améliorer, le temps aujourd’hui perdu, le niveau de qualité attendu et les personnes qui adopteront l’outil. Elle peut ensuite proposer un RAG, c’est-à-dire une IA qui formule ses réponses à partir de vos documents, si cette approche sert réellement l’usage.
Avec un cadrage faible, vous financez une démonstration impressionnante mais inutile au quotidien. Les demandes s’ajoutent et personne ne peut dire si le projet a réussi. Avant de comparer, vous pouvez cadrer votre stratégie IA pour fixer priorités et critères d’arrêt.
Les preuves à demander
- Une reformulation en une page du problème, des utilisateurs, du résultat attendu et des exclusions.
- Une valeur de départ mesurée : temps de traitement, coût unitaire, taux d’erreur ou chiffre d’affaires concerné.
- Un plan par étapes avec une décision de poursuivre ou d’arrêter à chaque jalon.
- Deux références comparables par leur usage, avec un contact client et un résultat chiffré.
Question à poser
« Qu’avez-vous besoin de savoir avant de pouvoir chiffrer, et dans quel cas me conseilleriez-vous de ne pas lancer ce projet ? »
Une bonne réponse réclame des exemples de tâches, un échantillon de données, des volumes, les contraintes juridiques et un objectif mesurable. Elle nomme aussi les hypothèses qui pourraient rendre le projet non rentable. Une mauvaise réponse promet un prix et un délai après un échange commercial, sans accès au terrain ni aux futurs utilisateurs.
Critère 2 — Une méthode de qualité fondée sur vos cas réels
Avant le développement, convenez de ce qui constitue une réponse acceptable. L’agence doit bâtir avec vos équipes un jeu de tests réunissant des situations réelles, fréquentes, sensibles et ambiguës, puis mesurer chaque nouvelle version.
Sans cette référence, la recette devient une bataille d’opinions. Le comité de direction ne sait ni autoriser le lancement ni retenir un paiement. Vous risquez des réponses fausses ou un projet prolongé vers une perfection jamais définie.
Les preuves à demander
- De 50 à 500 cas représentatifs selon la variété de l’usage, validés par un responsable métier.
- Des seuils convenus avant la réalisation : exactitude, réponses refusées, temps gagné, délai de réponse et coût par opération.
- Un résultat comparé au processus actuel, pas seulement à la version précédente de l’outil.
- Une procédure claire pour traiter un échec critique et empêcher sa réapparition.
Question à poser
« Montrez-moi comment vous avez prouvé la qualité d’un projet livré et qui a validé le droit de le mettre en service. »
Une bonne réponse montre un tableau de résultats daté, explique les erreurs restantes et distingue ce qui a été accepté de ce qui a été corrigé. Une mauvaise réponse s’appuie sur une démonstration choisie, un ressenti global ou la seule puissance du fournisseur de modèle.
Critère 3 — La maîtrise du coût total, pas seulement du devis
Le prix de réalisation n’est qu’une partie de la dépense. Il faut ajouter les licences, l’hébergement, les appels aux modèles facturés selon l’usage, la maintenance, l’assistance et les évolutions. Le bon indicateur est le coût total sur trois ans, rapporté à une unité métier : dossier traité, réponse utile, heure économisée ou vente assistée.
Sans modèle économique, un projet abordable peut devenir prohibitif avec le succès. L’arbitrage dépend de la valeur produite, pas d’une course au modèle le moins cher. Notre guide sur le ROI de l’IA en entreprise aide à poser cette base.
Les preuves à demander
- Trois scénarios de volume — prudent, cible et haut — avec coût mensuel et coût unitaire.
- Les postes inclus, exclus et susceptibles d’augmenter en cas de changement de fournisseur.
- Une alerte budgétaire et un plafond automatique pour éviter une consommation incontrôlée.
- Un point trimestriel reliant dépenses réelles, usage et valeur créée.
Question à poser
« Si l’usage est multiplié par dix, combien paierons-nous par mois et quelles décisions pourrez-vous prendre pour contenir la facture ? »
Une bonne réponse présente des hypothèses lisibles, une fourchette et plusieurs leviers avec leur effet sur la qualité. Une mauvaise donne un montant fixe sans volumes, exclut les services tiers du calcul ou répond que les coûts seront vus après le lancement.
Critère 4 — Le pilotage des résultats une fois le service lancé
Le monitoring désigne le suivi continu du service après son lancement : disponibilité, qualité, coût et incidents. L’observabilité va un cran plus loin en permettant de comprendre rapidement pourquoi un résultat s’est dégradé. Pour un dirigeant, l’enjeu n’est pas le nom de l’outil utilisé, mais la présence d’indicateurs, de seuils d’alerte et d’un responsable qui agit.
Sans ce dispositif, coûts ou qualité peuvent dériver jusqu’à une plainte client, sans historique pour en trouver la cause. Le suivi doit aussi couvrir les résultats métier et les retours utilisateurs.
Les preuves à demander
- Un tableau de bord accessible à votre équipe : usage, disponibilité, qualité, coût et incidents.
- Des seuils d’alerte, un destinataire nommé et un délai d’intervention par niveau de gravité.
- La conservation d’un historique suffisant pour expliquer une dégradation.
- Un bilan mensuel au démarrage, puis trimestriel, avec décisions et responsables.
Question à poser
« Quelle alerte recevrai-je si la qualité baisse demain, qui interviendra et sous quel délai ? »
Une bonne réponse décrit un exemple d’incident, le seuil qui déclenche l’alerte, la personne d’astreinte et le retour à une version sûre. Une mauvaise se limite à « nous surveillons les serveurs » ou renvoie toute responsabilité à votre future équipe interne.
Critère 5 — La propriété, la protection des données et la conformité
Le contrat doit séparer ce qui vous appartient, ce qui est loué et ce que l’agence réutilise : code, instructions données à l’IA, données préparées, tests, documentation et modèles issus du fine-tuning — l’adaptation d’un modèle général à des exemples spécialisés.
Une clause vague crée trois risques : dépendre du prestataire pour chaque évolution, perdre l’accès à un actif payé, ou exposer des données confidentielles à un service non approuvé. Le lieu d’hébergement ne suffit pas à répondre à ces questions. Il faut connaître les flux de données, leur durée de conservation, les sous-traitants, les accès et les usages autorisés.
Les preuves à demander
- Une annexe listant les composants, leur propriétaire, leur licence et leur coût.
- Le dépôt du travail dans vos espaces dès le premier jour, avec des accès administrateur.
- Une carte simple des données : origine, destination, conservation, suppression et personnes habilitées.
- Les mesures prévues au titre du RGPD et, lorsque le cas l’exige, du règlement européen sur l’IA.
- Une procédure de restitution et de suppression en fin de contrat.
Question à poser
« Si nous arrêtons de travailler ensemble demain, que récupérons-nous et que devra faire le prochain prestataire pour reprendre le service ? »
Une bonne réponse fournit une liste exhaustive, un format de remise, un délai et les rares dépendances tierces restantes. Une mauvaise invoque un socle propriétaire non documenté, reporte la cession à la fin du projet ou ne sait pas dire si vos données servent à améliorer un service tiers. Le choix entre solution existante et développement propre est approfondi dans notre comparaison build vs buy.
Critère 6 — La capacité à passer en production et à durer
Un prototype convaincant n’est pas un service fiable. Le passage en production exige intégration, sécurité, test à la charge, accompagnement des utilisateurs et responsabilités définies. C’est la frontière entre expérimentation et actif durable.
Si l’offre s’arrête à la démonstration, votre entreprise hérite du travail difficile : connexions aux outils internes, gestion des accès, assistance, corrections et adoption. Le calendrier s’allonge après l’annonce du succès, les coûts non prévus apparaissent et le projet peut ne jamais être réellement utilisé.
Les preuves à demander
- Une définition contractuelle de la mise en production et des conditions de réception.
- Un plan de déploiement : intégrations, sécurité, charge, reprise en cas d’échec et accompagnement des utilisateurs.
- Un responsable nommé pour exploiter, corriger et mettre à jour le service après la livraison.
- Des délais d’intervention et un budget de maintenance séparé du projet initial.
- Un plan de sortie comprenant documentation, formation et assistance à la reprise.
Question à poser
« Qui fait quoi le premier mois après le lancement, puis à la fin de votre mission ? »
Une bonne réponse nomme les personnes, les horaires de prise en charge, les délais, les livrables de transfert et le coût annuel. Une mauvaise suppose que « vos équipes prendront la suite » sans les avoir évaluées ni formées, ou confond mise en ligne et mise en production.
Critère 7 — Un mode de collaboration qui rend les risques visibles
Une agence fiable livre une version testable toutes les deux semaines, implique les utilisateurs et consigne les décisions. Le comité de pilotage arbitre ainsi sur les tests, le budget, les risques et les décisions attendues.
Sans cette cadence, les incompréhensions s’accumulent jusqu’à la recette et les changements deviennent des conflits commerciaux. La transparence permet d’arrêter tôt une piste peu rentable.
Les preuves à demander
- Une démonstration testable toutes les deux semaines, sur vos cas et avec vos utilisateurs.
- Un suivi du budget consommé, du reste à faire, des risques et des décisions en attente.
- Un décideur identifié de chaque côté et une règle d’escalade en cas de blocage.
- Une documentation mise à jour au fil du projet et au moins deux sessions de formation.
- Une garantie de correction après lancement, avec durée et exclusions explicites.
Question à poser
« Que verrons-nous toutes les deux semaines, et comment saurai-je immédiatement qu’un délai ou un budget est menacé ? »
Une bonne réponse montre le support de pilotage utilisé sur un autre projet et explique comment une alerte a conduit à réduire ou revoir un périmètre. Une mauvaise promet des comptes rendus, mais aucun accès direct au travail, aux tests ou aux chiffres.
Framework de décision : scoring sur 70 points
Notez chaque agence de 0 à 10 après vérification des références : 0, aucune preuve ; 5, preuve partielle ; 10, preuve vérifiable, engagement écrit et responsable nommé. Justifiez chaque note en une phrase.
| Critère | Risque principal | Score /10 |
|---|---|---|
| Résultat métier et cadrage | Produit inutile ou périmètre instable | |
| Méthode de qualité | Erreurs invisibles ou recette interminable | |
| Coût total maîtrisé | Facture récurrente non rentable | |
| Pilotage après lancement | Dégradation découverte trop tard | |
| Propriété, données et conformité | Dépendance ou données exposées | |
| Passage en production et durée | Prototype jamais adopté | |
| Collaboration et transmission | Retards et reprise difficile | |
| Total | /70 |
Interprétation
- Moins de 40/70 : le risque est trop élevé sans garanties contractuelles supplémentaires.
- De 40 à 55/70 : offre envisageable sur un périmètre limité, avec jalons d’arrêt rapprochés.
- De 56 à 65/70 : partenaire solide, sous réserve des références et du contrat.
- Plus de 65/70 : dossier très convaincant ; vérifiez néanmoins qu’aucun critère critique n’est sous 6/10.
Le total ne doit jamais masquer un point éliminatoire. Une agence à 60/70 qui obtient 3/10 sur la protection des données ou la capacité à exploiter le service reste un mauvais choix pour un usage sensible.
Les 3 pièges classiques à éviter
Piège 1 — Comparer uniquement le montant des devis
Un écart de 15 à 20 % au départ peut disparaître avec un mois de retard, une intégration exclue ou une maintenance non anticipée. Faites remettre un coût sur trois ans, sur les mêmes volumes, avec une liste d’hypothèses et d’exclusions. Le prix le plus bas devient alors parfois l’offre la plus chère.
Piège 2 — Acheter un prototype en croyant acheter un service
Demandez que le devis distingue exploration, première version, intégration, sécurité, déploiement, formation et exploitation. Si une phase manque, elle ne disparaît pas : elle sera facturée plus tard ou prise en charge par vos équipes. Reliez chaque paiement à une preuve vérifiable plutôt qu’à une date seule.
Piège 3 — Accepter des références invérifiables
Appelez deux clients dont le service est utilisé depuis au moins six mois. Demandez si les délais et le budget ont tenu, ce qui s’est passé lors du premier incident, combien coûte l’exploitation et s’ils pourraient changer de prestataire. Un logo sur une présentation ne prouve ni la portée de la mission ni son résultat.
Comment reconnaître la meilleure agence IA
Le marché évolue vite, comme le documente l’AI Index de Stanford HAI, mais les bons signaux restent concrets. La meilleure agence réduit l’incertitude avant votre engagement.
- Elle chiffre après avoir enquêté. Elle demande des données, des volumes, des contraintes et l’accès aux utilisateurs avant de promettre.
- Elle montre des résultats et des difficultés. Un cas crédible comprend une mesure avant/après, des erreurs rencontrées et le coût d’exploitation.
- Elle rend les arbitrages lisibles. Vous comprenez ce qui améliore la qualité, ce qui réduit le délai et ce qui augmente le risque.
- Elle prépare son remplacement. Vos accès, votre documentation et votre droit de reprise existent dès le début.
- Elle sait dire non. Elle écarte un usage non rentable, une donnée insuffisante ou un calendrier irréaliste.
Demandez enfin aux personnes qui réaliseront la mission de participer au dernier entretien. Vous évaluerez ainsi l’équipe réelle, pas seulement le discours commercial. Chez Forgit, nous rendons notre processus de développement public pour permettre cette vérification avant le démarrage.
Conclusion
Choisir une agence IA revient à retenir un partenaire capable de transformer un enjeu métier en service mesurable et transmissible. Utilisez le score, puis inscrivez au contrat le résultat attendu, la qualité, le coût total, l’exploitation et les conditions de sortie.
Une bonne agence ne supprime pas toute incertitude. Elle la rend visible, la mesure et vous donne des points d’arrêt avant que le risque ne devienne coûteux.
Vous devez choisir un partenaire IA et vous voulez un avis extérieur ? → Discutons de vos enjeux