L'IA écrit désormais près de la moitié du code. Choisir une agence de développement est devenu bien plus compliqué.

Points clés à retenir
Tout le monde est rapide désormais
La recherche DORA de Google a constaté que les équipes assistées par IA livrent environ 20 % de pull requests en plus par développeur, avec 23,5 % d'incidents en plus par changement. La vitesse ne permet plus de comparer les agences. C'est la discipline qui fait l'écart.
Les données sur le code IA non relu sont cohérentes
GitClear a mesuré un churn de code qui a doublé depuis 2022, des blocs dupliqués multipliés par huit, un refactoring en baisse de 70 %. Veracode a trouvé une faille de sécurité dans 45 % des tâches de codage IA. Rapide et propre sont deux promesses différentes.
Demandez des histoires de maintenance, pas des portfolios
Un portfolio montre des lancements. Un projet que l'agence maintient depuis plus d'un an montre du code qui a survécu. C'est le signal le plus fort que vous puissiez demander.
Les devis bon marché reportent le coût, ils ne le suppriment pas
L'IA a compressé le coût d'écriture du code, pas celui de sa relecture et de ses tests. Si un devis bas a sacrifié ces postes pour atteindre son prix, vous les paierez plus tard, au tarif d'un sauvetage.
Deux chiffres posent le problème. La télémétrie de GitHub montre que Copilot écrit désormais environ 46 % du code produit par les développeurs qui l'utilisent, contre 27 % à son lancement commercial en 2022. Gartner s'attend à ce que 60 % de tout le nouveau code soit généré par IA d'ici la fin de l'année. Quelle que soit l'agence que vous vous apprêtez à engager, l'IA écrira une grande partie de votre produit. Ce point-là est tranché.
Ce qui ne l'est pas, c'est la façon de choisir l'agence. Les signaux que les fondateurs ont toujours utilisés pour comparer les prestataires, le vernis du portfolio, la vitesse de la démo, le taux journalier, n'ont jamais été très fiables. Ils sont aujourd'hui presque inutiles, parce que l'IA a compressé précisément les parties du travail que ces signaux mesuraient.
Pourquoi les anciens signaux ne fonctionnent plus
Une démo soignée voulait dire quelque chose. Mettre devant un client une interface propre, une authentification qui marche et un parcours crédible demandait des semaines de travail compétent, si bien que la démo servait aussi de preuve d'une équipe compétente. Aujourd'hui, la même démo prouve l'existence d'un abonnement à vingt dollars par mois. N'importe quelle équipe de deux personnes peut en monter l'ossature en une journée. Beaucoup le font.
La vélocité s'est nivelée elle aussi. La recherche DORA de Google a constaté que les équipes qui adoptent l'IA livrent environ 20 % de pull requests en plus par développeur, et que les incidents par changement ont augmenté de 23,5 % dans le même temps. Plus de code sort, et chaque morceau a un peu plus de chances de casser quelque chose. Quand toutes les agences que vous rencontrez sont rapides, la vitesse n'est plus un critère de sélection.
Le prix a cessé de discriminer dans l'autre sens. Les devis pour un même périmètre vont désormais de quelques milliers de dollars à vingt fois plus, et le bas de la fourchette ne ment pas forcément. Ils peuvent réellement le construire à ce prix. Ce que le devis ne dit pas, c'est l'état du code à l'arrivée, et qui paiera cet état plus tard. En général, vous.
À quoi ressemble du code IA non relu au bout de six mois
La recherche est sans détour sur ce point. GitClear, qui a analysé plus de 600 millions de changements de code, a constaté que le churn, c'est-à-dire les lignes réécrites ou jetées quelques semaines après avoir été écrites, a environ doublé depuis 2022. Les blocs de code dupliqués ont été multipliés par huit en un an. Le refactoring, ce travail ingrat de consolidation qui garde un codebase maintenable, a chuté d'environ 70 %. Le code est produit plus vite et organisé moins.
La sécurité raconte la même histoire. Veracode a fait passer plus de 100 modèles sur 80 tâches de codage et a obtenu une faille de sécurité dans 45 % des résultats. Quand une tâche pouvait être résolue de façon sûre ou non sécurisée, les modèles choisissaient régulièrement la mauvaise option. Pour le cross-site scripting en particulier, le taux d'échec a atteint 86 %.
Voici le détail que je trouve révélateur : les personnes les plus proches de ces outils sont celles qui leur font le moins confiance. Dans l'enquête 2025 de Stack Overflow, 46 % des développeurs disent ne pas faire confiance à l'exactitude des résultats de l'IA, contre 33 % qui la leur accordent, et les développeurs les plus expérimentés étaient les plus sceptiques de tous. Près de la moitié qualifient le débogage de code généré par IA de gouffre à temps. L'adoption a pourtant continué de grimper, jusqu'à 84 %. Les développeurs n'ont pas cessé d'utiliser l'IA. Ils ont cessé de supposer qu'elle a raison.
Rien de tout cela ne fait du développement assisté par IA une erreur. Nous utilisons ces outils tous les jours et le gain de vitesse est réel. Mais le gain arrive tout de suite et la dette arrive au troisième mois, ce qui explique pourquoi le sauvetage d'applications construites à l'IA est devenu une ligne de service à part entière avec sa propre grille tarifaire. Les agences qui génèrent ce travail de sauvetage et celles qui s'en chargent sont identiques en réunion de pitch. Les deux sont rapides. La différence tient à un processus invisible depuis une démo.
Sept questions qui distinguent encore les agences
Vous ne pouvez pas auditer un codebase avant d'avoir embauché ceux qui l'écriront. Vous pouvez en revanche écouter attentivement la façon dont une agence parle de son processus. Sur ces questions, les équipes disciplinées et les autres donnent des réponses visiblement différentes.
- Comment utilisez-vous l'IA en développement ? Les deux réponses extrêmes sont mauvaises. « On ne l'utilise pas » est soit faux, soit le signe que vous payez un prix d'artisan pour un travail de commodité. « L'IA fait presque tout », sans rien derrière, est pire. La réponse que vous voulez cite des outils précis puis, spontanément, décrit comment leur production est relue.
- Qui relit le code généré par IA, et comment ? Guettez la mécanique : pull requests, un relecteur nommément désigné, revue avant merge et non après le lancement. « L'IA se vérifie elle-même » ou « nos seniors gardent un œil dessus » se traduisent tous les deux par : personne ne le relit.
- À quoi ressemblent les tests sur un vrai projet ? Demandez à voir le pipeline CI d'un projet qu'ils ont livré. Une agence qui avance à la vitesse de l'IA a soit des tests automatisés sérieux, soit elle expédie cette statistique de 45 % de failles droit dans votre production.
- Pouvez-vous me montrer un projet que vous maintenez depuis plus d'un an ? Les portfolios montrent des lancements. Les chiffres de GitClear décrivent l'après : churn, duplication, code que personne ne consolide. Une équipe qui détient encore des contrats de maintenance signés en 2024 a du code qui a survécu au contact de la réalité. Le signal le plus fort de cette liste.
- Où sont passées les heures de revue et de tests dans ce devis ? Si le prix arrive à la moitié de ce que vous attendiez, quelque chose a sauté. Parfois l'IA a réellement réduit les heures et le devis est honnête. Demandez-leur de dérouler les postes ligne par ligne et regardez si la revue et les tests ont survécu à la remise.
- Faites-vous du scan de sécurité, et à quel endroit ? La réponse doit inclure de l'analyse statique au sein du pipeline CI, pas un audit ponctuel à la fin. Quand près de la moitié de la production brute de l'IA porte une faille, scanner au fil de l'eau fait la différence entre l'attraper mardi et l'apprendre par un client.
- À quoi ressemble la passation si nos chemins se séparent ? Un code dupliqué et instable est hostile à toute équipe qui ne l'a pas écrit. Vous voulez de la documentation, les accès de déploiement et un codebase qu'une autre agence pourrait reprendre. S'ils restent vagues ici, le désordre est peut-être la stratégie de rétention.
Remarquez qu'aucune de ces questions ne vous demande de lire du code. Elles demandent à l'agence de décrire son propre processus en détail, ce que les équipes disciplinées font sans effort puisqu'elles racontent ce qu'elles ont fait le matin même. Les équipes indisciplinées ramèneront la conversation vers leurs outils. Or les outils sont la seule chose qui ne distingue plus personne.
Questions fréquentes
Faut-il éviter les agences qui utilisent l'IA pour écrire du code ?
Non, et vous n'y arriveriez pas même en essayant. La télémétrie de GitHub attribue à l'IA 46 % du code écrit par les développeurs qui utilisent Copilot, et Gartner s'attend à ce que 60 % de tout le nouveau code soit généré par IA d'ici fin 2026. Le bon filtre n'est pas de savoir si une agence utilise l'IA, mais si elle sait décrire, concrètement, comment sa production est relue et testée avant la mise en ligne.
Le code généré par IA est-il vraiment moins sûr ?
Non relu, oui. Veracode a testé plus de 100 modèles sur 80 tâches de codage et a trouvé une faille de sécurité dans 45 % des résultats ; quand une tâche pouvait être résolue de façon sûre ou non, les modèles choisissaient régulièrement la voie non sécurisée. Avec de l'analyse statique dans le pipeline et une revue humaine avant merge, ces failles sont attrapées. C'est ce dispositif-là qu'il faut exiger.
Quelle est la meilleure question à poser à une agence de développement en 2026 ?
Demandez à voir un projet qu'elle maintient depuis plus d'un an, et ce qui y a changé récemment. Les portfolios montrent le jour du lancement. Les contrats de maintenance montrent si le code a tenu ensuite. Une agence dont les clients continuent de payer pour faire évoluer d'anciens codebases détient une preuve qu'aucune démo ne peut imiter.
Pourquoi les devis d'agences sont-ils si éloignés pour le même périmètre ?
Parce que l'IA a fait s'effondrer le coût de production du code pendant que le coût de sa relecture, de ses tests et de sa sécurisation restait le même. Les devis du bas de la fourchette rognent en général sur la seconde catégorie. Le produit sort quand même. La facture de ce qui a été sauté arrive quelques mois plus tard, et le sauvetage d'applications construites à l'IA va aujourd'hui de quelques milliers de dollars pour un audit à six chiffres pour une reconstruction.
Articles liés
L'app store de ChatGPT a six mois. Faut-il déjà y construire votre app ?
900 millions de personnes utilisent ChatGPT chaque semaine, et il dispose désormais d'un SDK d'apps, d'un annuaire et de ses 300 premières apps. La promesse de distribution est réelle. Le trafic, pour l'instant, l'est nettement moins.
Ce que coûte le sauvetage d'une application vibe-coded en 2026
Réparer les applications construites à l'IA est désormais une prestation à part entière, et les devis vont de l'audit à 3 000 $ à la reconstruction à un demi-million. Voici les vrais paliers, et les cinq signaux qui disent dans lequel vous êtes.