LI Solutions

AI schrijft inmiddels bijna de helft van alle code. Een dev-agency beoordelen werd net een stuk lastiger.

AI now writes almost half of all code. Vetting a dev agency just got harder.

Belangrijkste inzichten

Iedereen is nu snel

Googles DORA-onderzoek stelde vast dat AI-ondersteunde teams zo'n 20% meer pull requests per developer opleveren, met 23,5% meer incidenten per wijziging. Snelheid is geen manier meer om agencies te vergelijken. Het verschil zit in discipline.

De data over ongereviewde AI-code is consistent

GitClear mat dat code churn sinds 2022 is verdubbeld, gedupliceerde blokken verachtvoudigd, refactoring 70% gedaald. Veracode vond een beveiligingsfout in 45% van de AI-codeertaken. Snel en schoon zijn twee verschillende claims.

Vraag naar onderhoudsverhalen, niet naar portfolio's

Een portfolio toont lanceringen. Een project dat de agency na het eerste jaar nog onderhoudt, toont code die het overleefd heeft. Dat is het sterkste signaal waar je om kunt vragen.

Goedkope offertes verschuiven kosten, ze schrappen ze niet

AI drukte de kosten van code schrijven, niet de kosten van reviewen en testen. Als een lage offerte daarin heeft gesneden om de prijs te halen, betaal je er later voor, tegen reddingstarieven.

Twee cijfers kaderen het probleem. GitHubs telemetrie laat zien dat Copilot inmiddels zo'n 46% schrijft van de code van de developers die het gebruiken, tegenover 27% bij de commerciële lancering in 2022. Gartner verwacht dat eind dit jaar 60% van alle nieuwe code AI-gegenereerd is. Welke agency je ook op het punt staat in te huren, AI schrijft een groot deel van je product. Dat staat vast.

Wat niet vaststaat, is hoe je die agency kiest. De signalen waarmee founders shops altijd vergeleken, een gelikt portfolio, demosnelheid, dagtarief, waren nooit geweldig. Nu zijn ze vrijwel nutteloos, want AI comprimeerde precies de delen van het werk die deze signalen maten.

Waarom de oude signalen niet meer werken

Een gelikte demo betekende vroeger iets. Een strakke UI, werkende auth en een geloofwaardige flow bij een klant krijgen kostte weken competent werk, dus de demo gold meteen als bewijs van een competent team. Vandaag is diezelfde demo bewijs van een abonnement van twintig dollar per maand. Elke tweemansshop zet hem in een dag in elkaar. Genoeg shops doen dat ook.

Snelheid vlakte ook af. Googles DORA-onderzoek stelde vast dat teams die AI adopteren ruwweg 20% meer pull requests per developer opleveren, en dat het aantal incidenten per wijziging met 23,5% steeg. Er gaat meer code de deur uit, en elk stuk ervan breekt net iets vaker iets. Als elke agency die je spreekt snel is, kun je niet meer op snelheid selecteren.

Ook prijs onderscheidt niet meer, vanaf de andere kant. Offertes voor dezelfde scope lopen inmiddels van een paar duizend dollar tot twintig keer zoveel, en de goedkope kant liegt niet per se. Ze kunnen het echt voor die prijs bouwen. Wat de offerte je niet vertelt, is in welke staat de code daarna verkeert, en wie daar later voor betaalt. Meestal jij.

Hoe ongereviewde AI-code er na zes maanden uitziet

Het onderzoek hier is onverbloemd. GitClear, dat ruim 600 miljoen codewijzigingen analyseerde, stelde vast dat code churn, regels die binnen weken na het schrijven worden herschreven of weggegooid, sinds 2022 ruwweg is verdubbeld. Gedupliceerde codeblokken verachtvoudigden in een enkel jaar. Refactoring, het onglamoureuze consolidatiewerk dat een codebase onderhoudbaar houdt, daalde zo'n 70%. Code wordt sneller geproduceerd en minder georganiseerd.

Beveiliging vertelt hetzelfde verhaal. Veracode joeg ruim 100 modellen door 80 codeertaken en kreeg in 45% van de resultaten een beveiligingsfout. Als een taak veilig of onveilig kon worden opgelost, kozen de modellen geregeld de onveilige variant. Bij cross-site scripting specifiek liep het faalpercentage op tot 86%.

En dit vind ik het veelzeggendst: de mensen die het dichtst op deze tools zitten, vertrouwen ze het minst. In de Stack Overflow-enquête van 2025 zei 46% van de developers de nauwkeurigheid van AI-output niet te vertrouwen, tegenover 33% die dat wel doet, en de meest ervaren developers waren het meest sceptisch van allemaal. Bijna de helft noemde het debuggen van AI-gegenereerde code een tijdvreter. De adoptie klom intussen gewoon door, naar 84%. Developers stopten niet met AI gebruiken. Ze stopten met aannemen dat het klopt.

Niets hiervan maakt AI-ondersteunde ontwikkeling een vergissing. Wij gebruiken deze tools dagelijks en de snelheidswinst is echt. Maar de winst komt nu en de schuld komt in maand drie, en daarom is het redden van AI-gebouwde apps een eigen dienstverlening geworden met een eigen prijslijst. De agencies die dat reddingswerk veroorzaken en de agencies die het uitvoeren zien er in een pitchmeeting identiek uit. Beide zijn snel. Het verschil zit in proces dat je in een demo niet ziet.

Zeven vragen die agencies nog wel onderscheiden

Je kunt geen codebase auditen voordat je de mensen hebt ingehuurd die hem zouden schrijven. Je kunt wel goed luisteren naar hoe een agency over proces praat. Op deze vragen geven gedisciplineerde en ongedisciplineerde shops zichtbaar verschillende antwoorden.

  1. Hoe gebruiken jullie AI in de ontwikkeling? Beide extreme antwoorden zijn slecht. "Wij niet" is óf onwaar, óf een teken dat je ambachtsprijzen betaalt voor commoditywerk. "AI doet het meeste" zonder vervolg is erger. Het antwoord dat je wilt, noemt concrete tools en beschrijft daarna, ongevraagd, hoe de output wordt gereviewd.
  2. Wie reviewt AI-gegenereerde code, en hoe? Luister naar de mechaniek: pull requests, een reviewer met naam, review voor de merge in plaats van na de lancering. "De AI controleert zichzelf" of "onze seniors houden een oogje in het zeil" betekenen allebei: niemand reviewt het.
  3. Hoe ziet testen eruit op een echt project? Vraag om de CI-pipeline van iets dat ze hebben opgeleverd. Een agency die op AI-snelheid werkt, heeft óf serieuze geautomatiseerde tests, óf levert die 45%-beveiligingsstatistiek rechtstreeks aan jouw productie.
  4. Kunnen jullie een project laten zien dat jullie al ruim een jaar onderhouden? Portfolio's tonen lanceringen. De GitClear-cijfers beschrijven wat er na de lancering gebeurt: churn, duplicatie, code die niemand consolideert. Een shop die nog onderhoudscontracten uit 2024 heeft, heeft code die het contact met de werkelijkheid heeft overleefd. Sterkste signaal op deze lijst.
  5. Waar zijn de review- en testuren in deze offerte gebleven? Als de prijs op de helft van je verwachting uitkwam, is er ergens in gesneden. Soms heeft AI de uren echt verlaagd en is de offerte eerlijk. Vraag ze de posten door te lopen en let op of review en testen de korting hebben overleefd.
  6. Draaien jullie securityscans, en waar? Het antwoord moet statische analyse binnen de CI-pipeline bevatten, geen eenmalige audit aan het eind. Nu bijna de helft van de ruwe AI-output een fout bevat, is doorlopend scannen het verschil tussen hem dinsdag vangen en erover horen van een klant.
  7. Hoe ziet de overdracht eruit als we uit elkaar gaan? Gedupliceerde, churnende code is vijandig voor elk team dat hem niet schreef. Je wilt documentatie, toegang tot de deployment en een codebase die een andere agency kan oppakken. Blijven ze hier vaag, dan is de rommel misschien de retentiestrategie.

Merk op dat je voor geen van deze vragen code hoeft te lezen. Ze vragen de agency om het eigen proces concreet te beschrijven, en dat doen gedisciplineerde shops moeiteloos, want ze beschrijven gewoon wat ze vanochtend deden. Ongedisciplineerde shops sturen het gesprek terug naar hun tools. En tools zijn nu net het enige dat niemand meer onderscheidt.

Veelgestelde vragen

Moet ik agencies mijden die AI gebruiken om code te schrijven?

Nee, en het zou je ook niet lukken. GitHubs eigen telemetrie zet AI op 46% van de code die developers met Copilot schrijven, en Gartner verwacht dat eind 2026 60% van alle nieuwe code AI-gegenereerd is. Het nuttige filter is niet of een agency AI gebruikt, maar of ze concreet kunnen beschrijven hoe de output wordt gereviewd en getest voordat die live gaat.

Is AI-gegenereerde code echt minder veilig?

Ongereviewd wel. Veracode testte ruim 100 modellen op 80 codeertaken en vond een beveiligingsfout in 45% van de resultaten; als een taak veilig of onveilig kon worden opgelost, kozen de modellen geregeld de onveilige route. Met statische analyse in de pipeline en menselijke review voor de merge worden die fouten gevangen. Dat is de opzet waar je om moet vragen.

Wat is de beste vraag die je een dev-agency kunt stellen in 2026?

Vraag om een project dat ze al langer dan een jaar onderhouden, en wat daar recent in is veranderd. Portfolio's tonen de lanceerdag. Onderhoudscontracten tonen of de code daarna overeind bleef. Een agency waarvan klanten blijven betalen om oude codebases door te ontwikkelen, heeft bewijs in handen dat een demo niet kan faken.

Waarom liggen offertes voor dezelfde scope zo ver uit elkaar?

Omdat AI de kosten van code produceren liet instorten terwijl de kosten van reviewen, testen en beveiligen gelijk bleven. Offertes aan de onderkant schrappen meestal die tweede categorie. De build wordt gewoon opgeleverd. De rekening voor wat is overgeslagen komt een paar maanden later, en reddingswerk aan AI-gebouwde apps loopt inmiddels van een paar duizend dollar voor een audit tot zes cijfers voor een rebuild.