LI Solutions

KI skriver nå nesten halvparten av all kode. Å vurdere et utviklingsbyrå ble nettopp vanskeligere.

AI now writes almost half of all code. Vetting a dev agency just got harder.

Viktigste poenger

Alle er raske nå

Googles DORA-forskning fant at KI-assisterte team leverer rundt 20 % flere pull requests per utvikler, med 23,5 % flere hendelser per endring. Fart sluttet å være en måte å sammenligne byråer på. Disiplin er der forskjellen ligger.

Dataene om ugjennomgått KI-kode er konsistente

GitClear målte at code churn er doblet siden 2022, dupliserte blokker åttedoblet, refaktorering ned 70 %. Veracode fant en sikkerhetsfeil i 45 % av KI-kodeoppgavene. Rask og ryddig er to forskjellige påstander.

Be om vedlikeholdshistorier, ikke porteføljer

En portefølje viser lanseringer. Et prosjekt byrået har vedlikeholdt forbi det første året, viser kode som overlevde. Det er det sterkeste enkeltsignalet du kan be om.

Billige tilbud utsetter kostnaden, de fjerner den ikke

KI presset ned kostnaden ved å skrive kode, ikke kostnaden ved å gjennomgå og teste den. Hvis et lavt tilbud kuttet de delene for å nå prisen, betaler du for dem senere, til redningspriser.

To tall rammer inn problemet. GitHubs telemetri viser at Copilot nå skriver rundt 46 % av koden produsert av utviklerne som bruker det, opp fra 27 % da det ble lansert kommersielt i 2022. Gartner venter at 60 % av all ny kode er KI-generert innen utgangen av året. Uansett hvilket byrå du er i ferd med å hyre, skriver KI en stor andel av produktet ditt. Den delen er avgjort.

Det som ikke er avgjort, er hvordan du velger byrået. Signalene gründere alltid har brukt for å sammenligne byråer, polert portefølje, demofart, dagrate, var aldri spesielt gode. Nå er de nesten ubrukelige, fordi KI komprimerte akkurat de delene av arbeidet signalene pleide å måle.

Hvorfor de gamle signalene sluttet å virke

En polert demo pleide å bety noe. Å få et rent grensesnitt, fungerende innlogging og en troverdig flyt foran en kunde krevde uker med kompetent arbeid, så demoen fungerte samtidig som bevis på et kompetent team. I dag er den samme demoen bevis på et abonnement til tjue dollar i måneden. Et hvilket som helst topersonsbyrå kan rigge den opp på en dag. Mange gjør det.

Farten flatet også ut. Googles DORA-forskning fant at team som tar i bruk KI leverer omtrent 20 % flere pull requests per utvikler, og at hendelser per endring samtidig steg 23,5 %. Mer kode går ut døren, og hver del av den har litt større sjanse for å ødelegge noe. Når hvert byrå du snakker med er raskt, er fart ikke lenger noe du kan velge etter.

Pris sluttet å skille fra den andre kanten. Tilbud for samme omfang spenner nå fra noen tusen dollar til tjue ganger så mye, og den billige enden lyver ikke nødvendigvis. De kan faktisk bygge det til den prisen. Det tilbudet ikke forteller deg, er tilstanden koden er i etterpå, og hvem som betaler for den tilstanden senere. Som regel deg.

Hvordan ugjennomgått KI-kode ser ut etter seks måneder

Forskningen her er brutal. GitClear, som analyserte over 600 millioner kodeendringer, fant at code churn, altså linjer som skrives om eller kastes innen få uker etter at de ble skrevet, omtrent er doblet siden 2022. Dupliserte kodeblokker ble åttedoblet på ett enkelt år. Refaktorering, det lite glamorøse konsolideringsarbeidet som holder en kodebase vedlikeholdbar, falt rundt 70 %. Kode produseres raskere og organiseres mindre.

Sikkerheten forteller samme historie. Veracode kjørte over 100 modeller gjennom 80 kodeoppgaver og fikk en sikkerhetsfeil i 45 % av resultatene. Når en oppgave kunne løses på en sikker eller en usikker måte, valgte modellene jevnlig den usikre. For cross-site scripting spesifikt nådde feilraten 86 %.

Her er delen jeg synes er talende: menneskene som står nærmest disse verktøyene, stoler minst på dem. I Stack Overflows undersøkelse fra 2025 sa 46 % av utviklerne at de ikke stoler på nøyaktigheten i KI-resultater, mot 33 % som gjør det, og de mest erfarne utviklerne var de mest skeptiske av alle. Nesten halvparten kalte feilsøking av KI-generert kode et tidssluk. Bruken fortsatte likevel å klatre, til 84 %. Utviklerne sluttet ikke å bruke KI. De sluttet å anta at den har rett.

Ingenting av dette gjør KI-assistert utvikling til en feil. Vi bruker disse verktøyene daglig, og fartsgevinsten er reell. Men gevinsten kommer nå og gjelden kommer i måned tre, og det er derfor redning av KI-bygde apper ble en egen tjenestelinje med sin egen prisliste. Byråene som genererer det redningsarbeidet og byråene som gjør redningen, ser identiske ut i et pitchmøte. Begge er raske. Forskjellen sitter i prosesser du ikke kan se fra en demo.

Sju spørsmål som fortsatt skiller byråer

Du kan ikke revidere en kodebase før du har hyret menneskene som skulle skrive den. Men du kan lytte nøye til hvordan et byrå snakker om prosess. På disse spørsmålene gir disiplinerte og udisiplinerte byråer synlig forskjellige svar.

  1. Hvordan bruker dere KI i utviklingen? Begge ytterpunktene er dårlige svar. "Vi gjør ikke det" er enten usant eller et tegn på at du betaler håndverkspriser for hyllevarearbeid. "KI gjør det meste" uten noe mer er verre. Svaret du vil ha, navngir faktiske verktøy og beskriver deretter, uoppfordret, hvordan resultatet gjennomgås.
  2. Hvem gjennomgår KI-generert kode, og hvordan? Lytt etter mekanikken: pull requests, en navngitt reviewer, gjennomgang før merge i stedet for etter lansering. "KI-en sjekker seg selv" eller "seniorene våre følger med" betyr begge deler det samme: ingen gjennomgår den.
  3. Hvordan ser testing ut på et ekte prosjekt? Be om å få se CI-pipelinen fra noe de har levert. Et byrå som beveger seg i KI-fart har enten seriøs automatisert testing, eller sender den 45-prosents sikkerhetsstatistikken rett inn i produksjonen din.
  4. Kan dere vise meg et prosjekt dere har vedlikeholdt i over ett år? Porteføljer viser lanseringer. GitClear-tallene beskriver det som skjer etter lansering: churn, duplisering, kode ingen konsoliderer. Et byrå som fortsatt har vedlikeholdskontrakter fra 2024, har kode som overlevde møtet med virkeligheten. Sterkeste signal på denne listen.
  5. Hvor ble det av gjennomgangs- og testtiden i dette tilbudet? Hvis prisen kom inn på halvparten av det du ventet, ble noe kuttet. Noen ganger kuttet KI faktisk timene, og tilbudet er ærlig. Be dem gå gjennom postene, og følg med på om gjennomgang og testing overlevde rabatten.
  6. Kjører dere sikkerhetsskanning, og hvor? Svaret bør inkludere statisk analyse inne i CI-pipelinen, ikke en engangsrevisjon på slutten. Når nesten halvparten av rå KI-kode bærer på en feil, er løpende skanning forskjellen på å fange den på tirsdag og å høre om den fra en kunde.
  7. Hvordan ser en overlevering ut hvis vi skiller lag? Duplisert kode i konstant endring er fiendtlig mot ethvert team som ikke skrev den. Du vil ha dokumentasjon, tilgang til deploy og en kodebase et annet byrå kan plukke opp. Blir de vage her, kan rotet være selve strategien for å holde på deg.

Legg merke til at ingen av disse krever at du leser kode. De krever at byrået beskriver sin egen prosess konkret, noe disiplinerte byråer gjør uten å nøle, fordi de beskriver hva de gjorde i morges. Udisiplinerte byråer styrer samtalen tilbake til verktøyene sine. Verktøy er det ene som ikke lenger skiller noen.

Ofte stilte spørsmål

Bør jeg unngå byråer som bruker KI til å skrive kode?

Nei, og du hadde ikke klart det om du prøvde. GitHubs egen telemetri viser at KI står for 46 % av koden skrevet av utviklere som bruker Copilot, og Gartner venter at 60 % av all ny kode er KI-generert innen utgangen av 2026. Det nyttige filteret er ikke om et byrå bruker KI, men om de konkret kan beskrive hvordan resultatet gjennomgås og testes før det går i produksjon.

Er KI-generert kode virkelig mindre sikker?

Ugjennomgått, ja. Veracode testet over 100 modeller på 80 kodeoppgaver og fant en sikkerhetsfeil i 45 % av resultatene; når en oppgave kunne løses sikkert eller usikkert, valgte modellene jevnlig den usikre veien. Med statisk analyse i pipelinen og menneskelig gjennomgang før merge blir de feilene fanget opp. Det er det oppsettet du bør be om.

Hva er det beste enkeltspørsmålet å stille et utviklingsbyrå i 2026?

Be om å få se et prosjekt de har vedlikeholdt i mer enn ett år, og hva som nylig ble endret i det. Porteføljer viser lanseringsdagen. Vedlikeholdskontrakter viser om koden holdt etterpå. Et byrå med kunder som fortsetter å betale for å videreutvikle gamle kodebaser, sitter på bevis en demo ikke kan forfalske.

Hvorfor spriker byråtilbudene så mye for samme omfang?

Fordi KI kollapset kostnaden ved å produsere kode, mens kostnaden ved å gjennomgå, teste og sikre den sto stille. Tilbud i den billige enden kutter som regel den andre kategorien. Byggingen leveres likevel. Regningen for det som ble hoppet over kommer noen måneder senere, og redningsarbeid på KI-bygde apper koster nå fra noen tusen dollar for en revisjon til sekssifrede beløp for en ombygging.