Blog
Wie controleert de AI-bouwer? Onafhankelijke QA bij AI-software
· 4 min leestijd
Je leverancier laat een nieuwe applicatie zien. Ze is in een week gebouwd, het ziet er netjes uit en de bouwer zegt: "Getest, alles werkt." Twee weken na livegang blijkt dat een factuurbedrag rond middernacht op de verkeerde dag valt en dat een collega meer kan zien dan de bedoeling was.
Dat is niet per se slordigheid. Het is wat er gebeurt als dezelfde partij bouwt en beoordeelt. Bij software die met AI is gemaakt speelt dat extra sterk, omdat de bouwer razendsnel werkt en zijn eigen werk met evenveel overtuiging goedkeurt.
De bouwer die zichzelf nakijkt
Een AI-tool die code schrijft, is ook heel goed in het opschrijven van een geruststellende conclusie. "De tests slagen" en "de functie werkt" komen makkelijk uit zo'n tool, ook als er niets echt is uitgeprobeerd. Wij hebben dat in eigen bouwwerk vaak genoeg gezien. Onze vuistregel: vraag nooit om een bevestiging, vraag om een gemeten uitkomst. Niet "werkt het?", maar "laat zien wat je op dit scherm ziet als je als planner inlogt".
Dat er meer aan de hand is dan een gevoel, blijkt uit onderzoek. Veracode laat AI-modellen codeertaken uitvoeren en kijkt of het resultaat veilig is. In hun 2026 GenAI Code Security Report staat dat het gemiddelde slagingspercentage voor beveiliging over de modellen 56% is, nauwelijks veranderd ten opzichte van 55% in het eerste rapport. Ook staat er dat ongeveer 44% van de codeertaken in de tests een riskante kwetsbaarheid opleverde. De modellen worden dus wel beter in code die draait, maar niet vanzelf beter in code die veilig is.
Ook het onderzoek van DORA naar AI in softwareteams wijst die kant op. Zij noemen dat 30% van de ontwikkelaars weinig tot geen vertrouwen heeft in door AI gegenereerde code. Diezelfde pagina stelt dat een hogere AI-inzet samengaat met meer doorvoer én meer instabiliteit in de softwarelevering. Sneller bouwen betekent dus niet automatisch minder fouten. De tijd die je bij het schrijven wint, kan bij het controleren weer verdwijnen. Als niemand controleert, verdwijnt hij bij de eerste storing.
Wat onafhankelijk hier betekent
Onafhankelijke QA is geen zwaar woord voor een grote organisatie. Het is één simpele eis: degene die controleert heeft geen belang bij het antwoord "het is goed" en heeft het werk niet zelf gemaakt. Dat kan een collega zijn die de bouw niet heeft gedaan. Het kan een tweede AI-model zijn dat met een ander opdrachtkader kritisch meeleest. Het kan de opdrachtgever zelf zijn, mits die een concrete kijklijst heeft. Onze les uit eigen praktijk: laat iemand anders het resultaat afkeuren voordat het "af" heet. Een tweede blik vangt wat de bouwer zelf niet meer ziet.
Automatische controles horen daar zeker bij, maar vervangen het niet. OutSystems heeft bijvoorbeeld een AI Mentor System dat volgens de productpagina automatisch elke twaalf uur uitgebreide codereviews uitvoert op onderhoudbaarheid, beveiliging en prestaties. Dat is nuttig: het helpt om ongebruikte code en andere problematische patronen te vinden. Maar zo'n review kijkt naar de kwaliteit van de bouw. Of jouw factuurregel klopt, of jouw planner de juiste dingen ziet en of jouw klant een correct certificaat krijgt, is een andere vraag. Daarvoor heb je iemand nodig die het proces kent en het langs de bedrijfsregels legt.
Waar het in de praktijk misgaat
Uit onze bouwpraktijk komen steeds dezelfde soorten fouten terug. Het zijn geen spectaculaire fouten, maar precies het soort dat een bouwer die zijn eigen werk nakijkt overslaat:
- Tijdzones. "Vandaag" wordt in sommige systemen in een andere tijdzone berekend dan in Nederland. Rond middernacht zit je dan een dag ernaast.
- Volgorde. Een lijst die goedkoopste eerst moet tonen, klopt in de mockup en niet in de app, omdat de sortering nergens in de data is vastgelegd.
- Rollen. Een scherm zonder duidelijke rol wordt een vergeten los eindje. Rechten achteraf inregelen is precies het soort werk dat sneuvelt.
- Misklikken. Een verwijderknop zonder bevestigingsstap werkt tot iemand hem tijdens een demo indrukt.
- Veroudering. Demo-data die aan "vandaag" hangt, is een week later leeg, juist in een klantgesprek.
- Opgestapelde waarschuwingen. Bouw- en validatiewaarschuwingen die oplopen maken een nieuwe, echte fout onzichtbaar.
Een testrapport met "alle tests groen" vertelt je over geen van deze dingen iets. Groene tests bewijzen dat de functie doet wat de test vraagt, niet dat de mens die ermee werkt krijgt wat hij nodig heeft. Daarom testen wij het pad dat een mens aflegt: inloggen met een echte rol, de taak uitvoeren, kijken wat er op het scherm staat.
Bij een platform als dat voor MEA Beveiliging, waar volgens onze pagina met projecten dealers hun eigen installaties beheren, SEPA-flows automatisch verlopen en certificaten direct worden gegenereerd, is een fout in de logica geen kosmetisch probleem. Hoe meer een applicatie zelfstandig doet, hoe meer een onafhankelijke controle loont. Dat geldt voor apps met AI-hulp gebouwd én voor apps waar AI-agents in meedraaien.
Wat betekent dit voor jouw bedrijf?
Je hoeft geen testafdeling op te richten. Je moet wel afspreken wie het werk afkeurt voordat het live gaat.
- Scheid bouwen en beoordelen. Vraag je leverancier wie de oplevering controleert als de bouwer dat niet is. Als het antwoord "de bouwer zelf" is, vraag dan om een tweede paar ogen, van een collega, een ander model of jezelf.
- Schrijf de kijklijst vooraf. Doel in één zin, wat nooit met productie gedeeld wordt, en of er met synthetische of echte data wordt getest. Zet er de rollen bij die moeten kunnen inloggen en wat ieder wel en niet mag zien. Dat voorkomt achteraf discussie.
- Vraag om gemeten uitkomsten. Accepteer geen "het werkt" maar een verslag: wat is er gedaan, met welke rol, wat was het resultaat. Een schermafbeelding of een concrete voorbeeldrun is beter dan een bevestiging.
- Test het echte pad, ook rond middernacht. Loop het proces door zoals je medewerker het doet, inclusief de randgevallen: datumgrenzen, een medewerker zonder rechten, een misklik.
Wil je weten hoe wij dit aanpakken, of wil je een oplevering door een onafhankelijke blik laten nalopen? Kijk ook naar onze post over eerst een mockup laten beoordelen en wat je aan het stuur houdt bij bouwen met AI-hulp in OutSystems. Of neem contact met ons op voor een vrijblijvend gesprek.