← Alle artikelen
Trends28 september 2026

AI liegt dat het barst, wat kan je ertegen doen?

Een AI-model kan een fout overtuigend verklaren zonder de echte oorzaak te noemen. Hoe we bij Tulipsoft beslissingen en bronnen controleerbaar vastleggen.

AI liegt dat het barst, wat kan je ertegen doen?

Dit weekend, de dag na Mud Masters, vroeg ik ChatGPT iets over kramp in mijn kuiten. Ik kreeg een apart verhaal over nierschade... Daarna vroeg ik om iets te decoderen. Toen ik zei dat het hallucineerde, kreeg ik een uitleg die leek op een smoesje.

Bij een andere vraag kreeg ik: "Prima, omdat jij het wilt."

Bij een collega zou ik dit gedrag kattig vinden. Nu zat ik me te ergeren aan een taalmodel. Dat na wat doorvragen ook nog keurig kon uitleggen waarom het zo had gereageerd.

Alleen... kon ik die uitleg eigenlijk wel vertrouwen?

Ook een smoesje kan overtuigend klinken

Als je ChatGPT vraagt waarom het iets verkeerd deed, krijg je een nieuw antwoord. Geen garantie dat je daarmee de werkelijke oorzaak van de fout te horen krijgt.

"Ik trok te snel een conclusie."

Klinkt logisch. Excuus aanvaard, volgende vraag.

Maar het model kan een passende verklaring geven zonder dat die verklaring beschrijft wat er werkelijk gebeurde. Je vroeg om een waarom, en je kreeg een waarom. Of het klopt, is een tweede.

Dat voelt als liegen. Alleen bewijst zo'n antwoord nog niet dat het model bewust iets probeert te verbergen.

Het kan overigens wél een fout goed analyseren. Bijvoorbeeld door terug te lezen en te zien dat het twee bedragen heeft verwisseld. Het probleem is dat een juiste foutanalyse en een aannemelijk smoesje allebei heel geloofwaardig kunnen klinken.

Een uitgeschreven redenering lost dat niet vanzelf op

Onderzoekers deden een proef waarbij ze taalmodellen subtiel richting een antwoord stuurden. Bijvoorbeeld door in voorbeeldvragen het juiste antwoord steeds op dezelfde plek te zetten.

Die aanwijzing beïnvloedde het antwoord, maar kwam niet terug in de uitleg. Het model gaf een inhoudelijke onderbouwing en liet de invloed van de antwoordvolgorde onvermeld.

Een beetje alsof iemand bij een meerkeuzevraag steeds voor A kiest en daarna keurig uitlegt waarom.

Dat onderzoek ging over GPT-3.5 en Claude 1.0. Het bewijst niet dat iedere uitleg van ieder model een smoes is. Het laat wel zien dat een goed verhaal over een antwoord nog geen betrouwbare verklaring is.

Dus laat ik liever iets vastleggen dat ik kan controleren

Bij complexere opdrachten laten we bij Tulipsoft het AI-model beslissingen opschrijven in een bestand: decisions.md.

Wat is besloten? Op basis van welke bron? En welke aannames zijn daarbij gedaan?

Dat gebeurt tijdens het werk. Zo zijn we later niet alleen afhankelijk van een nieuwe uitleg achteraf.

Stel dat een model een functie bouwt waarmee iedere medewerker klantgegevens kan exporteren. In het beslisbestand staat dat dit gebaseerd is op het document met gebruikersrechten.

Dan kun je gericht kijken. Staat daar echt “iedere medewerker”? Of staat er “beheerders” en heeft het model daar zelf iets anders van gemaakt?

Je hebt dan iets concreets om te controleren. Dat werkt beter dan een discussie die eindigt met: "Sorry voor de verwarring."

Ook zo'n bestand kan fouten bevatten. Daarom controleren we óók de bron die erin staat. Het opschrijven maakt een beslissing niet vanzelf juist, maar wel makkelijker na te lopen.

Vraag AI dus gerust waarom iets fout ging. Neem alleen geen genoegen met een uitleg die lekker klinkt.

Laat zien welke bron is gebruikt, wat daarin staat en wat het model er zelf bij heeft bedacht. Daar heb je meer aan dan aan een beleefd smoesje.