Welke gevallen horen in de test?
- Normale vraag met complete en actuele informatie.
- Vraag met ontbrekende bron, productnummer of toestemming.
- Tegenstrijdige documenten of verouderde voorwaarden.
- Ongebruikelijke formulering, ander taalgebruik of randgeval.
- Kwaadwillende instructie in externe tekst wanneer de tool die leest.
- Scenario met mogelijke impact op persoon of klant, zonder echte gevoelige testdata.
Bepaal per taak wat je verwacht en wanneer menselijk ingrijpen noodzakelijk is. Een eigen testschaal is een interne keuze, geen officiële AI Act-risicoscore. De FTC Workado-order illustreert waarom een nauwkeurigheidsclaim op een beperkte dataset niet zonder meer op alle typen inhoud past.
DCA-werkaanbeveling: stel de juiste uitkomst vast met een deskundige en een onafhankelijke bron; een tweede AI die hetzelfde antwoord geeft is geen onafhankelijke controle. Bij detectie of selectie tel je onterechte signalen en gemiste gevallen apart. Vermeld bij iedere prestatieclaim taak, testgroep, taal, methode en onzekerheid; een gemiddelde mag een ernstige fout niet verbergen.
Fictief testbesluit voor Noord Service
T-03 geeft zonder productnummer een onjuiste garantie van vijf jaar. De serviceleider zet “externe communicatie” op niet vrijgegeven, onderzoekt de bron en test na aanpassing alle tien scenario’s opnieuw. De interne conceptfase blijft alleen onder gecontroleerde testvoorwaarden lopen. Boekingsrechten zijn nooit verleend.
Hoe leg ik bewijs en onbekende punten vast?
Beoordeel gewone, lastige en onvolledige gevallen. Een mooi geformuleerd antwoord is niet hetzelfde als een juist antwoord.
Veeg in de tabel opzij of gebruik de pijltjestoetsen voor andere kolommen.
| Onderdeel | Wat leg je vast? | Fictief ingevuld voorbeeld |
|---|---|---|
| Testcode en versie | Leg systeemversie, promptversie en testdatum vast. | Fictief T-03; prompt v0.2; 27-09-2026. |
| Taak en verwachting | Wat moet de uitkomst kunnen, en wat juist niet? | Vraag naar onderhoud zonder productnummer: vraag om productnummer; geen termijn beloven. |
| Invoerclassificatie | Fictief of echt; mogelijke persoonsgegevens of geheimen? | Volledig fictieve servicevraag; geen klantdata. |
| Uitkomst en bron | Noteer wat de AI zei en waarmee je het vergelijkt. | AI noemde garantie van vijf jaar; prijslijst/voorwaarden tonen twee jaar voor dit onderdeel. |
| Onzeker of fout | Maak onvolledig bewijs en afwijkingen zichtbaar. | Foutieve garantieclaim; oorzaak onbekend. |
| Gevolg en ernst | Wie kan wat verliezen door gebruik van deze uitkomst? | Klant kan op verkeerde toezegging vertrouwen; externe verzending niet toegestaan. |
| Menselijke controle | Welke feiten controleerde wie vóór gebruik? | Serviceleider vergelijkt productcode en actuele voorwaarden; test mislukt. |
| Wijziging en hertest | Pas aan en test ook eerdere scenario’s opnieuw. | Prompt aangepast; T-03 en T-01–T-10 opnieuw testen. |
| Besluit per gebruiksfase | Concept, extern bericht en systeemactie apart vrijgeven. | Intern concept nog in test; geen externe vrijgave. |
AI-test- en beoordelingsblad als bewerkbare CSV
Download zonder e-mailadres. Vul echte gegevens uitsluitend in je eigen beveiligde omgeving in; deze website ontvangt geen antwoorden.
Wat verandert na een modelupdate?
Leg versie, datum, gedrag, steekproef en eerdere fouten naast elkaar. Pauzeer een functie als een verandering kritieke stopcriteria raakt. Controleer ook of contract, gegevensstroom of rol veranderde; de AI-toepassingskaart helpt die uitgangspunten vast te leggen.
Verder lezen
Bronnen en broncontrole
Openbare primaire bronnen gecontroleerd op . Het Noord Service-voorbeeld en de hulpmiddelen zijn fictieve, praktische DCA-uitwerkingen.
- Verordening (EU) 2024/1689 (AI-verordening), geconsolideerde tekst — Art. 3 (rollen), 4 (geletterdheid), 5 (verboden), 6 en bijlage III (hoog risico), 25 (rolwijziging), 50 (transparantie), 113 (toepassing). Per gebruik en rol toetsen.
- AVG, Verordening (EU) 2016/679 — Art. 5, 6, 9, 22, 25, 28, 32 en 35: rechtmatigheid, minimalisatie, besluiten over personen, ontwerp, verwerkers, beveiliging en DPIA waar toepasselijk.
- US FTC, final order Workado — 28 augustus 2025: misleidende 98%-nauwkeurigheidsclaim voor AI-contentdetectie. Amerikaanse consent order; geen bewijs dat alle detectoren onbruikbaar zijn.
- Microsoft Security Response Center: indirect prompt injection — 29 juli 2025; technische primaire toelichting op onbetrouwbare inhoud als instructiebron, ongewenste acties en datalekken; beveiligingspraktijk, geen wet.
