Juristen-editie
Een rechtbank trekt voor het eerst een grens rond het begrip 'AI-systeem', een nieuwe benchmark laat zien dat het beste model 15 procent haalt op Nederlands juridisch werk, en wederpartijen klagen sneller met hulp van AI.
Rechtbank trekt een grens: het zoekprogramma van de IND is geen AI-systeem
De rechtbank Noord-Holland legt uit waarom CaseMatcher geen AI is. Daarmee geeft ze een eerste toetssteen voor het begrip 'AI-systeem'.
Vier Turkse asielzoekers stelden dat de IND een geavanceerd AI-systeem had gebruikt bij hun aanvraag, zonder dat te melden in het besluit. Het ging om CaseMatcher, een intern IND-programma. Volgens hen had dat programma een bepalende invloed op de afwijzing. De rechtbank Noord-Holland is het daar niet mee eens. CaseMatcher is volgens de rechtbank een eenvoudige 'rule-based' zoektool: hij zoekt eerdere zaken op zoekterm en rangschikt ze op datum of relevantie. Het programma kan niet zelf redeneren, niet modelleren en niet zelfstandig handelen. Daarom hoefde de IND het gebruik ervan niet te vermelden. De uitspraak staat bekend als ECLI:NL:RBDHA:2026:25209. Het verschil waar de rechtbank op let, is dat tussen een vaste regel en een geleerd patroon. Een rule-based tool doet precies wat een programmeur heeft opgeschreven: zoek op deze term, sorteer op deze datum. De uitkomst is herleidbaar en herhaalbaar. Een AI-systeem in de zin van de AI-verordening leidt zelf iets af uit voorbeelden en kan uitkomsten genereren die niemand vooraf heeft ingetikt. De rechtbank kijkt dus niet naar de naam van het product, maar naar wat het feitelijk kan: redeneren, modelleren, zelfstandig acties uitvoeren. Kan het dat niet, dan valt het buiten het begrip en gelden de meld- en transparantieplichten niet. Wees hier voorzichtig mee. Dit is één uitspraak van één rechtbank in asielzaken, geen hogere rechtspraak. En de redenering snijdt twee kanten op. Het argument "het is maar een zoektool" werkt alleen zolang de werking dat ook echt draagt. Zodra een leverancier er een taalmodel in verwerkt dat samenvat of rangschikt op geleerde patronen, verschuift de kwalificatie mee, ook als de naam gelijk blijft. Voor de praktijk betekent dat: leg vast wat een systeem nu doet, en beoordeel dat opnieuw bij elke update. Een kwalificatie uit 2026 is geen vrijbrief voor de versie van 2027.
Achtergrond voor abonneesDeze editie geeft je houvast op vier fronten. De uitspraak over CaseMatcher levert een concrete redenering om te bepalen of een tool wel of niet als AI-systeem geldt: kijk naar wat het ding feitelijk doet, niet naar de naam. De DELTA-benchmark laat zien dat algemene taalmodellen nog ver achterblijven op echte juridische toepassing, dus vraag leveranciers om harde cijfers in plaats van een demo. Het verhaal over AI-opgestelde klachtbrieven laat zien dat je dossiervorming rond sommaties en termijnen belangrijker wordt, omdat de drempel om te klagen lager ligt. En het notariskantoor dat met AI een groot deel van de verklaringen van erfrecht verwerkt, laat zien dat standaardwerk onder prijsdruk komt te staan, ook buiten het notariaat.
Nieuwe Nederlandse benchmark: beste model haalt 15 procent op juridisch werk
Legal Benchmarks publiceerde deze week DELTA, een openbare benchmark voor Nederlands juridisch onderzoek. Hij bevat 15 praktijkopdrachten en 273 criteria die door juristen zijn gevalideerd. Het best scorende model, Fable 5.1, haalt een task pass rate van slechts 15 procent. Van de 23 geteste AI-systemen passen er maar twee de juiste juridische maatstaf echt toe op een concrete casus over een wettelijk vertegenwoordiger met tegenstrijdige belangen. Mark Zijlstra (ICTRecht) zegt dat dit laat zien hoe hoog de lat ligt zodra je niet alleen naar bronvermelding kijkt, maar ook naar correcte toepassing van het recht op de feiten. Het verschil zit in wat je meet. De meeste demo's laten zien dat een model een bron noemt en een vlot antwoord geeft. DELTA toetst de stap daarna: kiest het model de juiste maatstaf, en past het die toe op déze feiten? Dat is de stap waar een jurist zijn geld mee verdient, en juist daar zakken de modellen door. Een 'task pass rate' betekent dat de hele opdracht goed moet zijn, niet een deel ervan. Eén verkeerde maatstaf en de taak telt als mislukt, hoe net de tekst er ook uitziet. Lees de 15 procent niet als een oordeel over juridische AI-producten in het algemeen. Het onderzoek gebruikte alleen algemene foundation models, geen tools die speciaal voor de juridische markt zijn gebouwd met eigen bronnen en controles. Wat het wél zegt: het onderliggende model lost je vakinhoudelijke probleem niet vanzelf op. Een tool is dus zo goed als de bronnen en controles die de leverancier eromheen bouwt. De testset staat volledig open, dus je kunt hem zelf narekenen met je eigen casussen.
Achtergrond voor abonneesDit is een voorproefje.
Abonnees lezen de hele Juristen-editie: alle verhalen, en bij elk de achtergrond in klare taal.
Schrijf je in →Nog niet zover? Lees eerst de gratis brief →
AI en techniek, in klare taal.
Dit is de Juristen-editie. Abonnees lezen bij elk bericht de achtergrond, in klare taal.
Inschrijven
inklaretaal · Amsterdam · © 2026