Naar hoofdinhoud
PRODENDAKennisinfrastructuur

Kennisprobleem

RAG haalt op wat er staat, niet wat er klopt

Retrieval-augmented generation lost een zoekprobleem op, geen kennisprobleem. Wie een rag implementatie inzet om onzekerheid over de juiste bron weg te nemen, verwart vindbaarheid met geldigheid.

Techniek
Retrieval-augmented generation
Niveau
CTO / AI-lead

01Kernonderscheid

Retrieval vindt passages, geen waarheid

Een RAG-systeem zoekt de tekstfragmenten die statistisch het beste aansluiten bij een vraag en geeft die mee aan een taalmodel als context. Dat mechanisme is neutraal ten opzichte van juistheid: het fragment dat het beste matcht, is niet per definitie het fragment dat nog geldt.

Als een archief twee versies van dezelfde procedure bevat, kan retrieval beide ophalen, of de verkeerde, afhankelijk van hoe de tekst is geformuleerd en geïndexeerd. Het model krijgt dan tegenstrijdige of verouderde input mee, en presenteert het resultaat met dezelfde vloeiende zekerheid als een correct antwoord.

Dat is geen bug die met een volgende modelversie verdwijnt. Het is een structureel gevolg van hoe retrieval werkt: het optimaliseert op gelijkenis tussen vraag en tekst, niet op status of geldigheid van die tekst.

02Faalmodi

Waar een rag implementatie concreet misgaat

01
Chunking doorbreekt context
Documenten worden in stukken geknipt voor indexering; een voorwaarde of uitzondering die twee alinea's verderop staat, komt niet mee met het opgehaalde fragment.

Verlies van randvoorwaarden

02
Meerdere versies van dezelfde procedure
Oude en nieuwe versie staan naast elkaar in het archief; retrieval kiest op tekstuele gelijkenis, niet op geldigheidsdatum.

Risico op verouderd antwoord

03
Impliciete voorwaarden
Een instructie geldt alleen onder een bepaalde situatie die elders staat beschreven of nergens is vastgelegd; het opgehaalde fragment mist die begrenzing.

Onterechte generalisatie

04
Ontbrekende status
Concepttekst, ingetrokken tekst en vastgestelde tekst zien er voor een retrieval-index identiek uit; er is geen veld dat status meeweegt.
05
Ontbrekend eigenaarschap
Niemand in het systeem is gekoppeld aan een fragment als verantwoordelijke, dus tegenspraak wordt niet gesignaleerd maar stilzwijgend doorgegeven.

03Conflicterende bronnen

Wat er gebeurt bij tegenstrijdige documenten

In vrijwel elke organisatie bestaan documenten die elkaar op onderdelen tegenspreken: een oud kwaliteitshandboek naast een recentere werkinstructie, een projectrapport dat een uitzondering beschrijft die nooit in het handboek is verwerkt. Voor mensen die de context kennen, is dat meestal geen probleem; zij weten welke bron voorrang heeft.

Een retrieval-systeem kent die context niet. Het haalt fragmenten op uit beide bronnen en laat het taalmodel de synthese maken, dat op zijn beurt geen basis heeft om te bepalen welke bron leidend is. Het resultaat is een antwoord dat grammaticaal correct oogt maar inhoudelijk een gok is tussen twee tegenstrijdige bronnen.

Dit probleem wordt groter naarmate het archief ouder en groter is, precies de situatie waarin een rag implementatie het meest wordt ingezet om overzicht te herstellen.

04Praktijkkennis ontbreekt

Wat retrieval per definitie mist

Retrieval werkt alleen op tekst die is vastgelegd. Kennis die uitsluitend mondeling wordt overgedragen, of die alleen zichtbaar is in het handelen van een ervaren medewerker, staat nergens en kan dus ook nergens worden opgehaald. Dat betekent niet dat het systeem daar transparant over is; het geeft simpelweg geen antwoord, of erger, het geeft een antwoord op basis van het dichtstbijzijnde beschikbare fragment, dat de praktijk niet dekt.

Voor vragen waarbij die praktijkkennis relevant is, ontstaat zo een antwoord dat volledig oogt maar een structureel gat verzwijgt. De gebruiker heeft geen manier om dat gat te zien, tenzij het systeem expliciet aangeeft dat een onderwerp buiten de gedekte kennis valt.

05Wat retrieval niet meet

Ontbrekende dimensies in een standaard rag-opzet

Geldigheidsstatus
Of een fragment vastgesteld, ingetrokken of nog concept is.
Eigenaarschap
Wie inhoudelijk verantwoordelijk is voor het fragment en het kan bevestigen of herroepen.
Toepassingsvoorwaarden
Onder welke omstandigheden een instructie wel of juist niet geldt.
Dekkingsgraad
Of het onderwerp van de vraag überhaupt is vastgelegd, of dat het antwoord een gok is op het dichtstbijzijnde fragment.

06Wat wél nodig is

Een laag boven retrieval, niet in plaats van

Retrieval blijft een geschikt mechanisme om tekst terug te vinden; het probleem zit niet in de techniek maar in wat eraan voorafgaat. Voordat fragmenten in een index terechtkomen, moet vaststaan welke bron bij tegenspraak leidend is, welke versie geldig is, en onder welke voorwaarden een instructie van toepassing is.

Dat is een kennisvraagstuk dat losstaat van het model en dat door mensen met inhoudelijk gezag wordt beslist, niet door een algoritme dat optimaliseert op tekstuele gelijkenis. Pas wanneer die laag er is, kan retrieval fragmenten aanleveren waarvan de status en herkomst bekend zijn, in plaats van fragmenten die toevallig het best matchten.

→Zelf beginnen

Start gratis met KOS.

Bouw uw eerste kennisdomein op en doorloop de volledige kenniscyclus.

→Kennislaag

Alle onderwerpen in het kennisoverzicht.

Elk thema staat op zichzelf: het probleem, de sector of het moment waarop kennis wordt vastgesteld.