Een interne kennisassistent bouwen: van idee tot werkend prototype
Wat is er technisch en organisatorisch nodig om een RAG-gebaseerde kennisassistent op te zetten voor technische documentatie? Een stapsgewijze doorloop van documentinventarisatie tot gebruikerstesten.
Wat is een kennisassistent (en wat niet)?
Een kennisassistent — vaak aangeduid als RAG-systeem (Retrieval-Augmented Generation) — is een AI-toepassing die vragen beantwoordt op basis van uw eigen documenten. Anders dan een algemeen taalmodel zoals ChatGPT haalt het systeem eerst relevante passages op uit uw documentatie en genereert vervolgens een antwoord dat op die specifieke bronnen is gebaseerd.
Het is geen magische zoekmachine. De kwaliteit van de antwoorden hangt direct af van de kwaliteit, volledigheid en actualiteit van de bronnen. Documenten die vaag, verouderd of tegenstrijdig zijn, leiden tot vage, verouderde of tegenstrijdige antwoorden.
Stap 1: Documentinventarisatie en bronbeoordeling
Voordat u iets bouwt, begint u met een overzicht van de documentatie die het systeem moet kunnen doorzoeken:
Waar staat de informatie? SharePoint, netwerkschijven, ERP-systeem, e-mailbijlagen, papieren archieven?
In welk formaat? PDF, Word, Excel, afbeeldingen van technische tekeningen, e-mail?
Hoe actueel? Worden documenten regelmatig bijgewerkt of zijn er versies van jaren oud?
Hoe gevoelig? Bevatten ze klantgegevens, prijsinformatie, intellectueel eigendom?
De inventarisatie levert twee dingen op: een prioriteitenlijst (welke documenten het meeste opleveren) en een technische haalbaarheid (welke documenten eenvoudig te verwerken zijn).
Stap 2: Documentverwerking en indexering
Documenten moeten worden omgezet naar doorzoekbare tekst en opgedeeld in logische blokken (chunks). De kwaliteit van deze stap bepaalt grotendeels de kwaliteit van het hele systeem.
Chunking: niet te klein, niet te groot
Als de blokken te klein zijn, mist het systeem context. Te groot, en het antwoord wordt onnauwkeurig. Een gangbare aanpak is blokken van 500 tot 1.500 tokens met overlap, maar dit verschilt per documenttype. Technische handleidingen met genummerde paragrafen lenen zich voor andere strategieën dan vrije tekst.
Metadata meegeven
Verrijk elk blok met metadata: documenttitel, versiedatum, productserie, taal. Dit maakt het mogelijk om zoekresultaten te filteren en bronverwijzingen te tonen — cruciaal voor het vertrouwen van gebruikers.
Stap 3: Antwoordgeneratie en bronverwijzing
Wanneer een gebruiker een vraag stelt, doorloopt het systeem drie stappen:
Retrieval: de meest relevante documentblokken worden opgehaald op basis van semantische gelijkenis met de vraag
Augmentation: deze blokken worden als context aan het taalmodel meegegeven
Generation: het taalmodel formuleert een antwoord op basis van de context en de vraag
De bronverwijzing is essentieel. Gebruikers moeten kunnen controleren waar het antwoord vandaan komt. Zonder bronverwijzing vertrouwen technische medewerkers het systeem niet — terecht.
Stap 4: Toegangsrechten en beveiliging
Niet iedereen mag alles zien. Een kennisassistent moet de bestaande toegangsrechten respecteren. Als een document alleen toegankelijk is voor de engineeringafdeling, mag het antwoord dat op dat document is gebaseerd niet zichtbaar zijn voor iedereen.
Dit is technisch complexer dan het lijkt. Oplossingen variëren van het filteren van resultaten op gebruikersrol tot het opzetten van gescheiden indexen per afdeling. De keuze hangt af van de gevoeligheid van de informatie en de complexiteit van uw rechtenstructuur.
Stap 5: Testen met echte gebruikers
Een kennisassistent die technisch werkt, is nog niet bruikbaar. Test met een kleine groep eindgebruikers — bij voorkeur medewerkers die dagelijks met de betreffende documentatie werken:
Stel vragen die zij normaal aan collega's zouden stellen
Beoordeel of de antwoorden correct, volledig en begrijpelijk zijn
Controleer of de bronverwijzingen kloppen
Noteer vragen waar het systeem faalt of hallucineert
Meet de tijd ten opzichte van de huidige werkwijze
De feedback uit deze testfase leidt tot aanpassingen in chunking, promptinstructies, documentkeuze en interface. Plan hiervoor minimaal twee iteratieronden in.
Veelvoorkomende valkuilen
Op basis van praktijkervaring zijn dit de meest voorkomende struikelblokken:
Te breed beginnen: start met één documentcollectie, niet met alles tegelijk