Naar hoofdinhoud
Documenten verwerken met AI

Documenten automatisch verwerken met AI: van pdf en scan naar gecontroleerde data

Facturen, bonnen, contracten, formulieren en pakbonnen: ze komen binnen als pdf, scan of foto en moeten met de hand worden overgetikt. AI leest die documenten uit, controleert de gegevens en zet ze klaar in je systemen, zodat het overtypen stopt.

Kort antwoord

Documenten automatisch verwerken met AI betekent dat inkomende documenten zoals facturen, bonnen, contracten en formulieren automatisch worden uitgelezen, dat de juiste gegevens eruit worden gehaald, gecontroleerd en in je systemen worden gezet. ThrAive bouwt dit op maat rond je bestaande software, getraind op jouw eigen documenttypes en je manier van werken. We beginnen bij het proces: welke documenten komen binnen, welke gegevens heb je nodig en waar moeten ze terechtkomen. Daarna kiezen we de extractietechniek die daarbij past; je weet vooraf wat het kost en binnen een maand verwerkt de oplossing je eerste documenten.

Wat is documenten automatisch verwerken met AI?

Documenten automatisch verwerken met AI is het omzetten van ongestructureerde documenten, zoals pdf's, scans, foto's en formulieren, naar gestructureerde data die rechtstreeks in je bedrijfssoftware bruikbaar is. De AI leest het document, bepaalt welk type het is, haalt de relevante gegevens eruit, controleert die tegen je eigen regels en levert het resultaat af waar het hoort. Alleen twijfelgevallen komen nog bij een mens terecht.

Zie het als een vertaalslag. Een contract, pakbon of ingevuld formulier is geschreven voor menselijke ogen; je software heeft velden, tabellen en records nodig. Tot nu toe waren medewerkers die vertalers: lezen, interpreteren, overtikken. AI-extractie neemt die vertaling over en doet dat in seconden per stuk, met een zekerheidsscore per gegeven zodat je precies weet waar je op kunt bouwen.

Welke documenten zich hiervoor lenen

Vrijwel elk documenttype waar je nu gegevens uit overtikt, komt in aanmerking. Een greep uit wat we in de praktijk verwerken:

  • Contracten en overeenkomsten: partijen, looptijden, opzegtermijnen, bedragen en bijzondere clausules.
  • Pakbonnen en vrachtbrieven: geleverde aantallen, artikelnummers, batchnummers en afwijkingen ten opzichte van de order.
  • Ingevulde formulieren: aanvraagformulieren, intakes, keuringsrapporten en checklists, ook met aankruisvakjes.
  • Orderbevestigingen van leveranciers: prijzen, levertijden en condities die je wilt vergelijken met wat is afgesproken.
  • Certificaten en verklaringen: geldigheidsdata en kenmerken die je per relatie of project moet bijhouden.
  • Rapporten en brieven waaruit je vaste gegevens nodig hebt, zoals dossiernummers, data en beslissingen.

Ook inkoopfacturen kunnen uiteraard mee in zo'n stroom, maar dat vak heeft zijn eigen spelregels en een eigen pagina; verderop verwijzen we je daarnaartoe.

Gegevens uit documenten halen: OCR of AI-extractie?

Klassieke OCR, optische tekenherkenning, zet pixels om in letters. Dat is stap een, en meer niet. Je krijgt een lap tekst terug zonder betekenis: OCR weet niet welk getal de datum is en welk getal het gewicht, en al helemaal niet dat de opzegtermijn in artikel 9.2 staat. Daarom moesten er vroeger sjablonen omheen worden gebouwd, per lay-out een, met coordinaten die aangeven waar elk veld zit.

AI-extractie werkt fundamenteel anders. Het model leest het hele document met tekstbegrip en beantwoordt in feite vragen: wie zijn de partijen, wat is geleverd, welke datum geldt. Daardoor maakt de lay-out niet meer uit. Een nieuwe leverancier met een compleet ander sjabloon wordt net zo goed gelezen als de vaste relatie waar je al jaren documenten van krijgt. Dat is de doorbraak die verwerking op MKB-schaal haalbaar maakt.

Waarom sjablonen en vaste formats altijd stuklopen

Wie eerder met sjabloongebaseerde herkenning heeft gewerkt, kent het patroon: het werkt prima voor de vijf grootste relaties, en dan verandert er iemand zijn briefpapier. Elk nieuw format betekent opnieuw inregelen, en de lange staart van incidentele afzenders wordt nooit rendabel om in te richten. Het gevolg is een halfslachtige automatisering waar het handwerk gewoon naast blijft bestaan.

Bij taalgedreven extractie bestaat dat onderhoud niet. Er is geen sjabloonbibliotheek die bijgehouden moet worden; de definitie van wat je zoekt staat los van hoe het document eruitziet. Verandert een relatie zijn opmaak, dan merkt niemand daar iets van. Juist die lange staart van eenmalige en onregelmatige documenten, vaak 30 tot 40 procent van het totaal, gaat nu wel automatisch mee.

Het uitlezen van een document is zo gebeurd. De echte winst zit in alles wat daarna niet meer met de hand hoeft.

Van pdf naar data: de vijf stations

Elke documentstroom die we bouwen, volgt dezelfde route. Per station gebeurt er iets anders met het stuk:

  1. Aanleveren

    Documenten komen binnen via een mailadres, een uploadmap, een scan vanaf de multifunctional of een koppeling met een portaal. De bron maakt voor de verwerking niet uit.

  2. Herkennen en sorteren

    Het systeem bepaalt welk documenttype het is: contract, pakbon, formulier of iets anders. Meerdere documenten in een pdf worden gesplitst, dubbele exemplaren gesignaleerd.

  3. Extraheren

    Per type worden de afgesproken gegevens uitgelezen: losse velden, maar ook complete tabellen met regels en aantallen. Elk gegeven krijgt een zekerheidsscore mee.

  4. Valideren

    De uitgelezen data gaat langs jouw controleregels: kloppen totalen, bestaat het referentienummer in je systeem, valt de datum binnen de verwachte periode. Wat slaagt, gaat door; wat twijfelachtig is, wordt apart gezet.

  5. Afleveren of voorleggen

    Gevalideerde data landt automatisch in je software. Uitzonderingen verschijnen in een overzicht waar een medewerker ze met twee klikken beoordeelt, corrigeert of afkeurt.

Welke gegevens eruit komen: velden, tabellen en clausules

Extractie gaat verder dan een paar losse velden. Afhankelijk van het documenttype halen we eruit:

  • Kopgegevens: afzender, datum, kenmerk, referenties en contactgegevens.
  • Tabellen met regels: artikelen, aantallen, eenheden en specificaties, ook als de tabel over meerdere pagina's doorloopt.
  • Tekstuele afspraken: looptijden, termijnen, voorwaarden en verplichtingen die ergens in de lopende tekst staan.
  • Aangekruiste opties en ingevulde antwoorden op formulieren, inclusief de vraag waar ze bij horen.
  • Afwijkingen: wat op het document staat maar niet overeenkomt met de order of afspraak in je systeem.

Welke gegevens we per type uitlezen, bepaal jij. De lijst met velden is onderdeel van de afspraken die we vooraf vastleggen, zodat er geen discussie ontstaat over wat de verwerking moet kunnen.

Validatie: de poortwachter tussen extractie en administratie

Uitlezen is pas de helft van het werk; het gevaar zit in verkeerd uitgelezen data die ongemerkt je systemen in stroomt. Daarom staat er tussen extractie en administratie altijd een validatielaag met drie soorten controles. Rekenkundige controles: tellen regels op tot het totaal. Referentiecontroles: bestaat de relatie, de order of het project waar het document naar verwijst. En bandbreedtecontroles: wijkt een waarde verdacht af van wat gebruikelijk is.

Die regels stellen we samen met jou op, want jij kent de valkuilen van je eigen administratie. Een verwerking die alles klakkeloos doorlaat, is gevaarlijker dan handwerk; een verwerking die alles tegenhoudt, lost niets op. De kunst zit in het afstellen: streng waar fouten pijn doen, soepel waar de kans op schade klein is.

Uitzonderingen: het eerlijke verhaal over de laatste procenten

Geen enkele documentverwerking haalt honderd procent zonder menselijke blik, en wie dat belooft, verkoopt je een probleem. Er zijn altijd documenten die onscherp zijn gefotografeerd, informatie missen of iets bevatten wat buiten elke regel valt. Het verschil tussen een goede en een slechte oplossing is niet of uitzonderingen bestaan, maar hoe ze worden behandeld.

In onze inrichting is de uitzonderingenlijst een volwaardig werkscherm. De medewerker ziet het document en de uitgelezen gegevens naast elkaar, met het twijfelpunt gemarkeerd. Beoordelen kost seconden in plaats van minuten, en elke correctie wordt vastgelegd zodat het systeem hetzelfde geval de volgende keer beter aankan. Zo daalt het uitzonderingspercentage vanzelf naarmate de stroom langer draait.

Contracten: gegevens die nu in de kast verstoppen

Contracten zijn een onderschatte goudmijn voor extractie, omdat de belangrijkste afspraken vaak alleen op papier bestaan. Wat we uit overeenkomsten halen:

  • Einddatums en verlengingsmomenten, zodat een contract nooit meer stilzwijgend verlengt zonder dat iemand het wist.
  • Opzegtermijnen en de uiterste datum waarop je moet handelen.
  • Indexeringsclausules en prijsafspraken die je wilt naleggen naast wat er werkelijk wordt gefactureerd.
  • Verplichtingen en leverafspraken per partij, bruikbaar als checklist bij evaluaties.
  • Afwijkende bepalingen ten opzichte van je standaardvoorwaarden.

Wil je die gegevens ook doorlopend bewaken in plaats van eenmalig uitlezen, kijk dan bij AI voor contractbeheer.

Pakbonnen en formulieren: kleine stukken, groot volume

Pakbonnen lijken onbelangrijk tot je ze optelt. Elke levering een bon, elke bon een controle: klopt het geleverde met het bestelde, zijn er manco's, welke batch is het. Bedrijven die tientallen leveringen per week ontvangen, zijn daar zomaar een dagdeel per week aan kwijt. Geautomatiseerd vergelijkt het systeem bon en order regel voor regel en meldt alleen de verschillen, zodat controle alleen nog gaat over wat afwijkt.

Voor formulieren geldt hetzelfde patroon. Intakes, aanvraagformulieren, inspectielijsten: gestructureerd bedoeld, maar in de praktijk ingevuld in alle soorten handschrift en volledigheid. Extractie zet elk formulier om naar een record in je systeem en signaleert ontbrekende verplichte velden meteen bij binnenkomst, niet pas weken later als iemand het dossier nodig heeft.

Hoe goed wordt het? Nauwkeurigheid in de praktijk

De vraag die iedereen stelt: hoeveel procent gaat er goed? In onze trajecten ligt de veldnauwkeurigheid na de inregelperiode boven de 95 procent en verwerkt 70 tot 85 procent van de documenten zich volledig zonder menselijke tussenkomst. De rest is geen mislukking maar bewuste voorzichtigheid: documenten waar het systeem twijfelt en die het daarom voorlegt in plaats van gokt.

Belangrijker dan het startpercentage is de richting. Doordat correcties worden teruggevoerd, leert de verwerking van elke beoordeling die je team doet. Stromen die een half jaar draaien, laten steevast een dalend uitzonderingspercentage zien. Handmatige invoer beweegt precies de andere kant op: die wordt niet beter, hooguit langzamer naarmate het volume groeit.

De opbrengst, uitgedrukt in tijd en fouten

Wat levert het onder de streep op? De effecten die onze klanten het eerst noemen:

  • Verwerkingstijd per document van minuten naar seconden: een stapel die vroeger een middag kostte, is verwerkt voordat de koffie koud is.
  • 80 tot 90 procent minder handmatige invoer op de documentstromen die zijn aangesloten.
  • Invoerfouten praktisch verdwenen op gevalideerde velden, waar handwerk 1 tot 4 procent fouten kent.
  • Documenten direct vindbaar en gekoppeld aan de juiste relatie, order of dossier in plaats van los in een map.
  • Achterstanden verdwijnen: verwerking gebeurt bij binnenkomst, niet wanneer er toevallig tijd is.

Waar de data landt: je eigen systemen

Geextraheerde data heeft pas waarde op de plek waar je ermee werkt. We leveren daarom rechtstreeks af in je bestaande software: boekhouding, ERP, CRM of projectadministratie, via koppelingen met onder meer Exact Online, AFAS, Simplicate, Teamleader en Microsoft 365. Geen tussenbestanden die iemand nog moet importeren, geen apart pakket dat naast je huidige software komt te hangen.

Voor elke stroom spreken we af wat het eindpunt is: een record, een boeking, een taak of een aanvulling op een bestaand dossier. Het brondocument reist mee als bijlage, zodat je vanuit je systeem altijd het origineel kunt openen.

Draait jouw stapel vooral om inkoopfacturen? Daarvoor hebben we een aparte aanpak, beschreven op factuurverwerking automatiseren.

Onze werkwijze: klein beginnen, snel bewijzen

We geloven niet in maandenlange projecten voordat er iets draait. De route die we volgen:

  1. Stromen kiezen

    We inventariseren je documentstromen en kiezen samen de stroom waar volume en pijn het grootst zijn. Daar beginnen we, de rest volgt later.

  2. Velden en regels afspreken

    Per documenttype leggen we vast welke gegevens eruit moeten, welke validaties gelden en wanneer iets een uitzondering is. Die afspraken bepalen ook het vaste bedrag dat je vooraf van ons krijgt.

  3. Inrichten en proefdraaien

    We richten de extractie in met jouw eigen documenten, inclusief de lelijke exemplaren, en draaien proef naast je huidige werkwijze zodat je de resultaten kunt vergelijken.

  4. Live en uitbreiden

    De eerste stroom staat binnen twee weken in productie. Bevalt het, dan sluiten we telkens een volgend documenttype aan op hetzelfde fundament.

Voor wie dit loont en voor wie niet

De vuistregel is simpel: verwerkt je organisatie wekelijks tientallen documenten of meer waaruit telkens vergelijkbare gegevens nodig zijn, dan verdient extractie zich snel terug. Administratiekantoren, technische bedrijven met keurings- en werkdocumenten, organisaties met veel contracten of aanvraagformulieren: daar zit het volume dat het verschil maakt. Twijfel je over je aantallen, dan rekenen we het gewoon met je door.

Bij een handvol documenten per maand, of bij stukken die stuk voor stuk juridische interpretatie vergen, is automatiseren het gereedschap niet waard. Dat zeggen we je dan recht toe. En bouwen we wel, dan is de afspraak helder: het bedrag staat vast voordat we beginnen, de opgeleverde software met alle herkennings- en validatielogica komt op jouw naam te staan, en binnen een maand draait het geheel in productie. Lukt dat niet volgens afspraak, dan betalen we je terug.

Meer weten over wat we naast documentverwerking bouwen? Bekijk alle AI-oplossingen voor het MKB.

Begin bij je zwaarste stapel

De beste eerste stap is niet een groot plan maar een kleine proef op je zwaarste stapel. Pak de documentstroom die je team het meeste tijd kost, laat ons er een week proef mee draaien en beoordeel de resultaten met je eigen ogen. Zo weet je op basis van je eigen documenten wat de verwerking waard is, voordat je ergens aan vastzit.

Via de gratis AI-scan op thraive.nl/ai-scan brengen we samen in kaart welke stromen er zijn, waar het volume zit en wat automatisering daar realistisch oplevert. Je krijgt een concreet voorstel met een richtprijs, en op elke vraag daarover antwoorden we binnen 1 uur op werkdagen. Overtypen is geen vak; laten we het dus ook niet langer als werk behandelen.

Benieuwd welke documentstroom in jouw bedrijf het meeste overtypwerk kost?

Vraag je prijsindicatie aan en krijg een vaste prijs vooraf.

Veelgestelde vragen

Minder dan je denkt. Moderne AI-extractie heeft geen duizenden getrainde voorbeelden per lay-out nodig; een paar tientallen representatieve documenten per type volstaan om de herkenning in te richten en de validatieregels te testen. Belangrijker dan het aantal is de spreiding: we willen juist de lastige en afwijkende exemplaren zien, want daar bewijst de verwerking zich.

Grotendeels wel. Aangekruiste vakjes, ingevulde velden en korte handgeschreven notities zijn goed leesbaar voor de huidige generatie modellen. Volledig handgeschreven brieven of onleesbare krabbels zijn een ander verhaal: die krijgen een lage zekerheidsscore en gaan automatisch naar de uitzonderingenlijst, zodat een medewerker ze beoordeelt in plaats van dat er stilletjes iets verkeerds wordt overgenomen.

In goed ingerichte trajecten ligt de veldnauwkeurigheid boven de 95 procent, en dat is inclusief documenten van slechte kwaliteit. Ter vergelijking: bij handmatige invoer is een foutpercentage van 1 tot 4 procent normaal, zeker bij repeterend werk aan het eind van de dag. Het grote verschil zit in de controle: het systeem weet wanneer het twijfelt en meldt dat, een vermoeide medewerker niet.

Die worden gewoon verwerkt. De modellen lezen onder meer Nederlands, Engels, Duits en Frans zonder aparte inrichting per taal. Handig voor bedrijven die met buitenlandse leveranciers of internationale contracten werken: de gegevens komen in een uniforme structuur in je systemen terecht, ongeacht de taal van het brondocument.

Ja, en dat is bewust zo gebouwd. Bij elk geextraheerd gegeven bewaren we de herkomst: uit welk document het komt, van welke plek op de pagina en met welke zekerheid. Voor een accountantscontrole of interne audit kun je dus altijd van een waarde in je administratie terugbladeren naar het originele stuk. Het brondocument zelf blijft gearchiveerd binnen je eigen omgeving.

Eén gesprek en je weet hoe AI je organisatie een stap vooruit brengt.

App ons of bel direct. Reactie binnen 1 uur op werkdagen.

Liever mailen? info@thraive.nl