Inputpipeline
AI Integratie in Processen
Uitdaging
Spraakopnames, vergaderregistraties en gedicteerde notities stapelen zich snel op. Handmatige transcriptie is te traag om op schaal nuttig te zijn. De gestructureerde data in die opnames — taken, CRM-feiten, projectnotities — is waardevol maar ontoegankelijk zonder een geautomatiseerde extractielaag.
Wat we bouwden
We bouwden een end-to-end dagelijkse pipeline: spraakopnames komen binnen in een bewaakt bucket, een 60-secondensample stuurt automatische taaldetectie aan, volledige Whisper-transcriptie draait in de gedetecteerde taal, een LLM-extractor geeft getypeerde items per onderwerp (vluchtige notitie, taak, CRM-feit) via een gedeelde prompt, een PII-redactiestap reinigt elk item, en alles wordt per onderwerp doorgestuurd naar de relevante kennisbanken. Elk ruw artefact wordt gearchiveerd in GCS zodat herextractie altijd mogelijk is.
Resultaat
De pipeline draait dagelijks sinds de inzet. Elke spraakopname wordt binnen enkele minuten gestructureerde, doorzoekbare data. De extractielaag fungeert als de databackbone voor de kennisbank en alles stroomafwaarts — de output van de pipeline voedt de use-case-showcase van de site bij het bouwen.
Gebruikte technologie
- Whisper spraak-naar-tekst met taaldetectie
- LLM gestructureerde extractie (meerdere onderwerpen)
- PII-redactielaag
- GCS-archivering
- Postgres-opslag
- Dagelijkse geautomatiseerde run
binnen 7 dagen geleverd