Open menu
  • Home
  • Schrijfsels
    • Blogs
    • Populaire
    • Wetenschappelijk
    • Drenten
  • In de Media
    • AV
    • Web
    • Krant
    • Lezingen
    • AV-Lezingen
    • Televisie
  • Werk
    • TST & AI
      • Spraakherkenning
      • AI
      • Whisper
      • Knowledge Navigator
      • Showcases
      • LIPS
      • UvN
      • Maastricht
      • Diplomaten
      • TTS
      • URaad
      • Preek
    • Affiliaties
      • UTwente
      • UU
      • Telecats
      • Overige Werkgevers
    • Netwerken
      • NOTaS
      • CLST
      • Levende Herinneringen
      • SOS
    • Infrastructuur
      • CLARIN - NL
      • CLARIAH
      • CLARIN - EU
      • DARIAH
      • CHAT
      • Listen
      • Levend Verleden
    • Projecten
    • Programming
    • Software
    • Over mij
    • LOT 2023
    • NTU
    • Workshop(s)
  • Persoonlijk
    • Arjan
      • Arjan
      • Ouders
      • Zus en Broer
      • Neven en Nicht
      • Grootouders
      • Foto's
    • Brigitte
    • Drentsche Patrijshonden
    • Huizen
      • Samen
        • Burg. Reigerstraat (2010 - ...)
        • Steve Biko (2009 - 2010)
        • Baarnseweg (2007 - 2009)
        • Poortstraat (1994 - 2007)
      • Arjan
        • Poortstraat (1977 - 1994)
        • Sweelincklaan (1972 - 1977)
        • Soestdijkseweg (1965 - 1972)
        • Biltzigt (1958 - 1965)
      • Brigitte
        • Thijssenlaan (1985 - 1994)
        • Braamstraat (1981 - 1984)
        • Voorstraat (1980 - 1981)
        • Hopakker (1980 - 1980)
        • Kemperstraat (1979 - 1979)
        • Verwerstraat (1968 - 1979)
        • Oude Raadhuisstraat (1961 - 1968)
        • Drostlaan (1960 - 1961)
    • Rolanda
      • Levensverhalen
      • Rolanda 85
      • Afnemende Gezondheid
      • Begrafenis Rolanda
  • Interessant
    • Tekst-naar-Spraak
    • Zips Law
    • Conversatie Regels
  • Extra Activiteit

blogs

Open menu
  • Blogs
  • Populaire
  • Wetenschappelijk
  • Drenten

Hoe komen chatbots als ChatGPT tot hun antwoorden?

chatGPT VKDe chatbots veroveren de wereld. Ze maken indruk door hun veelzijdigheid en goed geformuleerde zinnen, maar verbazen ook door hun rare fouten. Hoe komen ChatGPT, Google Bard en consorten eigenlijk tot hun antwoorden?

In een interessant artikel in de Volkskrant van 16 juni 2023 schrijft Laurens Verhagen over de drie populairste chatbots en legt hij een (beetje) uit hoe ze werken. Dwz. hij omschrijft een beetje wat er gebeurt als je de bots een vraag stelt en heel vaag, hoe de training precies tot stand gekomen is. Ik had eerlijk gezegd gehoopt dat hij iets dieper op de precies training in zou gaan, want nu blijft het een beetje vaag.

Toch is het wel een interessant stuk en ik heb de vrijheid genomen om, met verwijzing naar de originele content, het stuk op de site te zetten.

 


 

Auteur: Laurens Verhagen
Illustraties: Sophia Twigt
Tijd-Datum: 16 juni 2023, 11:30
Copyright:
Volkskrant
Origineel: https://www.volkskrant.nl/kijkverder/v/2023/hoe-werkt-chatgpt-nu-eigenlijk-onder-de-motorkap~v750606/

Het lijkt achteloos te gebeuren. Slechts een paar seconden na de (best complexe) vraag geven programma’s als Bing Chat (van Microsoft), Bard (van Google) en ChatGPT (van OpenAI) hun antwoorden. De vraag: ‘Schrijf een korte (zeven vragen, zeven antwoorden) dialoog in de stijl van Plato over de vraag of AI bewustzijn kan hebben.’ De Griekse wijsgeer (427 - 347 vChr) onderscheidde zich stilistisch van zijn voorgangers door het schrijven van dialogen waarin hij een filosofisch gesprek voert met een opponent. Plato neemt hierin de rol aan van zijn leermeester Socrates.

Alle chatbots brengen hun taak inhoudelijk tot een goed einde en weten zowel het wezen van de Socratische dialoog als het hedendaagse debat over AI en bewustzijn in leesbare en prikkelende zinnen over het voetlicht te brengen.

...

Bard

Fragment van dialoog via Google Bard

Schrijf een korte dialoog in de stijl van Plato over de vraag of AI bewustzijn kan hebben.

Socrates  Wat is er voor nodig om te bewijzen dat AI bewustzijn kan hebben?
Glaucon Ik weet het niet zeker. Misschien als ze slaagt voor de Turing Test?
Socrates De Turing Test is geen perfecte meting voor bewustzijn. Ze kan voor de gek worden gehouden door machines die niet echt bewust zijn.
Glaucon Dat weet ik, maar het is het beste wat we hebben
Socrates Misschien, maar ik denk dat we voorzichtig moeten zijn met antropomorfiseren. Als AI iets kan wat mensen ook kunnen, wil nog niet zeggen dat AI op dezelfde manier bewust zijn als wij dat zijn.

Tegelijkertijd maken ze vreemde fouten, fouten die een basisscholier niet zou maken. Zeven vragen en antwoorden, was de opdracht. Dat lukt niet altijd. Bard smokkelt er flink wat bij, terwijl Bing het na vijf keer kort gepingpong wel mooi vindt geweest. De dialoog die daarop volgt, is nog vreemder. Bing maakt excuses, probeert het nog een paar keer, maar komt er niet uit.

Bing

De excuses van Bing

Dit zijn geen zeven vragen en geen zeven antwoorden.

Je hebt gelijk. Het spijt me dat ik dat niet goed heb gedaan. Hier is een nieuwe dialoog die wel voldoet aan de eisen...

Het is een beeld dat ze vaker laten zien: indrukwekkende prestaties gaan samen met lastig te vatten blunders. In dit verband valt vaak de ontnuchterende term stochastische papegaai: de zogenoemde grote taalmodellen die bovengenoemde chatbots aansturen hebben geen begrip van de wereld, maar doen niets anders dan woorden voorspellen en de ontelbare teksten waarmee ze zijn getraind napapegaaien.

Anders dan zoekmachines zijn ChatGPT en consorten niet ontworpen om correcte antwoorden te geven, maar om natuurlijke taal te produceren via het herkennen van tekstpatronen. Als de inhoud toch correct is, wat gelukkig meestal het geval is, is dat een mooie bijvangst. Dit leidt tot ware huzarenstukjes: de laatste generatie chatbots verbeteren computercode, kunnen samenvattingen maken van ingewikkelde wetenschappelijke studies en over elk denkbaar onderwerp meepraten. En het gaat steeds beter. De vorige versie van ChatGPT zakte nog voor het Amerikaanse juristenexamen, de opvolger (voor de liefhebber: GPT-4) scoort al bovengemiddeld.

Jelle Zuidema, UvA

De snelle progressie brengt de AI-wereld in verwarring. Zijn de chatbots dan misschien toch meer dan die stochastische papegaaien die ze volgens sommige experts zijn? Jelle Zuidema, universitair hoofddocent natuurlijke taalverwerking aan de Universiteit van Amsterdam, vindt de papegaaimetafoor niet zo gelukkig: ‘Ze suggereert dat die modellen voornamelijk kopiëren en plakken, terwijl we ook in kleinere modellen zien dat ze wel degelijk nieuwe, creatieve combinaties van bestaande elementen kunnen maken.’

Volgens Zuidema zijn de aanwijzingen ‘overweldigend’ dat GPT3 (het taalmodel achter ChatGPT) en andere LLM’s (Large Language Models, grote taalmodellen) ook veel abstracte patronen over verhaal- en dialoogstructuur hebben geleerd. Met andere woorden: de papegaaimetafoor is een grove onderschatting van de capaciteiten van de moderne taalmodellen.

In één adem door waarschuwt Zuidema voor overschatting op basis van de huidige vaardigheden: ‘Je moet voorzichtig zijn met claims over menselijke cognitieve vaardigheden.’ De mens is vrij snel geneigd het etiket ‘intelligent’ op computers te plakken, maar dit soort AI-systemen werken fundamenteel anders dan ons biologische brein. ChatGPT komt tot zijn vaak indrukwekkende prestaties via statistische associaties, met als gevolg dat ook GPT-4 nog steeds prachtig verwoorde onzin kan uitkramen.

Hoe kan dat? Hoe komen de moderne chatbots aan hun zinnen? In de basis is het GPT-model (Generative Pretrained Transformer) achter ChatGPT een getraind model om patronen in taal te herkennen en zo voorspellingen te kunnen doen. Denk aan de voorspellende tekstinvoer die bijvoorbeeld op het toetsenbord van mobieltjes zit. Op basis van eerdere berichten voorspelt die software het volgende woord. Na ‘ik’ volgt ‘heb’ en daarna ‘een’ en ‘vraag’. Maar wie telkens het voorgestelde woord aanklikt, creëert uiteindelijk bijzonder vreemde zinnen.

chatGPT

Slimme chatGPT

ChatGPT zit veel slimmer in elkaar en maakt niet alleen grammaticaal correcte zinnen en paragrafen, maar ook nog eens teksten die rekening houden met de context en de gegeven tekstinvoer. Met als gevolg dat ze lezen alsof ze door een mens zijn geschreven.
Het antwoord van chatGPT was als volgt:

Plato's dialogen zijn gekenmerkt door Socrates die ondervraagt, dus laten we een dialoog maken tussen Socrates en een AI onderzoeker genaamd Hypatia.

Socrates    Hypatia, jij bent bekend met de kunstmatige intelligentie, is het niet zo?
Hypatia Inderdaad Socrates, ik heb er mijn leven aan gewijd.
Socrates Je hebt het over intelligentie, maar kan een kunstmatige entiteit bewustzijn hebben?
Hypatia Het hangt af van hoe we "bewustzijn" definiëren, Socrates. Veel mensen nemen aan dat bewustzijn het vermogen is om ervaringen te hebben en te interpreteren.
Socrates Maar kan een machine dat doen? Kan het de zoetheid van honing proeven of het schitterende blauw van de lucht waarderen?
Hypatia Nee, Socrates, een machine kan deze sensaties niet direct ervaren zoals wij dat doen. Maar het kan wel gegevens over de wereld interpreteren en daarop reageren.
Socrates Maar is dat hetzelfde als bewustzijn? Mensen kunnen gevoelens ervaren, kunnen lijden, kunnen zich verheugen. Zijn dit niet de dingen die ons bewust maken?
Hypatia Het is waar, Socrates, dat machines niet kunnen voelen zoals mensen. Echter, sommigen argumenteren dat een voldoende geavanceerde AI het vermogen kan hebben om een vorm van bewustzijn te bereiken door zijn interacties en het verwerken van informatie.
Socrates Dus je stelt dat bewustzijn afhangt van de complexiteit van interpretatie en interactie, niet van het vermogen om te voelen?
Hypatia Het is een mogelijke interpretatie, Socrates. Hoewel het niet universeel geaccepteerd is.
Socrates Ik zie, Hypatia, dat het een diepgaande vraag is waar niet gemakkelijk een antwoord op te vinden is. Toch waardeer ik je inzicht en nodig ik je uit om er verder over na te denken.
Hypatia Dank je, Socrates. Het is inderdaad een vraag die nog veel discussie en contemplatie vereist.

 

 

Een kijkje onder de motorkap, in vijf stappen.

Verzamelen

 

ChatGPT is getraind op een grote hoeveelheid digitale tekst. Denk aan de artikelen van grote nieuwswebsites, elektronische boeken, wetteksten, fora of Wikipedia. Zo leert het onderliggend model de structuur en het gebruik van taal. Helaas zijn bedrijven als OpenAI niet erg open over de gebruikte trainingsdata voor de taalmodellen. Ook GPT-4 is een zwarte doos. Bedrijfsgeheim, zegt zijn maker OpenAI, tot frustratie van academici.

Verwerken

 

Volgende stap: al die teksten omzetten in zogeheten ‘tokens’, kleine bouwsteentjes. Dit kunnen woorden zijn, maar ook leestekens of achtervoegsels als ‘-aar’ van ‘wandelaar’. Ieder token krijgt een unieke rij van getallen mee waarmee het neurale netwerk verder kan werken.

Zo’n rijtje getallen kun je zien als de coördinaten in een multidimensionale ruimte: ieder token heeft daar z’n eigen plekje, in de buurt van de tokens die wat betreft betekenis dicht bij elkaar liggen, de zogenoemde word embeddings. Groot (of eigenlijk het rijtje getallen dat hieraan is gekoppeld) zit bijvoorbeeld in de buurt van gigantisch, omvangrijk en massief. En Biden bij president, politicus en Trump.

Woorden die we vaak in vergelijkbare contexten gebruiken, krijgen dus embeddings die dicht bij elkaar liggen. Dit betekent dat het model leert dat bepaalde woorden vergelijkbare betekenissen hebben, puur op basis van hoe wij ze gebruiken. Maar ook wat andersoortige relaties tussen woorden zijn. Bijvoorbeeld dat de relatie tussen ‘koning’ en ‘koningin’ vergelijkbaar is met die tussen ‘man’ en ‘vrouw.

Trainen

 

Nu begint het taalmodel als het ware een quiz met zichzelf, door een stuk tekst te pakken en daaruit woorden weg te halen. Dan voorspelt het welke woorden logischerwijs zouden moeten volgen, waarna deze prognose wordt vergeleken met de oorspronkelijke tekst. Afhankelijk van hoe goed of slecht de prognose was, past het algoritme de gewichtjes (hoe hoger de kans dat een woord volgt, hoe zwaarder het gewicht) in het taalmodel aan. Op deze manier leert het systeem.

GPT3 heeft 175 miljard van zulke gewichtjes, en heeft daarom ook honderden miljarden woorden nodig om van te leren, en een supercomputer om honderden miljarden keren dezelfde ‘quiz’ met zichzelf uit te voeren. Die 175 miljard gewichten zijn georganiseerd volgens een structuur die het transformermodel heet (de T van GPT). Transformers blijken, als ze groot genoeg zijn en genoeg data hebben gezien, enorm goed de belangrijkste delen van een zin te kunnen identificeren om de betekenis te ‘begrijpen’.

Tot slot voegt OpenAI nog een extra trainingslaag aan het hele proces toe, door ook mensen te laten meekijken. Dit is het moderne lopende bandwerk: is een antwoord correct, onduidelijk of slaat het misschien wel helemaal nergens op? Menselijke feedback verfijnt het systeem verder.

Voorspellen

 

Tijdens de training leert het model patronen herkennen in de taal en gebruikt het deze patronen om te voorspellen wat er waarschijnlijk volgt op een gegeven stuk tekst. Er bestaat geen grote database aan de hand waarvan het systeem elk woord leert te begrijpen. Nee, het taalmodel functioneert feitelijk als een supertelraam door woorden wiskundig te benaderen.

Antwoorden

 

Als een gebruiker gedachteloos een vraag stelt of een instructie geeft, gebruikt ChatGPT al zijn training om een zo goed mogelijk antwoord te genereren. Het model voorspelt welke woorden of zinnen het meest waarschijnlijk volgen op de gegeven instructie en genereert op basis daarvan een reactie. Dit is niet simpelweg een kwestie van de hoogst mogelijke waarschijnlijkheidsscore. Wie bijvoorbeeld aan zijn instructie meegeeft dat ChatGPT wat creatiever in zijn antwoord mag zijn, of moet rijmen, of in de stijl van een specifieke denker moet schrijven, dwingt het model tot een andere woordvoorspelling. Zo kan het gebeuren dat na ‘Het huiveringwekkende’ de ene keer ‘scenario’ volgt, en een andere keer ‘spiegelpaleis’. Maar een woord als ‘printers’ zal niet volgen.

Dit proces gaat razendsnel, maar wel woord voor woord, door het systeem iedere keer weer het nieuwe woord te voeden en daarop te laten reageren. Het resultaat is een tekst die nog niet eerder is geschreven en waarvan ook niet precies is aan te wijzen waar hij vandaan komt. Vaak gaat het goed, soms slaat het model inhoudelijk de plank mis. Maar over één ding zijn alle experts het wel eens: de chatbots zullen steeds overtuigender worden.

Over de auteur

Laurens Verhagen schrijft voor de Volkskrant over technologie, internet en kunstmatige intelligentie. Daarvoor was hij onder andere hoofdredacteur van nu.nl.


 

Kennis distilleren uit bergen spraak

ict magazine januari februari 2016 Pagina 11Artikel door Peter Olsthoorn is tot stand gekomen via een interview met Arjan van Hessen. Hij heeft alles herschreven waardoor het te lang werd. Peter heeft de tekst weer ingekort waarna het op 2 februari 2016 verschenen is in ICT-Magazine. Hieronder een aangepaste versie van dit artikel door Arjan.

Arjan StaatTKEen callcenter voert tien- tot honderdduizenden telefoongesprekken per jaar. Hoe kun je met data-analyse kennis halen uit deze massa conversaties?

Beeld en Geluid op het Mediapark in Hilversum maakt een miljoen uur aan audio- en video- (AV) materiaal toegankelijk: een aantal dat jaarlijks met 40.000 uur toeneemt. Maar hoe vind je het gewenste bestand? Daartoe bouwt Beeld en Geluid verschillende ingangen en verbindingen. Programmatitel, regisseur en uitzenddatum volstaan niet voor de vindbaarheid van een onderwerp.

Het AV-materiaal gaat door de spraakherkenner voor – niet-foutloze – transcripties, geschikt voor trefwoordlabels aan fragmenten. Sprekerherkenning helpt bij het achterhalen van presentatoren en gasten van wie de stemprofielen in de databank staan. Op termijn zullen ook niet-bekende Nederlanders herkend kunnen worden.

“We werken aan het audiovisuele web en hyperlinking”, vertelt Roeland Ordelman, Hoofd Onderzoek van Beeld en Geluid. “Daarbij worden tussen allerlei soorten data verbanden gelegd. Met het gecreëerde netwerk kun je op een intuïtieve manier door content navigeren.” Labels maken ook koppelingen met andere bestanden mogelijk, zoals tussen het radioarchief en de beeldbank van het Nationaal Archief. Radio krijgt daardoor een beeldscherm.

Big data

Het gaat om het toegankelijk maken van een "immense audiovisuele stroom" die groeit naar 90 procent van het internetverkeer. Big data? Ordelman: “Ja, er is sprake van Volume, Velocity, Value, Veracity en Variety. Wij oogsten waarde uit de brei met spraak- en sprekerherkenning, visuele analyse en "hogere tools.”

privacySamen met de universiteiten van Twente, Amsterdam en Delft test Beeld en Geluid nieuwe applicaties. Op labs.beeldengeluid.nl zijn datasets en api’s beschikbaar. Ordelman: “We verwachten de komende tien jaar een grote hoeveelheid programma’s voor analyse. Probleem is wel dat je veel computercapaciteit nodig hebt. We kijken met de Universiteit van Amsterdam naar een cloud-oplossing.”

Audiovisuele stroom wordt toegankelijk

Spraak is rijk maar ook ambigu en meestal grammaticaal incorrect, bevat aarzelingen, pauzes, onderbrekingen, halve zinnen. Logisch werkende analysetools die vaak wel werken met geschreven teksten, volstaan daarom niet. Zeker bij telefonieapplicaties (de spraak via de telefoon is van minder e kwaliteit en dus is de herkenning slechter) is het dan ook een uitdaging om in een gesproken-dialoog met de beller tot een bevredigend resultaat te komen. Maar..... met wat kunst-en-vliegwerk lukt het wel getuige de meer dan 1M gesprekken die per maand door spraakherkenning worden afgehandeld.
De bottleneck blijft de “kloof tussen wat bedoeld en gezegd wordt" aldus Arjan van Hessen. In het verleden werkte hij aan spraakherkenning bij het roemruchte Vlaamse Lernout & Hauspie maar tegenwoordig verdeelt hij zijn tijd over het Enschedese bedrijf Telecats, de Universiteit Twente en de Universiteit Utrecht. Zowel op de UT als bij Telecats wordt er gewerkt aan het doorzoekbaar maken van grote hoeveelheden spraak. Spraakopnemen wordt immers steeds makkelijker (opnemen met smartphones, tablets, laptops en opslaan in de cloud) en goedkoper (opslag kost bijna niets meer).
Organisaties als het NIOD, Beeld en Geluid, de Tweede Kamer, gemeentes en het Huizinga Instituut voor Oral History gebruiken spraakherkenning om de (soms) duizenden uren aan audiovisueel materiaal te ontsluiten. En sinds kort zijn ook onderwijsorganisaties zoals SURF en opsporingsinstanties zoals politie en inlichtingendiensten (MIVD en AIVD) geinteresseerd in de mogelijkheden die Taal- en Spraaktechnologie bieden. De veiligheidsdiensten waren dit natuurlij al veel en veel langer, maar pas sinds kort zoeken ze contact met Nederlandse bedrijven en universiteiten.

Sprekerherkenning

Bij sprekerherkenning zijn er grofweg twee varianten. De meest bekende is het bepalen of een spreker daadwerkelijk diegene is die hij/zij claimt te zijn of waarvan jij met enige zekerheid wilt kunnen zeggen: ja dat is hem! Inlichtingendiensten gebruiken het bijvoorbeeld om te bepalen of een een gesproken boodschap daadwerkelijk van een bepaalde terroristenleider afkomstig is of niet. Banken kunnen het gebruiken om rekeninghouders zonder paswoord toegang te geven tot hun account.
De andere manier van sprekerherkenning is diarisatie: hierbij worden "onbekende sprekers" in een grote verzameling spraak geclusterd. Dwz dat de computer bepaalt of spreker A in opname B dezelfde is als spreker C in opname D en spreker E in opname F. Als je dan weet dat de spreker in opname E Jan-Peter is, dan weet je direct dat Jan-Peter ook spreker A en spreker C is. Dat is erg handig als je enorm veel materiaal hebt zoals bv Beeld en Geluid, en op zoek bent naar het materiaal van een specifieke spreker X (bv ex-premier Balkenende). Vaak staat niet in de metadata dat Balkenened in deze uitzending aan het woord komt en ook niet zegt de presentator netjes "ik geef het woord aan Balkenende. Wil je alle spraak van Balkenende verzamelen (bv voor analyse) dan is diarisatie een zeer nuttig hulpmiddel.

Onderwerp labeling

Een volgende stap is het bepalen van het onderwerp waarover gesproken wordt. In "Frei Swebende" spraak (zeg maar de dagelijkse conversaties die we met de mensen om ons heen voeren) is dat duivels moeilijk omdat het in principe overal over kan gaan en mensen nogal de neiging hebben om van de hak-op-de-tak te springen en steeds van onderwerp te veranderen. In callcenters is dit gelukkig iets makkelijker omdat de onderwerpen waarover gesproken kan worden, gelimiteerd zijn. Het labelen ofwel classificeren bestaat uit het nadoen van het menselijk gedrag: "als bellers dit zeggen, naar welk doorkiesnummer zou jij (als medewerker) het gesprek dan door sturen?" Van Hessen: “Grote organisaties zitten dikwijls in ee spagaat. Enerzijds willen ze zo veel mogelijk weten over binnengekomen gesprekken (wie belt wanneer waarvoor) anderzijds willen ze in verband met de kosten zo veel mogelijk gesprekken zo snel mogelijk af handelen. Als er op de borden staat dat er nog 10 wachtend zijn, dan gaan de meeste callcenter medewerkers niet een uitgebreide gespreksnotitie maken maar classificeren ze het gesprekken als "overig", omdat ze dan niets meer hoeven in te vullen.”

brabantwater

Gespreksanalyse

Een hier op lijkend iets is de gespreksanalyse. Anders dan bij labeling, wordt er niet actief in het gesprek ingegepen maar probeert de computer (achteraf) een volledige analyse te doen van het binnekomende gesprek. Hoe lang stond de beller in de wachtrij, welke vragen kreeg hij, hoe reageerde de medewerker, welke vragen stelde die (zat daar het verwachte "goede morgen met....." bij of niet) en meer. Dit soort analyses bieden inzicht in de trajecten die een beller doorloopt en kunnen helpen bij het opzoeken (en oplossen) van knelpunten. Door spraakherkenning los te laten op zowel de spraak van de beller als die van de medewerker, kan bovendien nog veel meer inzicht verkregen worden in de reden dat iemand belt maar ook in de juiste (of juist onjuiste) manier vn het gesprek voeren door de medewerker en biedt het een nog beter inzicht in de reden dat mensen bellen.
Telecats heeft inmiddels grote analysetrajecten gedaan voor onder meer DUO van OCW, Belastingdienst, Aegon en Brabant Water. Tienduizenden gesprekken werden opgenomen en door de spraakherkenner gehaald om de inhoud ervan te bepalen.“Dit leverde, naast de klassieke datum, tijdstip en gespreksduur vooral zinvolle gegevens op over herhaalgesprekken - na belleridentificatie –, juistheid van doorverbinden en specifieke onderwerpen waardoor procesoptimalisatie beter werkte.

Toen bleek dat de onderwerpen waarover gebeld werd, sterk "dag en tijd specifiek" waren, kon besloten worden om de menustructuur daarop aan te passen zodat klanten sneller en beter worden geholpen. Van Hessen: “Analyse van callcenterdata levert ook een beter inzicht op in de verschillen tussen FAQ’s via web en telefoon. Die web-FAQ’s gaan over "wie zijn jullie en wat doen jullie", terwijl de gesproken FAQ’s persoonlijker zijn: "wat kunnen jullie voor mij betekenen?".

Van Hessen is positief over de rol van taal- en spraaktechnologie. Het kan zowel helpen om klanten sneller van dienst te zijn als om de gewenste managementinformatie (semi-)automatisch te extraheren. Medewerkers houden zo meer tijd over om te doen waar vooral mensen goed in zijn: praten met andere mensen!

Social Signal Processing

ik ben aliceNu robots een steeds prominentere rol in de samenleving gaan spelen en duidelijk wordt dat ze (wellicht) in de nabije toekomst zorgtaken gaan overnemen zoals in de documentaire "Ik ben Alice" te zien is, wordt duidelijk dat robots een "idee" moeten hebben van de menselijke emotie. Zowel aan de ontvangende kant (herkennen dat iemand verdrietig is) als aan de zendende kant (een troostende toon aanslaan). Dit heet ook wel Social Signal Processing (SSP): het met computers en algoritmes bepalen van de emotionele staat van sprekers en daar adequaat op reageren. Allerlei features in het spraak- signaal zoals plotselinge stijging van de amplitude, toenemende stiltes, door elkaar praten, veranderende toonhoogtes en natuurlijk woordkeuzes, kunnen emoties helpen blootleggen. Kun je dit berekenen, dan kun je "aan de knoppen draaien" om het gesprek zo "juist mogelijk" te laten verlopen. Inzet van robots in het intermenselijke verkeer, zoals aan ziekenhuisbedden, voor alleenstaande senioren en bij recepties zal alleen goed lukken als robots op z'n minst een klein beetje emotie kunnen voelen en tonen. Van Hessen:“Het is dus noodzakelijk dat de robot zijn houding aanpast aan die van de mens.”

Maar ook in het call center biedt SSP mogelijkheden. Van Hessen: “Nu is het one-size-fits-all: iedere beller krijgt altijd dezelfde dialoog aangeboden. Maar soms hebben mensen geen zin in een uitgebreide begroeting of andere beleefdheden, maar willen ze juist direct tot de kern van de gespreksreden doordringen ("tot hoe laat zijn jullie open?"). Door dit te signaleren, kan de computer de dialoog aan passen aan de manier van spreken van de klant waardoor die op de "juiste" manier te woord wordt gestaan.

Onmenselijke of onwenselijke ontwikkelingen? “Wellicht, maar in een wereld met onvoldoende geld en/of mensen die anderen gaan verzorgen wellicht een goede "second-best" en in ieder geval beter dan mensen volledig aan hun lot overlaten.

 

Pagina 5 van 9

  • 1
  • 2
  • 3
  • 4
  • 5
  • 6
  • 7
  • 8
  • 9
  • Laatst gewijzigd: donderdag 17 september 2026 17:59:00
  • Copyright @2026 Arjan van Hessen