Waarom voice AI nog wacht op zijn ChatGPT-moment
Techleiders van PolyAI en Otter stellen dat voice AI ondanks grote investeringen nog geen doorbraakmoment heeft gekend zoals ChatGPT dat voor tekst-AI was, vooral door onbetrouwbare spraakherkenning die de hele verwerkingsketen laat haperen.
Grote investeringen, nog geen doorbraak
Voice AI trekt al langere tijd grote sommen investeringsgeld aan, van modelontwikkelaars tot aanbieders van enterprise klantenservice, meeting-notetakers en AI-dictatiesoftware. Wekelijks verschijnen nieuwe tools die claimen net zo natuurlijk te klinken en converseren als een mens. Toch is de sector volgens meerdere tech-executives nog niet op het punt beland waarop ChatGPT in 2022 een omslagpunt vormde voor tekst-AI. Dat meldt TechCrunch op basis van uitspraken die vorige maand werden gedaan tijdens de HumanX-conferentie.
Spraakherkenning als zwakke schakel
Shawn Wen, CTO van het enterprise voice AI-platform PolyAI, zegt dat de industrie weliswaar een mijlpaal heeft bereikt met zogeheten full-duplex modellen, die tegelijk kunnen spreken én luisteren. Maar de volgende horde is volgens hem snelheid van redeneren: antwoorden moeten sneller komen wil een gesprek natuurlijk aanvoelen. AI-agents in klantenservice moeten bovendien niet robotisch klinken, zodat gebruikers vertrouwen krijgen dat hun probleem daadwerkelijk wordt opgelost. Wen verwacht dat klanten na twee tot drie natuurlijke gespreksbeurten met een goede voice-agent geleidelijk minder behoefte voelen om met een mens te spreken.
Een concreet technisch probleem dat hij noemt: automatische spraakherkenning (ASR) mist regelmatig belangrijke trefwoorden uit een gesprek. Daardoor gaat context verloren, wat de hele verwerkingspijplijn achter het systeem laat haperen.
Otter: transcriptie als fundament, niet als doel
Alex Gay, CMO van meeting-notetaker Otter, wijst op sprekersidentificatie, intentieherkenning en het koppelen daarvan aan organisatiekennis als noodzakelijke stappen richting verdere automatisering. Otter werkt aan zogeheten 'digital twins' die mensen in vergaderingen kunnen vertegenwoordigen. Volgens Gay moet de stem van zo'n digitale tweeling dezelfde emotionele expressie hebben als een echt mens — anders verwordt het systeem tot niet meer dan een Q&A-chatbot in plaats van een volwaardige gesprekspartner.
Gay benadrukt dat transcriptie bij Otter nooit het einddoel was, maar de basislaag waarop productiviteitswinst wordt gebouwd. Is die transcriptie niet accuraat genoeg, dan lopen alle vervolgacties — zoals automatisch gegenereerde taken — mis, wat het vertrouwen van gebruikers in het platform ondermijnt. Daarom blijft Otter investeren in verbetering van het onderliggende ASR-model.
Vertrouwen en transparantie als sleutel
Beide executives noemen taalbegrip als gebied waarop voice-modellen nog moeten verbeteren. Ze zijn het er ook over eens dat transparantie cruciaal is voor acceptatie: gebruikers moeten weten wanneer ze met AI praten of wanneer een gesprek wordt opgenomen. Wen stelt dat bedrijven bij enterprise-gesprekken altijd duidelijk moeten maken dat de gesprekspartner een AI-systeem is. Otter wil op vergelijkbare wijze vertrouwen opbouwen door deelnemers te informeren dat een meeting wordt vastgelegd, ook wanneer er geen fysieke 'bot' in de call aanwezig is.
Vooruitzicht
De uitspraken tijdens HumanX schetsen een sector die technisch snel vooruitgang boekt, maar volgens de betrokken executives nog geen definitief doorbraakmoment heeft gekend. Betrouwbare spraakherkenning, snellere redenering en heldere transparantie richting gebruikers worden genoemd als voorwaarden voordat voice AI een vergelijkbare impact kan hebben als tekst-AI na de komst van ChatGPT.