PolyAI heeft onlangs een grote stap gezet in de wereld van spraaktechnologie met de lancering van Dialog-RSN-1, hun allereerste audio-native model. CEO en host Nikola Mrkšić ging in gesprek met hoofdbouwer Matt Henderson om te bespreken waarom deze technologie een ware revolutie ontketent voor het bouwen van moderne spraakagenten.
Het probleem met traditionele stem-AI
De meeste traditionele systemen voor stem-AI lopen tegen een fundamenteel probleem aan. Ofwel ze zetten een telefoongesprek direct om in platte tekst – waardoor alle waardevolle nuances in de audio verloren gaan – of ze kiezen voor een volledige speech-to-speech-aanpak, waarbij je als maker de controle over de uiteindelijke stem verliest.
Dialog-RSN-1 kiest een vernieuwende gulden middenweg:
- Directe audio-waarneming: Het model luistert rechtstreeks naar de ruwe audio.
- Slimme timing: Het bepaalt autonoom het perfecte moment om te spreken.
- Volledige controle: De tekst-naar-spraaktechnologie blijft apart, zodat de stem volledig naar wens te beheren is – en dit alles binnen een razendsnelle responstijd van minder dan 300 milliseconden.
De geheimen achter de technologie
Tijdens het diepgaande interview bespraken Mrkšić en Henderson een aantal technische doorbraken die deze prestaties mogelijk maken:
- Wat 'audio-native' werkelijk betekent: Waarom traditionele geschakelde systemen (cascades) de rijke context van een gesprek missen.
- De kracht van autonomie: Hoe slimme redeneertechnieken ervoor zorgen dat het model alleen nadert wanneer het daadwerkelijk bijdraagt aan de snelheid en kwaliteit.
- Duplex en beurt-wisseling: Hoe het systeem feilloos aanvoelt wanneer het de beurt is om te reageren, wat zorgt voor een natuurlijk gespreksverloop.
- Snelheid onder de 300 milliseconden: Gerealiseerd door geavanceerde technieken zoals quantization, speculative decoding en specialisatie.
Een nieuwe standaard met Dialog-Eval
Naast het nieuwe model introduceerde PolyAI ook Dialog-Eval, een open benchmark om de kwaliteit van dialoogagenten eerlijk te kunnen meten. Uit tests blijkt dat het model de concurrentie op het gebied van snelheid en realtime prestaties overtreft, al wordt de lat hoog gelegd door geavanceerde systemen zoals Gemini Pro.
Het volledige interview belicht kritisch waarom bestaande benchmarks vaak tekortschieten en hoe PolyAI de toekomst van klantgerichte spraakagenten opnieuw vormgeeft.









