Google & Microsoft bieten Deep Lerning APIs an / KI und sowas ...

Das gibt es auch für Audio Streams

https://cloud.google.com/speech-to-text/

Damit bekommst du zb aus dem gesprochenen text. Im Text kannst du dann halt nach Namen suchen.