also generell gibt es mehrere probleme
das signal könnte mit störungen ankommen und somit ist die signalverarbeitung erschwert, da du von stream redest, hörst du das ganze wohl per internet ab, also ist das problem schonmal minimiert
dann gibt es das problem das der moderator nicht unbedingt den richtigen namen sagen könnte bspw. michi das michael
ich habe vor einem jahr mal probiert eine sprachsteuerung für eine app umzusetzten und hier mal ein paar sachen die ich da so mitgenommen habe
selbst bei perfekten audio signalen / aussprachen gibt (bzw. gab es zu dem zeitpunkt) keine api die freizugänglich ist die 100% der worte erkannt hat
ich suche gleich mal kurz ob ich meine alte dokumentation zu dem ganzen finde, weil ich dort ein paar services vergliechen habe ich weiß nurnoch das ich am ende https://wit.ai/ verwendet habe
es gibt jedoch nicht nur cloud-lösungen es gibt auch noch offline lösungen wir CMU Sphinx, hier musst du jedoch dein eigenes modell erzeugen
sonstiges: https://de.wikipedia.org/wiki/Soundex
https://en.wikipedia.org/wiki/Levenshtein_distance
edit:/
anscheint hatten ein paar Services bei dem Testsatz doch 100% erkannt, aber bei echten Aufnahmen sah das Ganze etwas anders aus.
der test satz war:
Influenza-A-Virus H1N1 bezeichnet einen Subtyp des Influenzavirus, der bei Enten, Menschen und Schweinen vorkommt, aber auch zahlreiche andere Säugetierarten sowie Truthähne infizieren kann
Google-Speech-Recognition: 100% erkannt, Antwortzeit: schnell, Preis 1.44 USD /h
Wit.ai (Facebook) 100% erkannt, Antwortzeit schnell, kostenlos
Bing Speech Recognition: 1 Fehlerhaftes, ...
Trint.com: 2 Fehlende, 1 Fehlerhaftes Wort
CMUSphinx: 71% Fehlende Wörter
Sonstige:
Dragon NaturallySpeaking bietet keine API
Voicebase Registration keine EMail erhalten
Amazon Transcribe muss CC hinterlegt werden
IBM (WATSON): kein Deutsch




Zitieren