19
ZDF plant mehr KI bei Untertiteln und Gebärdensprache
(www.heise.de)
Diese Community wird zum 01.07 auf read-only gestellt. Durch die anhäufenden IT-Probleme und der fehlende Support wechseln wir als Community auf www.feddit.org/c/dach - Ihr seid herzlich eingeladen auch dort weiter zu diskutieren!
Das Sammelbecken auf feddit für alle Deutschsprechenden aus Deutschland, Österreich, Schweiz, Liechtenstein, Luxemburg und die zwei Belgier. Außerdem natürlich alle anderen deutschprechenden Länderteile der Welt.
Für länderspezifische Themen könnt ihr euch in folgenden Communities austauschen:
Eine ausführliche Sidebar findet ihr hier: Infothread: Regeln, Feedback & sonstige Infos
Auch hier gelten die Serverregeln von https://feddit.de !
Banner: SirSamuelVimes
Ich sehe es tatsächlich auch erstmal positiv, aber bei dem aktuellen Stand der KI, wird es leider unvermeidlich zu solchen Patzern kommen. Wobei natürlich auch der beste menschliche Dolmetscher sich mal verspricht.
Oder einfach kompletten Quatsch macht: https://youtu.be/X-DxGoIVUWo?si=QoTd1nfKkvCENEH6
Welche Aufgaben muss die KI denn überhaupt lösen:
Klar, für ersteres muss eine gute KI genommen werden. Open Source kenne ich da nichts gutes. Und nein, KALI ist nicht gut, es ist scheiße im Vergleich zum Stand der Technik. OpenAI Whisper finde ich extrem gut, allerdings datenschutztechnisch schlecht. Wenn die da etwas gutes finden, was auch mit Deutsch funktioniert, dann... Aber ja, daran wird es haken.
Zweiteres, Text to Handsprache, da sehe ich überhaupt kein Problem. Das können, ich kenne mich mit Handsprache nicht sonderlich gut aus, Bilder seien, die aneinander gereiht sind und zwischen denen interpoliert wird.
Gebärdensprache ist mehr als die Aneinanderreihung von Gesten, die 1:1 dem Satz entsprechen. Denn einerseits hat Gebärdensprache einen anderen Satzbau und Grammatik, andererseits können Gebärden auch eine "Betonung" haben.
Das wär alles sicher machbar, bräuchte aber sicher viel Training für die KI.
Ich glaube das ist um einiges komplizierter. So weit ich weiß: Zum Beispiel werden Richtungen einfach durch eine Handbewegung in die entsprechende Richtung gezeigt. Was start one Ziel dieser Bewegung ist hängt dann vom Kontext ab. Klar, LLMs verstehen inzwischen worauf sich ein "es" im Satz bezieht, aber nichtsdestotrotz ist das ein richtig richtig schweres Problem für Computer.
Der Wikipedia Artikel ist interessant: https://de.wikipedia.org/wiki/Geb%C3%A4rdensprache