WIEN. Wann fällt eine synthetische Stimme unter die Deepfake-Definition, und ab welchem Grad wird Audiobearbeitung zur KI-Modifizierung? Solche Abgrenzungsfragen erschweren die Anwendung der neuen Transparenzpflichten im Radioalltag. Mahshid Dadgar, Head of Compliance & Data Management im Bereich Legal & Administrative Affairs bei kronehit, erläutert im medianet-Interview, welche Kriterien Mitarbeitende benötigen und welche Herausforderungen bei der Weiterverarbeitung gekennzeichneter Inhalte entstehen.
medianet: Wie setzen Sie die seit 2. August geltenden Transparenz- und Kennzeichnungspflichten für KI-generierte beziehungsweise KI-manipulierte Inhalte in Ihrem Unternehmen konkret um? Gibt es dafür bereits interne Richtlinien, Freigabeprozesse oder einheitliche Kennzeichnungen?
Mahshid Dadgar: Für die Umsetzung der Transparenz- und Kennzeichnungspflichten sind wir bei kronehit in mehreren Schritten vorgegangen. Zunächst haben wir den konkreten Einsatz von KI in den einzelnen Abteilungen erhoben und auf Grundlage der bestehenden Materialien geprüft, inwieweit die jeweiligen Anwendungsfälle unter die Definition eines Deepfakes fallen. Dazu fanden gezielte Abstimmungstermine mit allen relevanten Abteilungen statt.
Auf Basis dieser Analyse wurden einheitliche auditive und visuelle Kennzeichnungen entwickelt. Die gesetzlichen Vorgaben sowie deren konkrete Umsetzung bei kronehit wurden anschließend in unternehmensinternen KI-Richtlinien festgehalten.
medianet: Welche Unterschiede gibt es bei der Umsetzung zwischen redaktionellen Inhalten und Werbung beziehungsweise Marketing? Gelten in Ihrem Haus dafür unterschiedliche Regeln oder Kennzeichnungsstandards – und wie werden diese in der Praxis umgesetzt?
Dadgar: Wie bekanntlich gilt nach Art. 50 Abs. 4 AI Act gilt für Deepfakes, die Bestandteil eines offensichtlich künstlerischen, kreativen, satirischen, fiktionalen oder vergleichbaren Werks oder Programms sind, eine erleichterte Transparenzpflicht.
Nach unserem derzeitigen Wissensstand, basierend auf unserer eigenen rechtlichen Prüfung sowie dem Austausch mit Expert, lässt sich allerdings noch nicht mit ausreichender Rechtssicherheit beurteilen, inwieweit redaktionelle Inhalte, etwa im Rahmen einer Unterhaltungssendung, von dieser Erleichterung erfasst sind. Rein kommerzielle Inhalte, die als solche erkennbar sind, fallen hingegen grundsätzlich nicht unter diese Ausnahme.
In unserer praktischen Umsetzung unterscheiden wir daher derzeit bei den Kennzeichnungsstandards nicht zwischen redaktionellen und kommerziellen Inhalten. Aus unserer Sicht sprechen jedoch gute Gründe dafür, jedenfalls bestimmte redaktionelle Inhalte unter die erleichterte Transparenzpflicht zu subsumieren. Für eine entsprechende Differenzierung in der Praxis bedarf es allerdings größerer Rechtssicherheit beziehungsweise einer Konkretisierung der gesetzlichen Vorgaben.
medianet: Wo stellt die Kennzeichnungspflicht Redaktion und Werbung beziehungsweise Marketing im Arbeitsalltag vor besondere Herausforderungen – etwa bei Workflows, Freigaben oder der technischen Umsetzung? Welche Rolle spielen dabei speziell KI-generierte oder KI-bearbeitete Audioinhalte und Stimmen?
Dadgar: Die größte Herausforderung bei der Umsetzung der Vorgaben des AI Acts im Arbeitsalltag liegt aus unserer Sicht in den gesetzlichen Definitionen, allen voran in der Frage, wann ein Deepfake vorliegt. Unklar ist etwa weiterhin, ob nur geklonte Stimmen realer („bekannter“) Personen erfasst sind oder auch rein synthetisch erzeugte Stimmen. Ebenso stellt sich die Frage, inwieweit der konkrete Kontext und die Erwartung des Publikums, etwa ob in einer bestimmten Situation mit einer KI-Stimme gerechnet werden kann, in die Beurteilung einfließen. Gerade diese Abgrenzungsfragen bedürfen aus unserer Sicht einer deutlich näheren Konkretisierung.
Eine weitere wesentliche Abgrenzungsfrage stellt sich etwa bei der Bearbeitung von Audioinhalten und Stimmen: Ab welchem Grad ist die Veränderung eines Stimmklangs noch eine klassische Bearbeitung und ab wann handelt es sich um eine KI-Modifizierung beziehungsweise um „Speech-to-Speech“?
Vergleichbare Fragen stellen sich auch bei der Bearbeitung von Bild und Video.
Während sich manche Anwendungsfälle eindeutig einordnen lassen, gibt es zahlreiche Grenzfälle, welche für den Arbeitsalltag besonders relevant sind.
Die derzeit häufig empfohlene Einzelfallprüfung ist für den täglichen Arbeitsablauf daher nur bedingt praktikabel. Mitarbeiter benötigen klare und möglichst einfach anwendbare Kriterien, anhand derer sie beurteilen können, welche Inhalte kennzeichnungspflichtig sind.
Die bestehenden Unsicherheiten führen dazu, dass im Zweifel mehr gekennzeichnet wird als notwendig. Gerade im Radio kann das problematisch sein, weil dadurch der Eindruck entsteht, KI-generierte Inhalte oder Deepfakes seien stärker verbreitet, als sie tatsächlich sind. Gleichzeitig bleiben privat erstellte Deepfakes vielfach ungekennzeichnet, wodurch paradoxerweise der Eindruck entstehen kann, dass KI gerade im Radio stärker eingesetzt wird als auf Plattformen.
Hinzu kommen technische Herausforderungen. Bei der Verwendung einzelner Tools ist für Anwender nicht immer ersichtlich, ob es sich um ein reines Bearbeitungswerkzeug handelt oder ob im Hintergrund KI zum Einsatz kommt. Eine weitere Herausforderung liegt darin, sicherzustellen, dass technische Kennzeichnungen, insbesondere Watermarks, auch bei der Weiterverarbeitung, beim Export oder bei der Konvertierung in andere Dateiformate dauerhaft erhalten bleiben.
medianet: Wo sehen Sie in der praktischen Umsetzung derzeit noch die größten Unsicherheiten – etwa bei der Abgrenzung zwischen KI-unterstützter Bearbeitung und kennzeichnungspflichtigen KI-Inhalten oder bei der Frage, wer innerhalb der Produktions- und Veröffentlichungskette für die Kennzeichnung verantwortlich ist?
Dadgar: Die größte Unsicherheit liegt aus unserer Sicht derzeit in der Abgrenzung, welche KI-generierten oder KI-bearbeiteten Inhalte tatsächlich einer Kennzeichnungspflicht unterliegen. Diese Frage ist für die praktische Umsetzung zentral, weil davon sämtliche weiteren Prozesse abhängen.
Die Definition des Betreibers im AI Act lässt hier zwar weniger Interpretationsspielraum, dennoch werfen auch die Verantwortlichkeiten innerhalb der Produktions- und Veröffentlichungskette in der Praxis Fragen auf. Das betrifft insbesondere Konstellationen, in denen externe Auftragnehmer an der Erstellung und Bearbeitung von Inhalten beteiligt sind.
Eine weitere Unsicherheit betrifft den Umgang mit bereits vorhandenen Kennzeichnungen eines Betreibers. Ist deren Beibehaltung bei der Veröffentlichung von Inhalten in der Rolle des Mediums lediglich empfohlen, können ursprünglich gekennzeichnete Inhalte im weiteren Verlauf ohne Kennzeichnung verbreitet werden, ohne dass daran rechtliche Konsequenzen geknüpft sind. Dies lässt sich streng genommen zwar aus den Materialien ableiten, wirft jedoch die Frage auf, inwieweit damit der Schutzzweck der Verordnung durchgehend gewährleistet werden kann.
„Für Rundfunkveranstalter sind vor allem die Deepfakes praxisrelevant"
Wann liegt ein kennzeichnungspflichtiger Deepfake vor, und wie lassen sich akustische Hinweise in das Radioprogramm integrieren? Für private Rundfunkveranstalter bleiben wichtige Fragen