Zum Inhalt springen
Alle Referenzen
Media-Tech Startup | Medien & Unterhaltung

KI-Content-Plattform für serielle Unterhaltung

Multi-Tenant-SaaS für KI-generierte Hörbücher und Hörspiele mit redaktioneller Qualitätskontrolle - von der Story-Konfiguration bis zum fertigen Mehrsprecher-Audio.

KI & Automatisierung Digitale Produkte
-85%
Produktionszeit
3
Content-Formate
2 Stufen
Review-Durchlauf

Die Herausforderung

Serielle Unterhaltung zu produzieren ist teuer. Ein Hörspiel mit mehreren Sprechern durchläuft Manuskript, Casting, Studioaufnahme, Schnitt und Abnahme - Wochen an Arbeit pro Episode. Für Formate mit hoher Ausgabefrequenz rechnet sich das nur bei entsprechender Reichweite.

Unser Kunde, ein Startup in der Stealth-Phase, wollte diesen Prozess in eine Plattform überführen: B2B-Kunden konfigurieren Story-Parameter - Charaktere, Plotstruktur, Setting, Ton - und erhalten fertige Episoden in drei Formaten. Hörbuch mit einzelnem Erzähler, Hörspiel mit Mehrsprecher-Dialog, und E-Reader-Prosa zum Lesen.

Die entscheidende Anforderung war nicht Geschwindigkeit allein. Generierte Inhalte ohne redaktionelle Kontrolle sind für zahlende Kunden nicht verwendbar. Qualitätssicherung musste fester Bestandteil der Pipeline sein, nicht ein nachgelagerter Schritt.

Unser Ansatz

Wir haben die Plattform als Multi-Tenant-SaaS entwickelt, strukturiert um eine reviewbare Pipeline mit zwei festen Kontrollpunkten.

Human-in-the-Loop als Architekturprinzip. Die KI schreibt den Text, Reviewer prüfen und geben frei. Erst dann generiert die KI das Mehrsprecher-Audio, das erneut geprüft wird, bevor die Episode in der Consumer-App erscheint. Der Episoden-Workflow ist als expliziter State-Machine modelliert - jeder Zustandsübergang ist nachvollziehbar, und ein abgebrochener Review blockiert die Veröffentlichung.

Asynchrone Generierung. Text- und Audioerzeugung laufen als Hintergrund-Jobs. Das entkoppelt die Nutzeroberfläche von den teils minutenlangen Modellläufen und macht Wiederholungen bei Fehlern unkritisch.

Mehrere TTS-Anbieter parallel. Sprecherstimmen kommen je nach Rolle und Sprache aus unterschiedlichen Systemen. Die Abstraktion darüber erlaubt den Wechsel einzelner Stimmen, ohne die Pipeline anzufassen.

Mandantentrennung auf Datenbankebene. Row-Level-Security stellt sicher, dass ein Kunde nur seine eigenen Stoffe, Charaktere und Episoden sieht - auch bei fehlerhaften Abfragen in der Anwendungsschicht.

Die Ergebnisse

Aus einer Idee ist eine produktionsreife Content-Fabrik geworden. Episoden, die vorher Wochen brauchten, entstehen jetzt in Stunden - inklusive der beiden Review-Stufen, die den Qualitätsanspruch sichern.

Der eigentliche Hebel liegt in der Wiederholbarkeit. Ist eine Serie einmal konfiguriert, produziert die Plattform Folge um Folge im gleichen Ton, mit den gleichen Stimmen und dem gleichen erzählerischen Register. Genau das war mit klassischer Produktion in dieser Frequenz nicht darstellbar.

Haben Sie Projektbedarf?

Tobias

Gespräch vereinbaren →