Anleitung: Audio erzeugen & importieren
Stimmen und SFX direkt im Story-Modus erzeugen oder eigenes Audio importieren
đŹ Audio im Story-Modus (empfohlen) v3.0.0+
Seit v3.0.0 mĂŒssen Sie keine externen APIs mehr selbst aufrufen. Der Schritt †Audio im Story-Modus erzeugt Dialogstimmen (TTS) und Soundeffekte (SFX) direkt in der App.
Segmente mit ⣠Szenenaufteilung erzeugen
Beim Aufteilen des Skripts in Szenen entstehen pro Szene ErzÀhler- und Dialogsegmente sowie sfx-Segmente. Jedes Segment trÀgt einen Sprecher und eine Emotion.
In †Audio jedem Sprecher eine Stimme zuweisen
Klicken Sie in der Sprecherliste auf đ, um die Stimmenauswahl zu öffnen. Sprecher ohne Zuweisung werden mit der Standardstimme erzeugt.
AusfĂŒhren und Segment fĂŒr Segment prĂŒfen
Das erzeugte Audio landet unter story/audio/segments/ in Ihrem Projekt. Nach Abschluss erscheint im Panel eine Zeitleiste mit einer Spur pro Sprecher. In der Tabelle bietet jede Zeile â¶Test · Vorschau · â»Neu erzeugen.
đĄ Tipp: Aktivieren Sie "Auto" bei den Schritten, denen Sie vertrauen, und drĂŒcken Sie "Alle ausfĂŒhren" â Szenenaufteilung â Audio â Prompts laufen dann nacheinander durch. Den kompletten Ablauf beschreibt die Story-Modus-Anleitung.
đïž Stimme pro Sprecher zuweisen
Stimmen werden pro Sprecher zugewiesen. Innerhalb eines Skripts können Sie die Engines mischen â Typecast fĂŒr den ErzĂ€hler, ElevenLabs fĂŒr die Hauptfigur, Gemini fĂŒr eine Nebenrolle.
Drei TTS-Engines
| Engine | Beschreibung |
|---|---|
Typecast | API-Key unter Einstellungen â TTS-Keys eintragen, dann wird die Stimmenliste geladen. UnterstĂŒtzt den Emotionsparameter direkt. |
Gemini TTS | Nutzt Ihren Gemini-API-Key weiter â kein zusĂ€tzlicher Key nötig. Bietet mehrsprachige, vorgefertigte Stimmen. |
ElevenLabs | API-Key unter Einstellungen â TTS-Keys eintragen. Es gibt sehr viele geteilte Stimmen, daher lĂ€dt die Suche im Dialog ab 2 Zeichen weitere Stimmen aus der Ferne nach. |
Die Stimmenauswahl
Gut zu wissen
— Unterscheidet sich das Geschlecht der Figur von dem der Stimme, erscheint ein â auf dem Button. Das ist nur ein Hinweis â die Generierung lĂ€uft trotzdem.
— Stimmkarten mit unbestĂ€tigtem Geschlecht lassen sich per Rechtsklick selbst als weiblich oder mĂ€nnlich markieren.
— Jeder Sprecher erhĂ€lt eine eigene ErzĂ€hlspur (der ErzĂ€hler ist Spur 0) â der Export landet in CapCut entsprechend als Mehrspur-Projekt.
đ Wie Emotion angewendet wird
Die Emotion wird jedem Segment bei der Szenenaufteilung automatisch zugewiesen und ist in der Spalte Segment (Emotion) der Tabelle in †Audio ablesbar.
Emotionswerte
| Emotion | Beschreibung |
|---|---|
normal | Standard |
happy | Freudig / hell |
sad | Traurig |
angry | WĂŒtend / intensiv |
Regeln
— Emotion gilt nur fĂŒr Figurendialoge. ErzĂ€hlersegmente werden unabhĂ€ngig vom Emotionswert immer als normal synthetisiert.
— Jede Engine setzt das anders um â Typecast nimmt einen Emotionsparameter, Gemini TTS eine Stilanweisung, ElevenLabs nĂ€hert den Ton ĂŒber die Voice Settings an.
— Ăndern Sie Stimme, Engine oder Emotion eines Sprechers, werden die betroffenen Segmente neu synthetisiert statt wiederverwendet.
đ Automatische SFX-Extraktion
Soundeffekte werden fĂŒr Sie aus dem Skript herausgezogen. Bei der Szenenaufteilung fĂŒgt die KI dort, wo die Geschichte einen Effekt braucht â eine knarrende TĂŒr, fernes Donnern, Schritte â ein sfx-Segment mit einer kurzen englischen Beschreibung ein, und Schritt †Audio erzeugt es an genau dieser Stelle.
Ein sfx-Segment belegt dieselbe Position in der Abfolge wie eine Dialogzeile und sitzt damit genau an der gewĂŒnschten Stelle der Szene.
In der Sprecherspalte steht SFX, in der Segmentspalte die englische Beschreibung samt Quellen-Dropdown. Erzeugen kann nur ElevenLabs (Standard) â Library ist noch nicht verfĂŒgbar.
Mit â¶Test erzeugen Sie nur diesen einen Effekt und hören ihn ab; passt er nicht, erzeugen Sie ihn mit â» neu.
Soundeffekte landen zusammen mit dem Dialogaudio in story/audio/segments/.
đ§ Audio-Tab in der App
Nach dem Import bietet der Audio-Tab eine vollstĂ€ndige Ăbersicht Ihres Audiopakets.
Stimmenanzahl pro Charakter, SFX-Anzahl pro Kategorie, Gesamtdauer-AufschlĂŒsselung.
Chronologische Liste mit automatischer Szenenzuordnung ĂŒber Timecodes.
Vorschau jeder Audiodatei direkt in der App mit Inline-Player.
Ungeeignete Audio markieren. Nach Name, Dauer oder Status sortieren.
đĄ Drei Ansichten im Ergebnis-Panel: Das Ergebnis-Panel unter den Generierungs-Tabs wechselt zwischen â¶ Zeitleiste · â° Ergebnisse · â Raster. Die Raster-Ansicht kam mit v3.0.0 hinzu.
đŠ Eigenes Audio verwenden Manuell
Wenn Sie extern erstelltes Audio verwenden möchten, funktioniert der bisherige Audiopaket-Import weiterhin unverÀndert. Nutzen Sie ihn, wenn Sie nicht im Story-Modus arbeiten oder Stimmen und Effekte bereits vorliegen.
TTS-Audio extern generieren
Erzeugen Sie mit Typecast oder ElevenLabs charakterspezifische Dialogstimmen und organisieren Sie die Dateien nach Charakter-Ordnern.
SFX-Soundeffekte generieren
Erstellen Sie mit der ElevenLabs Sound Generation API UmgebungsgerÀusche, Schritte, Requisiten und weitere Effekte nach Kategorie.
Paket in AutoFlowCut importieren
Legen Sie die Audiodateien im media/-Ordner Ihres Projektverzeichnisses ab. AutoFlowCut erkennt und importiert das Audiopaket automatisch.
đĄ Tipp: Audiodateien mit Timecodes im Dateinamen werden automatisch den entsprechenden SRT-Untertitel-Zeitstempeln zugeordnet.
đ Audiopaket-Struktur Manuell
Organisieren Sie Ihre Audiodateien in folgender Verzeichnisstruktur innerhalb Ihres Projektordners:
media/ âââ voices/ # TTS-Dateien pro Charakter â âââ narrator/ â â âââ narrator_001_0000.mp3 â â âââ narrator_002_0035.mp3 â âââ scholar/ â âââ scholar_001_0120.mp3 âââ sfx/ # Soundeffekte nach Kategorie â âââ 01_props/ â âââ 02_ambience_wind/ â âââ 03_breath/ â âââ 04_footsteps/ â âââ 05_metal_doors/ â âââ 06_writing/ â âââ 07_crowd/ âââ .audio_review.json # Ungeeignete Audio-Verfolgung
đĄ Hinweis: Der voices/-Ordner enthĂ€lt Unterordner pro Charakter. Der sfx/-Ordner enthĂ€lt kategoriebasierte Unterordner.
đïž TTS (Dialogstimme) Manuell
Charakterspezifische Dialogaudio, generiert ĂŒber Text-to-Speech-APIs.
Generierungs-API: Typecast
API: https://api.typecast.ai/v1/text-to-speech
Dateibenennungskonvention
{charakter}_{nummer}_{MMSS}.mp3
Beispiele:
narrator/narrator_001_0000.mp3 # ErzÀhler, Zeile 1, bei 00:00
scholar/scholar_003_0245.mp3 # Gelehrter, Zeile 3, bei 02:45
Der Timecode (MMSS) ermöglicht die automatische Zuordnung zu SRT-Untertitel-Zeitstempeln.
Emotionsparameter
Es sind dieselben Werte, die auch die App verwendet (normal / happy / sad / angry). Details unter Wie Emotion angewendet wird.
đ SFX (Soundeffekte) Manuell
UmgebungsgerÀusche, Foley und Effekte, generiert durch KI-Soundgenerierung.
Generierungs-API: ElevenLabs
API: https://api.elevenlabs.io/v1/sound-generation
7 SFX-Kategorien
01_props/ — Objektinteraktionen, Klicks02_ambience_*/ — Wind, Regen, Vögel03_breath/ — Atmen, Seufzen04_footsteps/ — Gehen, Laufen05_metal_doors/ — TĂŒren, Schlösser, Aufprall06_writing/ — Pinsel, StiftgerĂ€usche07_crowd/ — Gemurmel, GeplauderDateibenennung
{kategorie}/{beschreibender_name}.mp3
Timecode-SFX (synchronisiert mit bestimmter Szene):
abacus_beads_dark_01_0015.mp3 # fĂŒr Szene 00:15
abacus_beads_01_0134.mp3 # fĂŒr Szene 01:34
Timecode-Dateinamen (enden auf _MMSS) werden automatisch den entsprechenden Szenen zugeordnet.
đ Audio-Review-System Manuell
Markieren Sie ungeeignete Audiodateien ĂŒber die App-OberflĂ€che oder Claude Code MCP-Tools. Markierte Dateien werden in .audio_review.json verfolgt.
.audio_review.json Struktur
{
"media/sfx/02_ambience_wind/wind_howl_01.mp3": {
"status": "flagged",
"reason": "Kein Timecode",
"flaggedAt": "2026-03-16T05:44:55.228Z"
}
}
MCP-Tools
list_audio_reviews
— Markierte Audiodateien anzeigen
update_audio_review
— Markierungen hinzufĂŒgen oder entfernen