đŸŽ” Audio-Anleitung

Anleitung: Audio erzeugen & importieren

Stimmen und SFX direkt im Story-Modus erzeugen oder eigenes Audio importieren

🎬 Audio im Story-Modus (empfohlen) v3.0.0+

Seit v3.0.0 mĂŒssen Sie keine externen APIs mehr selbst aufrufen. Der Schritt â‘€ Audio im Story-Modus erzeugt Dialogstimmen (TTS) und Soundeffekte (SFX) direkt in der App.

1

Segmente mit ④ Szenenaufteilung erzeugen

Beim Aufteilen des Skripts in Szenen entstehen pro Szene ErzÀhler- und Dialogsegmente sowie sfx-Segmente. Jedes Segment trÀgt einen Sprecher und eine Emotion.

2

In â‘€ Audio jedem Sprecher eine Stimme zuweisen

Klicken Sie in der Sprecherliste auf 🎙, um die Stimmenauswahl zu öffnen. Sprecher ohne Zuweisung werden mit der Standardstimme erzeugt.

3

AusfĂŒhren und Segment fĂŒr Segment prĂŒfen

Das erzeugte Audio landet unter story/audio/segments/ in Ihrem Projekt. Nach Abschluss erscheint im Panel eine Zeitleiste mit einer Spur pro Sprecher. In der Tabelle bietet jede Zeile ▶Test · Vorschau · ↻Neu erzeugen.

💡 Tipp: Aktivieren Sie "Auto" bei den Schritten, denen Sie vertrauen, und drĂŒcken Sie "Alle ausfĂŒhren" — Szenenaufteilung → Audio → Prompts laufen dann nacheinander durch. Den kompletten Ablauf beschreibt die Story-Modus-Anleitung.

đŸŽ™ïž Stimme pro Sprecher zuweisen

Stimmen werden pro Sprecher zugewiesen. Innerhalb eines Skripts können Sie die Engines mischen — Typecast fĂŒr den ErzĂ€hler, ElevenLabs fĂŒr die Hauptfigur, Gemini fĂŒr eine Nebenrolle.

Drei TTS-Engines

Engine Beschreibung
TypecastAPI-Key unter Einstellungen → TTS-Keys eintragen, dann wird die Stimmenliste geladen. UnterstĂŒtzt den Emotionsparameter direkt.
Gemini TTSNutzt Ihren Gemini-API-Key weiter — kein zusĂ€tzlicher Key nötig. Bietet mehrsprachige, vorgefertigte Stimmen.
ElevenLabsAPI-Key unter Einstellungen → TTS-Keys eintragen. Es gibt sehr viele geteilte Stimmen, daher lĂ€dt die Suche im Dialog ab 2 Zeichen weitere Stimmen aus der Ferne nach.

Die Stimmenauswahl

🔖
Engine-Chips
Alle / Typecast / Gemini / ElevenLabs — jeder Chip zeigt die Anzahl seiner Stimmen.
⌕
Suche
Filtert nach Stimmnamen und Eigenschaften (traits).
♀♂
Geschlechts-Segmente
Alle / Weiblich / MÀnnlich. Ist das Geschlecht der Figur bekannt, öffnet die Auswahl direkt in diesem Segment.
▶
Vorschau
Der Play-Button auf einer Karte spielt eine Beispielzeile in dieser Stimme ab.
đŸ·ïž
Karteninfos
Jede Karte zeigt Name, Geschlechts-Tag, Sprache und Eigenschafts-Tags.
✔
BestÀtigen
Erst [Diese Stimme verwenden] ĂŒbernimmt die Auswahl. Abbrechen behĂ€lt die bisherige Zuweisung.

Gut zu wissen

— Unterscheidet sich das Geschlecht der Figur von dem der Stimme, erscheint ein ⚠ auf dem Button. Das ist nur ein Hinweis — die Generierung lĂ€uft trotzdem.

— Stimmkarten mit unbestĂ€tigtem Geschlecht lassen sich per Rechtsklick selbst als weiblich oder mĂ€nnlich markieren.

— Jeder Sprecher erhĂ€lt eine eigene ErzĂ€hlspur (der ErzĂ€hler ist Spur 0) — der Export landet in CapCut entsprechend als Mehrspur-Projekt.

🎭 Wie Emotion angewendet wird

Die Emotion wird jedem Segment bei der Szenenaufteilung automatisch zugewiesen und ist in der Spalte Segment (Emotion) der Tabelle in â‘€ Audio ablesbar.

Emotionswerte

Emotion Beschreibung
normalStandard
happyFreudig / hell
sadTraurig
angryWĂŒtend / intensiv

Regeln

— Emotion gilt nur fĂŒr Figurendialoge. ErzĂ€hlersegmente werden unabhĂ€ngig vom Emotionswert immer als normal synthetisiert.

— Jede Engine setzt das anders um — Typecast nimmt einen Emotionsparameter, Gemini TTS eine Stilanweisung, ElevenLabs nĂ€hert den Ton ĂŒber die Voice Settings an.

— Ändern Sie Stimme, Engine oder Emotion eines Sprechers, werden die betroffenen Segmente neu synthetisiert statt wiederverwendet.

🔊 Automatische SFX-Extraktion

Soundeffekte werden fĂŒr Sie aus dem Skript herausgezogen. Bei der Szenenaufteilung fĂŒgt die KI dort, wo die Geschichte einen Effekt braucht — eine knarrende TĂŒr, fernes Donnern, Schritte — ein sfx-Segment mit einer kurzen englischen Beschreibung ein, und Schritt â‘€ Audio erzeugt es an genau dieser Stelle.

🎬 In der Szene platziert

Ein sfx-Segment belegt dieselbe Position in der Abfolge wie eine Dialogzeile und sitzt damit genau an der gewĂŒnschten Stelle der Szene.

📋 So sieht es in der Tabelle aus

In der Sprecherspalte steht SFX, in der Segmentspalte die englische Beschreibung samt Quellen-Dropdown. Erzeugen kann nur ElevenLabs (Standard) — Library ist noch nicht verfĂŒgbar.

▶ Einzeln anhören

Mit ▶Test erzeugen Sie nur diesen einen Effekt und hören ihn ab; passt er nicht, erzeugen Sie ihn mit ↻ neu.

📁 Speicherort

Soundeffekte landen zusammen mit dem Dialogaudio in story/audio/segments/.

🎧 Audio-Tab in der App

Nach dem Import bietet der Audio-Tab eine vollstĂ€ndige Übersicht Ihres Audiopakets.

📊 Zusammenfassungsansicht

Stimmenanzahl pro Charakter, SFX-Anzahl pro Kategorie, Gesamtdauer-AufschlĂŒsselung.

⏱ Zeitleistenansicht

Chronologische Liste mit automatischer Szenenzuordnung ĂŒber Timecodes.

▶ Wiedergabe

Vorschau jeder Audiodatei direkt in der App mit Inline-Player.

đŸš© Markieren & Sortieren

Ungeeignete Audio markieren. Nach Name, Dauer oder Status sortieren.

💡 Drei Ansichten im Ergebnis-Panel: Das Ergebnis-Panel unter den Generierungs-Tabs wechselt zwischen ▶ Zeitleiste · ☰ Ergebnisse · ⊞ Raster. Die Raster-Ansicht kam mit v3.0.0 hinzu.

📩 Eigenes Audio verwenden Manuell

Wenn Sie extern erstelltes Audio verwenden möchten, funktioniert der bisherige Audiopaket-Import weiterhin unverÀndert. Nutzen Sie ihn, wenn Sie nicht im Story-Modus arbeiten oder Stimmen und Effekte bereits vorliegen.

1

TTS-Audio extern generieren

Erzeugen Sie mit Typecast oder ElevenLabs charakterspezifische Dialogstimmen und organisieren Sie die Dateien nach Charakter-Ordnern.

2

SFX-Soundeffekte generieren

Erstellen Sie mit der ElevenLabs Sound Generation API UmgebungsgerÀusche, Schritte, Requisiten und weitere Effekte nach Kategorie.

3

Paket in AutoFlowCut importieren

Legen Sie die Audiodateien im media/-Ordner Ihres Projektverzeichnisses ab. AutoFlowCut erkennt und importiert das Audiopaket automatisch.

💡 Tipp: Audiodateien mit Timecodes im Dateinamen werden automatisch den entsprechenden SRT-Untertitel-Zeitstempeln zugeordnet.

📁 Audiopaket-Struktur Manuell

Organisieren Sie Ihre Audiodateien in folgender Verzeichnisstruktur innerhalb Ihres Projektordners:

media/
├── voices/                    # TTS-Dateien pro Charakter
│   ├── narrator/
│   │   ├── narrator_001_0000.mp3
│   │   └── narrator_002_0035.mp3
│   └── scholar/
│       └── scholar_001_0120.mp3
├── sfx/                       # Soundeffekte nach Kategorie
│   ├── 01_props/
│   ├── 02_ambience_wind/
│   ├── 03_breath/
│   ├── 04_footsteps/
│   ├── 05_metal_doors/
│   ├── 06_writing/
│   └── 07_crowd/
└── .audio_review.json         # Ungeeignete Audio-Verfolgung

💡 Hinweis: Der voices/-Ordner enthĂ€lt Unterordner pro Charakter. Der sfx/-Ordner enthĂ€lt kategoriebasierte Unterordner.

đŸŽ™ïž TTS (Dialogstimme) Manuell

Charakterspezifische Dialogaudio, generiert ĂŒber Text-to-Speech-APIs.

Generierungs-API: Typecast

API: https://api.typecast.ai/v1/text-to-speech

Dateibenennungskonvention

{charakter}_{nummer}_{MMSS}.mp3

Beispiele:
  narrator/narrator_001_0000.mp3    # ErzÀhler, Zeile 1, bei 00:00
  scholar/scholar_003_0245.mp3      # Gelehrter, Zeile 3, bei 02:45

Der Timecode (MMSS) ermöglicht die automatische Zuordnung zu SRT-Untertitel-Zeitstempeln.

Emotionsparameter

Es sind dieselben Werte, die auch die App verwendet (normal / happy / sad / angry). Details unter Wie Emotion angewendet wird.

🔊 SFX (Soundeffekte) Manuell

UmgebungsgerÀusche, Foley und Effekte, generiert durch KI-Soundgenerierung.

Generierungs-API: ElevenLabs

API: https://api.elevenlabs.io/v1/sound-generation

7 SFX-Kategorien

🧼
Requisiten
01_props/ — Objektinteraktionen, Klicks
🌿
Umgebung
02_ambience_*/ — Wind, Regen, Vögel
💹
Atmung
03_breath/ — Atmen, Seufzen
👣
Schritte
04_footsteps/ — Gehen, Laufen
đŸšȘ
Metall / TĂŒren
05_metal_doors/ — TĂŒren, Schlösser, Aufprall
✍
Schreiben
06_writing/ — Pinsel, StiftgerĂ€usche
đŸ‘„
Menschenmenge
07_crowd/ — Gemurmel, Geplauder

Dateibenennung

{kategorie}/{beschreibender_name}.mp3

Timecode-SFX (synchronisiert mit bestimmter Szene):
  abacus_beads_dark_01_0015.mp3   # fĂŒr Szene 00:15
  abacus_beads_01_0134.mp3        # fĂŒr Szene 01:34

Timecode-Dateinamen (enden auf _MMSS) werden automatisch den entsprechenden Szenen zugeordnet.

🔍 Audio-Review-System Manuell

Markieren Sie ungeeignete Audiodateien ĂŒber die App-OberflĂ€che oder Claude Code MCP-Tools. Markierte Dateien werden in .audio_review.json verfolgt.

.audio_review.json Struktur

{
  "media/sfx/02_ambience_wind/wind_howl_01.mp3": {
    "status": "flagged",
    "reason": "Kein Timecode",
    "flaggedAt": "2026-03-16T05:44:55.228Z"
  }
}

MCP-Tools

list_audio_reviews — Markierte Audiodateien anzeigen
update_audio_review — Markierungen hinzufĂŒgen oder entfernen