Skip to main content
Die Stimme prägt, wie Anrufer das Gespräch wahrnehmen — Akzent, Tempo und Ausdruck sollten zur Aufgabe passen. Im Tab Voice legen Sie TTS-Anbieter, Modell und Voice-ID fest, die Sprechgeschwindigkeit und den Umgang mit Hintergrundgeräuschen.

TTS-Anbieter

Beim Wechsel des Anbieters werden Voice model und Voice ID zurückgesetzt.

Stimmenmodell und Stimme

Nach dem Anbieter Voice model und Voice wählen; Filter nach Sprache möglich. Cartesia und ElevenLabs bieten die größten Kataloge.
Kurz in der Vorschau anhören — im echten Gespräch wirken Stimmen oft anders als isoliert.

Emotion (nur Cartesia)

Bei Cartesia erscheint Voice emotion — Feintuning der Ausdrucksweise:
Emotion nur bei Cartesia als TTS-Anbieter.

Sprechgeschwindigkeit

Speed von 0,5× bis 2,0×. Über 1,5× oft schwer verständlich; 0,9–1,1× sind für viele Szenarien angenehm.

Hintergrund-Ambiente

Background ambience — optionales Umgebungsgeräusch:
  • None
  • Office ambience
  • Keyboard typing / Keyboard typing 2
  • Hold music
Ambience volume (0–1) relativ zur Stimme. Zu laut = Assistent schlechter zu verstehen.

Thinking sound

Thinking sound — dezentes Geräusch während die KI antwortet generiert (zwischen Ende des Ansprechers und Antwort des Assistenten). Optionen z. B. Tippgeräusche oder keine.

Rauschunterdrückung

Noise cancellation für Audio vom Anrufer: Standard oft „bvc“ — empfohlen, um Nebensprechen zu reduzieren.
Ohne Rauschunterdrückung kann in lauter Umgebung Hintergrund als Sprache erkannt werden — unerwartete Antworten.