Forschungsfeld 01 · Stimme
Wie klingt eine Marke, wenn die KI spricht?
Kann eine KI eine Stimme glaubwürdig nachbilden, wenn nur wenige Sekunden Aufnahme vorliegen, oft in Telefonqualität, und das sogar im Dialekt?
Klassische Sprachsynthese braucht viele saubere Studioaufnahmen. Am Telefon gibt es die nicht: Die Aufnahmen sind kurz, der Klang ist komprimiert, es gibt Nebengeräusche und regionale Färbung. Dazu kommen weitere Fragen: Welche Sprache und welcher Dialekt passen zu einem Anruf? Und wie fügt sich die synthetische Stimme hörbar natürlich in Musik und Markenklang ein, schnell genug für den laufenden Anruf?
Woran wir gearbeitet haben
- Stimmen mit sehr wenig Referenzmaterial stabil nachbilden
- Sprache und Dialekt automatisch passend wählen
- Stimme und Jingle so mischen, dass Übergänge auch über Telefonleitungen natürlich klingen
- Alles so schnell machen, dass es in Echtzeit funktioniert
Die Ergebnisse stecken heute in TelefonSounds.ai, unseren KI-Telefonansagen mit Markenklang.


