Start / KI-Lexikon / Spracherkennung (Speech-to-Text)

Spracherkennung (Speech-to-Text)

Definition

KI-Technologie, die gesprochene Sprache in Text umwandelt.

Was Spracherkennung (Speech-to-Text) genau ist

Spracherkennung (auch Speech-to-Text oder STT) wandelt gesprochene Sprache automatisch in geschriebenen Text um. Moderne KI-basierte Spracherkennung erreicht eine Genauigkeit von über 95 %, auch bei Dialekten, Fachvokabular und Hintergrundgeräuschen. Open-Source-Modelle wie Whisper ermöglichen den lokalen, datenschutzkonformen Betrieb. Die Technologie beherrscht mittlerweile auch Sprechererkennung (wer spricht wann), Zeitstempel auf Wortebene und automatische Interpunktion. Mehrsprachige Modelle erkennen sogar Sprachwechsel innerhalb eines Gesprächs, etwa wenn ein Vertriebsmitarbeiter zwischen Deutsch und Englisch wechselt.

So funktioniert es

Spracherkennung wandelt Audiodaten zunächst in ein Spektrogramm um, das die Frequenzen und Lautstärke über die Zeit visualisiert. Darauf arbeitet ein neuronales Netz, typischerweise auf Transformer-Basis, das gelernt hat, akustische Muster in Wörter und Sätze zu übersetzen. Moderne Modelle nutzen dabei einen Encoder, der den Ton analysiert, und einen Decoder, der daraus Text erzeugt. Durch Training auf tausenden Stunden Audiomaterial lernt das Modell verschiedene Stimmen, Akzente und Hintergrundgeräusche zu unterscheiden. Kontextuelle Sprachmodelle verbessern zusätzlich die Wortwahl bei mehrdeutigen Lauten.

Was das für dein Unternehmen bedeutet

Spracherkennung spart überall Zeit, wo gesprochen wird: Meeting-Protokolle automatisch erstellen, Telefonate transkribieren, Diktate digitalisieren, Sprachnotizen verschriftlichen. Für Branchen mit viel Kundenkontakt (Vertrieb, Support) oder Dokumentationspflicht (Medizin, Recht) ist sie besonders wertvoll. Ein Vertriebsteam mit 20 Kundengesprächen pro Tag gewinnt durch automatische Transkription mehrere Stunden pro Woche zurück. Die transkribierten Texte können anschließend von weiterer KI analysiert werden, etwa zur Sentimentanalyse oder automatischen CRM-Aktualisierung.

Beispiele aus der Praxis

  • Automatische Meeting-Protokolle mit Sprecherzuordnung
  • Diktiergerät-Ersatz für Ärzte und Anwälte
  • Transkription von Kundenservice-Telefonaten zur Qualitätssicherung
  • Sprachgesteuerte Dateneingabe im Lager oder in der Produktion (Freihändig-Arbeit)
  • Automatische Untertitelung von internen Schulungsvideos

Vorteile und Grenzen

Das spricht dafür

  • Über 95 % Genauigkeit bei modernen Modellen, auch bei Dialekten
  • Massive Zeitersparnis bei Dokumentation und Protokollierung
  • Lokaler Betrieb mit Open-Source-Modellen wie Whisper garantiert Datenschutz
  • Sprechererkennung ermöglicht automatische Zuordnung wer was gesagt hat
  • Echtzeit-Transkription für Live-Untertitel und Barrierefreiheit

Das solltest du einplanen

  • Starke Hintergrundgeräusche und Überlappung mehrerer Sprecher reduzieren die Genauigkeit
  • Fachvokabular und Eigennamen erfordern oft Nachbearbeitung oder Wörterbücher
  • Lokale Modelle brauchen leistungsfähige Hardware (GPU empfohlen)
  • Datenschutzrisiko bei Cloud-Diensten, da Audiodaten besonders sensibel sind

Quellen

Häufige Fragen zu Spracherkennung (Speech-to-Text).

Deine Frage fehlt? Schreib uns, wir antworten innerhalb eines Werktags.

Wie gut funktioniert Spracherkennung auf Deutsch?

Sehr gut. Modelle wie Whisper Large unterstützen Deutsch mit über 95 % Genauigkeit. Auch Schweizerdeutsch und österreichisches Deutsch werden zunehmend besser erkannt, wobei starke Dialekte die Genauigkeit um 5-10 % reduzieren können.

Kann ich Spracherkennung lokal betreiben, ohne Daten in die Cloud zu senden?

Ja, Open-Source-Modelle wie OpenAI Whisper oder Faster-Whisper laufen vollständig lokal. Für Echtzeit-Transkription empfiehlt sich eine GPU, für Batch-Verarbeitung reicht auch eine moderne CPU. Damit bleiben alle Audiodaten im Unternehmen.

Was kostet Spracherkennung pro Stunde Audio?

Cloud-Dienste wie Google Speech-to-Text kosten ca. 1-2 Euro pro Stunde Audio. Lokale Lösungen verursachen nur Strom- und Hardwarekosten. Bei hohem Volumen (z. B. 100+ Stunden pro Monat) ist die lokale Variante deutlich günstiger.

Kann die KI erkennen, wer spricht?

Ja, diese Funktion nennt sich Speaker Diarization. Moderne Systeme erkennen automatisch Sprecherwechsel und ordnen Textabschnitte den einzelnen Sprechern zu. Die Zuordnung zu benannten Personen erfordert entweder Stimmprofile oder manuelle Nachbenennung.

Wie integriere ich Spracherkennung in bestehende Workflows?

Die meisten Lösungen bieten APIs, über die du Audio-Dateien einreichst und Text zurückbekommst. Für automatisierte Workflows kannst du dies mit Tools wie n8n oder Make.com verbinden. Viele Meeting-Tools wie Microsoft Teams bieten integrierte Transkription bereits eingebaut.

Wie relevant ist Spracherkennung (Speech-to-Text) für dich?

Im KI-Ready-Check schauen wir gemeinsam auf deine Abläufe und finden heraus, wo KI bei dir wirklich Zeit spart. 45 Minuten, kostenlos, ohne Folien.