Handbuch · Kapitel 11 · Teil C Kanäle

Sprach-Chat

Wozu

Mit dem Sprach-Chat sprechen Besucher mit dem Assistenten, statt zu tippen: Mikrofon drücken, Frage sprechen, Antwort hören und lesen. Das hilft auf dem Smartphone, unterwegs, in der Werkstatt und allen, denen Tippen schwerfällt. Die Antworten kommen aus demselben Wissen wie im Text-Chat, mit denselben Regeln.

Was Besucher sehen und hören

  • Ein Mikrofon-Knopf neben dem Eingabefeld, sobald der Sprach-Chat für die Sammlung eingeschaltet ist und die Einbettung ihn nicht ausblendet.
  • Beim Sprechen erscheint das Transkript live im Eingabefeld. Eine kurze Pause beendet die Aufnahme und schickt die Frage ab.
  • Die Antwort wird vorgelesen und gleichzeitig als Text angezeigt, mit Quellen wie im Text-Chat. Ein Tipp auf den Stopp-Knopf unterbricht.
  • Jede Antwort hat einen Lautsprecher-Knopf, der sie auch später vorliest.
  • Der Hilfetext im Chat nennt, an welchen Anbieter die Aufnahme geht.

Wo

Öffnen Sie Bearbeiten → Sprach-Chat in den Einstellungen der Sammlung.

Abschnitt „Sprach-Chat“ in den Einstellungen der Sammlung
FeldBedeutung
Sprach-Chat anbietenSchaltet den Mikrofon-Knopf frei. Er erscheint nur, wenn die Instanz den Sprachdienst eingerichtet hat (Kapitel 26) und der gewählte Anbieter Audio kann.
Audio-AnbieterSpracherkennung und Stimme brauchen Audio-Modelle. „Wie Chat-LLM“ nutzt den Anbieter der Sammlung, wenn er Audio kann (Mistral, OpenAI). Mit einem eigenen Audio-Anbieter funktioniert der Sprach-Chat auch, wenn der Chat mit Anthropic oder Gemini antwortet.
Spracherkennung (STT)Die Erkennung darf ein anderer Anbieter übernehmen als die Stimme. Gladia hält die Gesprächssprache fest und nutzt das Vokabular der Sammlung als Erkennungshilfe.
Sprechtempo1,00 = Normaltempo. Je weitere Sprache ein eigener Regler.
Voice-VokabularEin Begriff je Zeile: Marken- und Produktnamen werden im Transkript erkannt und korrigiert. falsch => richtig verdrahtet bekannte Verhörer. Je Sprache eine eigene Liste, leer = Liste der Primärsprache.
TTS-StimmeDie Liste kommt live vom Anbieter; auch selbst geklonte Stimmen erscheinen.

Stimme und Tempo erscheinen erst, nachdem ein sprechfähiger Audio-Anbieter gewählt und gespeichert ist.

Datenschutz

Die Aufnahme geht zur Erkennung an den gewählten Anbieter, die Antwort wird dort in Sprache umgewandelt. Der Hilfetext im Chat nennt den Anbieter und seine Region; die Verarbeitungsregion der Sammlung (Kapitel 20) prüft auch die Audio-Anbieter. Aufnahmen werden nicht gespeichert.

Häufige Fragen

Der Mikrofon-Knopf fehlt. Drei mögliche Gründe: Der Sprach-Chat ist in der Sammlung aus; die Einbettung blendet „Mikrofon“ unter „Funktionen“ aus; der Sprachdienst der Instanz läuft nicht.

Die Stimme spricht Deutsch mit Akzent. Nicht jeder Anbieter hat eine deutsche Stimme; einige sprechen Deutsch mit englischer Färbung. Probieren Sie die Stimmen der Liste, oder wählen Sie einen anderen Audio-Anbieter.

Der Chat versteht unseren Produktnamen nicht. Tragen Sie ihn ins Voice-Vokabular ein, mit der Schreibweise, die im Transkript ankommt: Produktname falsch => Produktname richtig.

Siehe auch