Handbuch · Kapitel 5 · Teil B Wissen
Datenquellen
Wozu
Datenquellen bringen das Wissen in die Sammlung. Eine Sammlung kann beliebig viele haben, auch mehrere desselben Typs: die Website, ein Ordner mit Datenblättern, das Wissensportal, das Ticketsystem. Jede Datenquelle erscheint als eigener Reiter in der Sammlungsansicht und verwaltet ihre eigenen Dokumente.
Wo
Öffnen Sie in der Sammlungs-Schiene Datenquellen.

Die Reihenfolge der Datenquellen ist die Reihenfolge der Indexierung: Seiten, die eine frühere Datenquelle bereits erfasst hat, werden nicht erneut indexiert. Mit den Pfeilen ändern Sie die Reihenfolge.
Die Typen

| Typ | Wofür |
|---|---|
| Webseiten Indexierung | Sitemaps einlesen, Domains crawlen, einzelne Adressen indexieren. Der Normalfall für eine Website. |
| Dateien | Dateien hochladen: PDF, Text, Office, HTML. Für Datenblätter, Preislisten, Broschüren. |
| Internetlinks | Eine Liste einzelner Adressen, auch fremder Websites, etwa Herstellerseiten. |
| Eingabe | Wissen direkt als Titel und Text eintragen: Öffnungszeiten, Regeln, Antworten, die nirgends stehen. |
| Supportdatenbank | Geprüfte Antworten aus dem Support-Eingang. Sie haben keine öffentliche Seite; der Chat nennt sie als „unsere Supportdatenbank“ ohne Link (Kapitel 17). |
| CSV-Datei, Excel-Datei | Tabellen zeilenweise als Dokumente: Produktlisten, Ersatzteile, Standorte. |
| Ordner auslesen | Ein Ordner auf dem Server, rekursiv; jede Datei ein Dokument. |
| Datenbankabfrage | Eine SQL-Abfrage gegen eine externe Datenbank; jede Zeile ein Dokument. |
| Confluence, Notion | Seiten aus dem Wissensportal per API. |
| Zendesk, Freshdesk | Artikel des Help-Centers bzw. der Wissensdatenbank. |
| Nextcloud, SharePoint, Google Drive | Dateien aus einer Dateiablage, per WebDAV, Microsoft Graph oder OAuth. |
| E-Mail-Postfach | Nachrichten eines IMAP-Postfachs als Dokumente. |
Die Zugänge der angebundenen Dienste (Token, Passwörter) trägt in der Regel die Administration ein (Kapitel 27). Dieses Kapitel beschreibt den häufigsten Typ ausführlich; die übrigen folgen demselben Formular mit ihren eigenen Feldern.
Was nach dem Speichern passiert
Das Speichern legt nur die Datenquelle an. Die Inhalte kommen mit Indexierung starten in der Sammlungsansicht, und in den Index kommen sie mit Verarbeiten (Kapitel 6). Bei Datenquellen, die Dateien holen (Nextcloud, SharePoint, Google Drive, Ordner), heißt der erste Schritt „Synchronisieren“ und läuft ebenfalls über den Hintergrundprozess.
Häufige Fragen
Der Crawl findet nur die Startseite. Die Website baut ihre Navigation per JavaScript auf. Stellen Sie den Renderer auf Playwright, oder tragen Sie die Sitemap ein. Steht an der Auswahl „nicht eingerichtet“, fehlt der Render-Dienst — bis die Administration ihn einrichtet, hilft nur die Sitemap.
Manche Seiten sollen nicht in den Chat. Deaktivieren Sie die Dokumente nach dem Crawl (Kapitel 6) oder indexieren Sie mit „Seiten-Liste“ nur die gewünschten Adressen.
Die Website ist nur mit Anmeldung erreichbar. Nutzen Sie den Typ „Dateien“ oder „Ordner auslesen“, oder lassen Sie die Administration einen Zugang für den Crawler einrichten.
Ich habe die Datenquelle gelöscht, die Dokumente sind noch da. Dokumente gehören zur Datenquelle und verschwinden mit ihr. Prüfen Sie den richtigen Reiter in der Sammlungsansicht; „Aufräumen“ entfernt Reste.
Siehe auch
- Kapitel 6 · Dokumente
- Kapitel 17 · Support-Eingang (Supportdatenbank)
- Kapitel 27 · Härtung (Zugänge)