Vier Sprachmodelle, dieselbe Wissensbasis
Auf dieser Seite stehen vier Chatbots direkt im Vergleich. Alle vier beantworten Fragen ausschließlich auf Grundlage der Inhalte dieser Website. Sie nutzen dieselbe Software und denselben Ablauf: Die Frage wird analysiert, relevante Inhalte werden im Index gesucht und anschließend vom Sprachmodell zu einer Antwort verarbeitet. Dieses Verfahren nennt sich Retrieval-Augmented Generation – kurz RAG.
Unterschiedlich sind im Kern das Sprachmodell und – sofern der jeweilige Anbieter ein eigenes Embedding-Modell anbietet – auch das Embedding-Modell. Mistral, Claude, GPT und Gemini – vier Anbieter, ein Wissensstand.
Warum sich das überhaupt vergleichen lässt
RAG trennt Wissen und Modell. Das Wissen liegt in einer eigenen Vektordatenbank und stammt aus den eigenen Dokumenten. Das Sprachmodell verarbeitet die gefundenen Informationen und formuliert daraus die Antwort. Damit wird das Sprachmodell zu einer austauschbaren Komponente: Es lässt sich wechseln, ohne die Wissensbasis neu aufbauen zu müssen. Genau das steht hier viermal untereinander.
Das Sprachmodell ist austauschbar
Die Software hinter allen vier Chatbots ist dAi Pro; wie Anfragen verarbeitet und protokolliert werden, steht unter DSGVO-konforme KI und im Hinweisfenster („?“) jedes Chatbots.
dAi Pro ist nicht an einen bestimmten KI-Anbieter gebunden. Je nach Anforderung können unterschiedliche Sprach- und Embedding-Modelle eingesetzt werden – etwa mit Fokus auf Antwortqualität, Geschwindigkeit, Kosten oder europäische Datenverarbeitung.
Wissensbasis und Anwendung bleiben davon unberührt. Unternehmen können das verwendete Modell wechseln, ohne ihre Inhalte oder ihre RAG-Anwendung neu aufbauen zu müssen.
Worauf Sie beim Vergleich achten können
Stellen Sie allen vier Chatbots nacheinander dieselbe Frage. Vergleichen Sie dabei weniger die zugrunde liegenden Fakten – diese stammen aus denselben Quellen – als vielmehr die Art, wie das jeweilige Modell daraus eine Antwort erzeugt:
- Länge und Aufbau. Antwortet das Modell knapp und direkt oder ausführlich und strukturiert?
- Umgang mit Wissenslücken. Was passiert, wenn die Wissensbasis keine ausreichende Antwort enthält? Wird das transparent kommuniziert oder ergänzt das Modell Informationen aus eigenem Wissen?
- Quellenangaben. Welche Belege werden genannt, und tragen sie die Aussage?
- Tempo. Die Antwortzeiten unterscheiden sich deutlich.
Einordnung
Dieser Vergleich ist kein wissenschaftlicher Benchmark, sondern eine praxisnahe Momentaufnahme auf Basis einer überschaubaren Wissensbasis.
Dabei gibt es einen wichtigen technischen Unterschied zwischen den vier Konfigurationen: Jede der vier Konfigurationen besitzt einen eigenen Vektorindex. Wenn ein Anbieter ein eigenes Embedding-Modell bereitstellt, wird dieses auch für den jeweiligen Index verwendet. Dadurch können sich bereits die gefundenen Textstellen leicht unterscheiden – noch bevor das Sprachmodell die eigentliche Antwort formuliert. Modelle, Preise und Antwortverhalten ändern sich zudem laufend. Belastbar wird ein Vergleich erst mit den eigenen Dokumenten und den eigenen Fragen.
Kosten
Neben Antwortqualität und Datenschutz entscheidet bei einer RAG-Anwendung ein dritter Faktor über den laufenden Betrieb: der Preis je Token. Zwischen den vier Anbietern liegen dabei nicht Prozente, sondern Größenordnungen.
Abgerechnet wird nach Token – grob gesagt Wortbausteine. Als Input zählt alles, was hineingeht: die Frage und die dazu gefundenen Textstellen. Output ist die erzeugte Antwort. Die Preise gelten je 1 Million Token, in Euro, Stand August 2026.
- Input – Frage und Textstellen
- Output – Antwort
Mistral Large 3
0,44 €
1,30 €
Gemini 3.6 FlashEinführungspreis bis 31.12.
0,64 €
3,21 €
Claude Opus 5
4,28 €
21,41 €
GPT-5.5
4,28 €
25,69 €
- Zwischen dem günstigsten und dem teuersten Modell liegt Faktor 10 bis 20. Ein Input-Token kostet bei GPT-5.5 rund zehnmal so viel wie bei Mistral Large 3, ein Output-Token rund zwanzigmal.
- Das günstigste Modell im Vergleich ist das europäische. Mistral Large 3 liegt noch unter Gemini 3.6 Flash – und das ist ausdrücklich auf Tempo und niedrige Kosten ausgelegt. Wer seine Wissensbasis mit Mistral betreibt, bleibt also nicht nur beim Datenschutz in der EU, sondern fährt auch wirtschaftlich günstiger.
- Antworten kosten mehr als Fragen. Output-Token sind bei allen vier Anbietern drei- bis sechsmal so teuer wie Input-Token. In einer RAG-Anwendung fallen dafür deutlich mehr Input-Token an, weil zu jeder Frage die gefundenen Textstellen mitgehen.
- Ein Preis mit Verfallsdatum. Gemini 3.6 Flash läuft bis zum 31.12.2026 zu Einführungspreisen. Danach kostet die Antwort regulär 6,41 € statt 3,21 € je Million Token – rund das Fünffache von Mistral Large 3.
- Der Listenpreis ist nicht der Endpreis. Stapelverarbeitung halbiert die Kosten, und für wiederkehrende Prompt-Anteile senkt Caching den Input-Preis je nach Anbieter um bis zu 90 Prozent. Bei RAG fällt das besonders ins Gewicht, weil zu jeder Frage derselbe Systemprompt mitgeht.
Quelle: öffentliche API-Preislisten von Mistral, Google, Anthropic und OpenAI, abgerufen im August 2026. Umrechnung USD → EUR zum Referenzkurs der EZB vom 21. August 2026 (1 USD ≈ 0,856 €). Tokenpreise ändern sich laufend – und sie sind nur die halbe Rechnung: Entscheidend sind die Kosten je beantworteter Frage, denn die Modelle brauchen für dieselbe Antwort unterschiedlich viele Token.
Mistral Large 3Mistral AI, Paris
Mistral Large 3 ist das standardmäßig auf dieser Website eingesetzte Sprachmodell und das leistungsfähigste allgemeine Modell des französischen Anbieters. Sowohl Embeddings als auch die Verarbeitung der Antworten können damit innerhalb der EU erfolgen – insbesondere für Behörden und regulierte Branchen kann das ein entscheidendes Kriterium sein. Wer die anderen drei Chatbots zum Vergleich heranzieht, sieht hier, was europäische Modelle inzwischen leisten.
Claude Opus 5Anthropic, San Francisco
Claude Opus ist Anthropics leistungsstarkes Modell für anspruchsvolle Aufgaben. In der Praxis antwortet es ausführlich und strukturiert und benennt Unsicherheiten. Eine Besonderheit dieser Konfiguration: Anthropic bietet kein eigenes Embedding-Modell an. Der Index wird deshalb mit Mistral-Embeddings gebaut. Die Trefferauswahl kommt hier also von Mistral, formuliert wird mit Claude.
GPT-5.5OpenAI, San Francisco
Das Modell, das die meisten schon aus ChatGPT kennen – und damit der Maßstab, den viele ohnehin im Kopf haben. GPT verwendet nicht sein allgemeines Wissen, sondern die von dAi Pro bereitgestellte Wissensbasis und darf nur daraus schöpfen. Sprach- und Embedding-Modell stammen beide von OpenAI: Verglichen wird hier also der gesamte Stack eines Anbieters, nicht nur das antwortende Modell.
Gemini 3.6 FlashGoogle, Mountain View
Googles Variante aus der Gemini-Reihe, auf Tempo und niedrige Kosten zugeschnitten. Daran lässt sich die für RAG entscheidende Frage prüfen: Wie leistungsfähig muss das Sprachmodell überhaupt noch sein, wenn die Trefferauswahl die passenden Textstellen bereits herausgesucht hat? Stellen Sie dieselbe Frage hier und weiter oben – der Unterschied, den Sie sehen, ist der Beitrag des Modells.