RAG-Vergleich: Vier Sprachmodelle, dieselbe Wissensbasis
Auf dieser Seite stehen vier Chatbots direkt im Vergleich: Mistral, Claude, GPT und Gemini beantworten Fragen ausschließlich auf Grundlage der Inhalte dieser Website. Alle vier laufen mit derselben Software – dAI Pro von Dreistein – und demselben Ablauf: Die Frage wird analysiert, relevante Inhalte werden im Index gesucht und anschließend vom Sprachmodell zu einer Antwort verarbeitet. Dieses Verfahren nennt sich Retrieval-Augmented Generation – kurz RAG.
Direkt zu: Kosten Antwortzeiten Mistral Claude GPT Gemini
Unterschiedlich sind im Kern das Sprachmodell und – sofern der jeweilige Anbieter ein eigenes Embedding-Modell anbietet – auch das Embedding-Modell. Mistral, Claude, GPT und Gemini – vier Anbieter, ein Wissensstand.
Warum sich das überhaupt vergleichen lässt
RAG trennt Wissen und Modell. Das Wissen liegt in einer eigenen Vektordatenbank und stammt aus den eigenen Dokumenten. Das Sprachmodell verarbeitet die gefundenen Informationen und formuliert daraus die Antwort. Damit wird das Sprachmodell zu einer austauschbaren Komponente: Es lässt sich wechseln, ohne die Wissensbasis neu aufbauen zu müssen. Genau das steht hier viermal untereinander.
Das Sprachmodell ist austauschbar
Die Software hinter allen vier Chatbots ist dAI Pro; wie Anfragen verarbeitet und protokolliert werden, steht unter DSGVO-konforme KI und im Hinweisfenster („?“) jedes Chatbots.
dAI Pro ist nicht an einen bestimmten KI-Anbieter gebunden. Je nach Anforderung können unterschiedliche Sprach- und Embedding-Modelle eingesetzt werden – etwa mit Fokus auf Antwortqualität, Geschwindigkeit, Kosten oder europäische Datenverarbeitung.
Wissensbasis und Anwendung bleiben davon unberührt. Unternehmen können das verwendete Modell wechseln, ohne ihre Inhalte oder ihre RAG-Anwendung neu aufbauen zu müssen.
Worauf Sie beim Vergleich achten können
Stellen Sie allen vier Chatbots nacheinander dieselbe Frage. Vergleichen Sie dabei weniger die zugrunde liegenden Fakten – diese stammen aus denselben Quellen – als vielmehr die Art, wie das jeweilige Modell daraus eine Antwort erzeugt:
- Länge und Aufbau. Antwortet das Modell knapp und direkt oder ausführlich und strukturiert?
- Umgang mit Wissenslücken. Was passiert, wenn die Wissensbasis keine ausreichende Antwort enthält? Wird das transparent kommuniziert oder ergänzt das Modell Informationen aus eigenem Wissen?
- Quellenangaben. Welche Belege werden genannt, und tragen sie die Aussage?
- Tempo. Die Antwortzeiten unterscheiden sich deutlich.
Einordnung
Dieser Vergleich ist kein wissenschaftlicher Benchmark, sondern eine praxisnahe Momentaufnahme auf Basis einer überschaubaren Wissensbasis.
Dabei gibt es einen wichtigen technischen Unterschied zwischen den vier Konfigurationen: Jede der vier Konfigurationen besitzt einen eigenen Vektorindex. Wenn ein Anbieter ein eigenes Embedding-Modell bereitstellt, wird dieses auch für den jeweiligen Index verwendet. Dadurch können sich bereits die gefundenen Textstellen leicht unterscheiden – noch bevor das Sprachmodell die eigentliche Antwort formuliert. Modelle, Preise und Antwortverhalten ändern sich zudem laufend. Belastbar wird ein Vergleich erst mit den eigenen Dokumenten und den eigenen Fragen.
Kosten
Neben Antwortqualität und Datenschutz entscheidet bei einer RAG-Anwendung ein dritter Faktor über den laufenden Betrieb: der Preis je Token. Zwischen den vier Anbietern liegen dabei nicht Prozente, sondern ein Vielfaches.
Abgerechnet wird nach Token – grob gesagt Wortbausteine. Als Input zählt alles, was hineingeht: die Frage und die dazu gefundenen Textstellen. Output ist die erzeugte Antwort. Die Preise gelten je 1 Million Token, in Euro, Stand September 2026.
- Input – Frage und Textstellen
- Output – Antwort
Mistral Large 3
0,44 €
1,32 €
Gemini 3.8 FlashEinführungspreis bis 31.12.
0,66 €
3,29 €
GPT-6 Sol
1,75 €
8,77 €
Claude Opus 5.5
3,51 €
17,54 €
- Zwischen dem günstigsten und dem teuersten Modell liegt Faktor 8 bis 13. Ein Input-Token kostet bei Claude Opus 5.5 achtmal so viel wie bei Mistral Large 3, ein Output-Token rund dreizehnmal.
- Das günstigste Modell im Vergleich ist das europäische. Mistral Large 3 liegt noch unter Gemini 3.8 Flash – und das ist ausdrücklich auf Tempo und niedrige Kosten ausgelegt. Wer seine Wissensbasis mit Mistral betreibt, bleibt also nicht nur beim Datenschutz in der EU, sondern fährt auch wirtschaftlich günstiger.
- Die neue Generation ist günstiger. Claude Opus 5.5 kostet ein Fünftel weniger als sein Vorgänger Opus 5, GPT-6 Sol beim Input 60 Prozent und beim Output zwei Drittel weniger als GPT-5.5. Nach Listenpreis kostet GPT-6 Sol damit nur noch halb so viel wie Claude Opus 5.5.
- Antworten kosten mehr als Fragen. Output-Token sind bei allen vier Anbietern drei- bis fünfmal so teuer wie Input-Token. In einer RAG-Anwendung fallen dafür deutlich mehr Input-Token an, weil zu jeder Frage die gefundenen Textstellen mitgehen.
- Ein Preis mit Verfallsdatum. Gemini 3.8 Flash läuft bis zum 31.12.2026 zu Einführungspreisen. Danach kostet die Antwort regulär 6,58 € statt 3,29 € je Million Token – rund das Fünffache von Mistral Large 3.
- Der Listenpreis ist nicht der Endpreis. Stapelverarbeitung halbiert die Kosten, und für wiederkehrende Prompt-Anteile senkt Caching den Input-Preis je nach Anbieter um bis zu 90 Prozent. Bei RAG fällt das besonders ins Gewicht, weil zu jeder Frage derselbe Systemprompt mitgeht.
Quelle: öffentliche API-Preislisten von Mistral, Google, Anthropic und OpenAI, abgerufen im September 2026. Umrechnung USD → EUR zum Referenzkurs der EZB vom 25. September 2026 (1 USD ≈ 0,877 €). Tokenpreise ändern sich laufend – und sie sind nur die halbe Rechnung: Entscheidend sind die Kosten je beantworteter Frage, denn die Modelle brauchen für dieselbe Antwort unterschiedlich viele Token.
Wie schnell antworten die vier?
Gemessen wird die Zeit vom Absenden der Anfrage beim Anbieter bis zum ersten Zeichen der Antwort. Was diese Website vorher selbst tut — die Suche in der Wissensbasis — steckt nicht darin; dieser Teil läuft bei allen vier gleich. Und gewertet werden ausschließlich Fragen, die allen vier Chatbots wortgleich und unter denselben Bedingungen gestellt wurden. Alles andere wäre kein Vergleich, sondern eine Zufallsstichprobe.
Die Werte sind Durchschnitte aus dem laufenden Betrieb. Stellen Sie allen vier dieselbe Frage — wenige Sekunden später ist Ihre eigene Messung hier enthalten.
- Zeit bis zum ersten Zeichen
Mistral Large 3mistral-large-latest
1,9 s
GPT-6 Solgpt-6-sol
4,7 s
Gemini 3.8 Flashgemini-3.8-flash
7,3 s
Claude Opus 5.5claude-opus-5-5
13,8 s
Wie belastbar ist das? Es sind Messungen aus dem echten Betrieb, kein Labortest — und sie schwanken erheblich. Einfluss haben unter anderem: die Auslastung beim Anbieter und Warteschlangen zu Stoßzeiten; die Tageszeit, weil die drei US-Anbieter am europäischen Nachmittag zusätzlich von Nordamerika genutzt werden; die Netzstrecke, denn Mistral antwortet aus der EU und die anderen drei von jenseits des Atlantiks; Routing, Peering und Paketverluste unterwegs; die Länge der Frage samt der mitgeschickten Textstellen; ob beim Anbieter ein Prompt-Cache greift; Rate-Limits und Wiederholungsversuche nach Fehlern; und schlicht die Tagesform der Rechenzentren. Ein einzelner Ausreißer verschiebt den Durchschnitt daher spürbar. Was die Zahl nicht misst: wie lang oder wie gut die Antwort wird — nur, wie lange es dauert, bis das Modell zu sprechen beginnt.
Mistral Large 3
Mistral AI, ParisMistral Large 3 ist das standardmäßig auf dieser Website eingesetzte Sprachmodell und das offene Flaggschiff des französischen Anbieters. Sowohl Embeddings als auch die Verarbeitung der Antworten können damit innerhalb der EU erfolgen – insbesondere für Behörden und regulierte Branchen kann das ein entscheidendes Kriterium sein. Wer die anderen drei Chatbots zum Vergleich heranzieht, sieht hier, was europäische Modelle inzwischen leisten.
Claude Opus 5.5
Anthropic, San FranciscoClaude Opus 5.5 ist die aktuelle Opus-Generation von Anthropic für anspruchsvolle Aufgaben – und günstiger als der Vorgänger. Das Modell denkt vor jeder Antwort nach; in der Praxis antworten Opus-Modelle ausführlich und strukturiert und benennen Unsicherheiten. Eine Besonderheit dieser Konfiguration: Anthropic bietet kein eigenes Embedding-Modell an. Der Index wird deshalb mit Mistral-Embeddings gebaut. Die Trefferauswahl kommt hier also von Mistral, formuliert wird mit Claude.
GPT-6 Sol
OpenAI, San FranciscoGPT-6 Sol ist das Arbeitspferd der neuen GPT-6-Generation – zwischen dem Spitzenmodell Astra und dem Sparmodell Luna – aus der Modellfamilie, die die meisten schon aus ChatGPT kennen. Damit ist es der Maßstab, den viele ohnehin im Kopf haben. GPT verwendet nicht sein allgemeines Wissen, sondern die von dAI Pro bereitgestellte Wissensbasis und darf nur daraus schöpfen. Das Embedding-Modell stammt von OpenAI: Verglichen wird hier also der gesamte Stack eines Anbieters, nicht nur das antwortende Modell.
Gemini 3.8 Flash
Google, Mountain ViewGoogles Variante aus der Gemini-Reihe, auf Tempo und niedrige Kosten zugeschnitten. Daran lässt sich die für RAG entscheidende Frage prüfen: Wie leistungsfähig muss das Sprachmodell überhaupt noch sein, wenn die Trefferauswahl die passenden Textstellen bereits herausgesucht hat? Stellen Sie dieselbe Frage hier und weiter oben – der Unterschied, den Sie sehen, ist der Beitrag des Modells.