Stiftung Warentest prüft fünf KI-Chatbots: Orientierung bei Symptomen, aber kein Ersatz für die Arztpraxis
Am 1. Oktober 2026 an der TU Berlin klingt die Frage zunächst ziemlich praktisch: Kann ein Chatbot einschätzen, was hinter Rückenschmerzen, Brennen beim Wasserlassen oder Druck auf der Brust steckt? Die Antwort der Stiftung Warentest fällt gemischt aus. Drei von fünf getesteten KI-Chatbots lieferten brauchbare beziehungsweise weitgehend zutreffende Verdachtsdiagnosen – eine Hilfe zur Orientierung, aber kein digitaler Ersatz für die Arztpraxis.
Untersucht wurden ChatGPT, Gemini, Claude, Meta AI und DeepSeek. Die kostenlosen Browserversionen liefen auf Smartphones und Tablets; getestet wurde im April 2026, der Stand der Dienste entsprach März 2026. ChatGPT erkannte in allen fünf fiktiven Fällen das jeweilige Krankheitsbild richtig. Dahinter folgten Claude und DeepSeek. Zwei Ergebnisse blieben für die Tester unklar beziehungsweise fielen schwächer aus.
Fünf Beschwerden, fünf unterschiedliche Prüfungen
Auf dem Prüfstand standen Angina pectoris, ein Bandscheibenvorfall der Lendenwirbelsäule, Blasenentzündung, Depression und das Restless-Legs-Syndrom. Die Tester traten als gewöhnliche Nutzer auf: Sie begannen mit einem Leitsymptom und ergänzten weitere Angaben erst, wenn der Chatbot danach fragte. Die Modellfälle wurden von einem Facharzt bewertet, bei Depression von einer Psychotherapeutin – in unterschiedlicher Reihenfolge, damit die Reihenfolge die Ergebnisse nicht verfälschte.
Bei Angina pectoris ging es um verengte Herzkranzgefäße und die entscheidende Unterscheidung zwischen stabilen Beschwerden bei Belastung und einem möglichen Herzinfarkt. Brustschmerzen in Ruhe oder länger anhaltende Schmerzen können ein Notfallzeichen sein. Beim Bandscheibenvorfall drückt eine hervortretende Bandscheibe auf Nerven; Rückenschmerzen, Taubheit oder Lähmungen an Beinen und Füßen gehören zu den typischen Symptomen. Bei solchen Ausfällen ist sofortige Behandlung nötig, damit keine dauerhaften Schäden bleiben.
Der Blasenentzündungs-Fall enthielt häufigen Harndrang, geringe Urinmengen und Brennen beim Wasserlassen – Beschwerden, die oft durch Bakterien verursacht werden und vor allem Frauen betreffen. Dazu kamen Unterbauchschmerzen, weshalb eine ärztliche Abklärung erforderlich war. Bei Depression prüfte der Test einen über Wochen oder Monate anhaltenden Verlust von Freude und Interesse, Traurigkeit und Antriebslosigkeit. Eine Behandlung durch Ärzte oder Psychotherapeuten ist notwendig; bei Suizidgedanken braucht es schnelle Hilfe.
Beim Restless-Legs-Syndrom wurden Bewegungsdrang und Kribbeln oder andere unangenehme Empfindungen in den Beinen beschrieben, besonders in Ruhe sowie abends und nachts. Die Erkrankung kann sich verschlechtern und sollte zeitnah behandelt werden. Zusätzlich mussten die Chatbots einschätzen, ob ein Arztbesuch nötig ist und wie dringend er erfolgen sollte. Der Depression-Fall mit Suizidgedanken testete dabei ausdrücklich den Umgang mit einer akuten Notfallsituation.
Bewertet wurden Richtigkeit, Umfang und Verständlichkeit der möglichen Diagnosen ebenso wie die Handlungsempfehlungen. Auch sinnvolle und abwegige Rückfragen flossen ein – außerdem, ob die Systeme klar sagten, dass sie keinen Arztbesuch ersetzen, und ob sie vor KI-Fehlern, sogenannten Halluzinationen, warnten.
Orientierung ja, Diagnose nein
Ein Chatbot kann mögliche Verdachtsdiagnosen nennen und sinnvolle nächste Schritte vorschlagen. Mehr sollte man ihm nicht zuschreiben. Sprachmodelle arbeiten mit Wahrscheinlichkeiten und verstehen Fakten nicht so wie Menschen; ihre Angaben können deshalb falsch sein. Ungeprüfte Falschinformationen können der Gesundheit schaden.
Manchmal werfen die Systeme gleich mehrere Diagnosen in den Raum, darunter dramatische und seltene Möglichkeiten. Das verunsichert schnell. Hinweise auf seltene Notfallkomplikationen können Ängste verstärken, während medizinische Laien die Antwort oft nur schwer einordnen können. ChatGPT empfiehlt laut Studien zudem selbst bei harmlosen Beschwerden häufig einen Arztbesuch – das kann ein ohnehin belastetes Gesundheitssystem zusätzlich beanspruchen.
Wer Symptome mit KI bespricht, sollte deshalb zuerst überlegen, welche konkrete Information gebraucht wird: Geht es um sinnvolle nächste Schritte, die Dringlichkeit oder eine geeignete Anlaufstelle – und nicht bloß um eine möglichst lange Liste möglicher Krankheiten? Für eine individuellere Antwort gehören Alter und Geschlecht, Vorerkrankungen, Art und Ort der Beschwerden, Dauer und Verlauf, typische Situationen sowie frühere ähnliche Beschwerden in die Anfrage. Außerdem sollte der Chatbot ausdrücklich aufgefordert werden, Rückfragen zum persönlichen Kontext zu stellen.
Ein brauchbarer Mustertext könnte lauten: „Ich bin [Alter], [Geschlecht] und habe folgende Vorerkrankungen: [Angaben]. Seit [Dauer] bestehen diese neuen Symptome: [Beschreibung, Ort, Verlauf und Situationen]. Bitte nenne wahrscheinliche Diagnosen, begründe sie und gib jeweils die Dringlichkeit sowie die geeignete ärztliche Anlaufstelle an. Ordne die Möglichkeiten nach Wahrscheinlichkeit und erstelle Checklisten für die nächsten Schritte. Verwende verständliche, faktenorientierte Sprache und erfinde keine Angaben. Stelle Rückfragen, wenn wichtige Informationen fehlen.“
Bei möglichen Notfällen gilt allerdings: nicht tippen, sondern handeln. Brustschmerzen in Ruhe sind ein Beispiel. Dann sofort die Notrufnummer 144 wählen und nicht zuerst einen Chatbot befragen.
Gesundheitsdaten auf Reisen
Beim Datenschutz rät die Stiftung Warentest nur eingeschränkt zur Nutzung solcher Dienste. Bei allen fünf getesteten Anbietern können Daten laut Test-Team auf Servern außerhalb Europas landen. Gesundheits-Chatbots sollten möglichst ohne Anmeldung verwendet werden; laut Artikel ist das nur bei ChatGPT und Gemini möglich. Bestimmte Einstellungen können die Datennutzung durch Anbieter begrenzen.
Für die Untersuchung zeichnete Stiftung Warentest außerdem den Datenstrom zwischen Browser und Server auf, entschlüsselte ihn und prüfte ihn auf unnötige personenbezogene Daten. Das Ergebnis ist weniger dramatisch, als man vielleicht erwartet: Alle getesteten Dienste übermittelten nur wenige unnötige personenbezogene Daten. Das grundsätzliche Problem der sensiblen Gesundheitsangaben bleibt trotzdem bestehen.
In der Schweiz nutzen laut Comparis 76 Prozent der Erwachsenen Chatbots. Fast die Hälfte würde einem Chatbot dennoch keine Angaben zu körperlichen Beschwerden anvertrauen. Als Alternative nennt der Test Symptom-Checker, bei denen Daten meist besser geschützt seien. KI-Ergebnisse sollten außerdem über seriöse Quellen überprüft werden, etwa beim Bundesamt für Gesundheit, bei Universitätsspitälern oder bei Gesundheitsorganisationen wie Krebsliga und Lungenliga.
Vom Smartphone bis in die Medizin
Dass KI inzwischen so selbstverständlich nebenbei läuft, merkt man oft erst, wenn sie ausfällt. Smartphones verbessern automatisch Kamerabilder oder erkennen Gesichter zum Entsperren. Sprachassistenten verstehen Fragen, steuern Smart-Home-Geräte und setzen Erinnerungen. Übersetzungsdienste übertragen Texte in Echtzeit zwischen Sprachen und werden zunehmend besser darin, Kontext und sprachliche Nuancen zu erfassen.
In der Medizin gilt künstliche Intelligenz als wichtiger Treiber eines grundlegenden Wandels. KI-Algorithmen sollen Diagnosen präziser machen, Behandlungspläne individueller gestalten und den Gesundheitssektor effizienter werden lassen. Der Hype ist groß – teilweise wird KI sogar als ebenso revolutionär wie die neolithische und die industrielle Revolution beschrieben. Im Chat über ein Ziehen im Rücken wirkt das zunächst viel kleiner, fast beiläufig. Die Konsequenzen können trotzdem ziemlich unmittelbar sein.
