Zum Inhalt springen
sw
en

Tippe um zu suchen

KI-Grundlagen

Was KI kann – und was (noch) nicht

Wo aktuelle KI-Modelle wirklich stark sind, wo sie typisch scheitern (Rechnen, Zählen, Aktualität, exakte Fakten) und wie du realistische Erwartungen entwickelst.

9 Min Lesezeit Anfänger Zuletzt aktualisiert:

Warum diese Frage überhaupt wichtig ist

ChatGPT, Claude, Gemini und Copilot wirken oft erstaunlich kompetent – sie schreiben flüssige Texte, erklären komplexe Themen und liefern Code, der auf Anhieb läuft. Genau diese Kompetenz führt aber zu einem Denkfehler: Wer eine KI einmal bei einer schwierigen Aufgabe brillieren sieht, geht schnell davon aus, sie sei bei allem gleich gut. Das stimmt nicht. Ein Sprachmodell ist kein allwissendes Orakel, sondern ein Werkzeug mit einem sehr spezifischen Fähigkeitsprofil: In manchen Bereichen übertrifft es geübte Fachleute, in anderen scheitert es an Aufgaben, die ein Kind im Grundschulalter lösen würde.

Diese Seite gibt dir eine realistische Landkarte: Wo KI wirklich glänzt, wo sie typisch schwächelt – und wie du als Nutzerin oder Nutzer damit umgehst, statt dich böse überraschen zu lassen.

Wo KI wirklich glänzt

Fangen wir mit dem Positiven an, denn das ist der Grund, weshalb sich der Einsatz überhaupt lohnt.

Sprache verarbeiten und erzeugen. Texte umformulieren, zusammenfassen, übersetzen, im Ton anpassen (“schreib das freundlicher”) oder aus Stichworten einen vollständigen Entwurf bauen – das ist die Kerndisziplin eines Sprachmodells, und hier ist es meist ausgezeichnet.

Muster in grossen Textmengen erkennen. Ein langes PDF durchsuchen, die Kernaussagen aus zehn E-Mails destillieren, Code auf Stilbrüche prüfen – überall dort, wo es um Mustererkennung in Sprache oder Code geht, ist KI stark.

Ausgangspunkte und Entwürfe liefern. Ein erster Entwurf für eine Präsentation, ein Testfall-Gerüst für eine Funktion, drei Varianten eines Betreffs für ein Mailing – KI ist hervorragend darin, die “leere Seite” zu füllen, die du danach überarbeitest.

Erklären und Wissen zugänglich machen. Ein Konzept auf drei verschiedenen Schwierigkeitsstufen erklären, eine Fehlermeldung verständlich machen, eine Analogie zu einem trockenen Fachthema finden – hier profitierst du von der riesigen Menge an Trainingstext.

Code schreiben und debuggen. Boilerplate-Code, Standardfunktionen, Fehlersuche bei offensichtlichen Bugs, Übersetzung zwischen Programmiersprachen – ein grosser, gut dokumentierter Anwendungsbereich mit hoher Trefferquote.

Mit anderen Formaten arbeiten. Aktuelle Modelle verarbeiten neben Text auch Bilder, Audio und teils Video – ein Foto einer Fehlermeldung beschreiben, ein handschriftliches Diagramm interpretieren, ein Meeting transkribieren. Mehr dazu unter Multimodale KI.

Die typischen Schwächen im Detail

Exaktes Rechnen

Ein Sprachmodell rechnet nicht wie ein Taschenrechner, sondern sagt Ziffer für Ziffer das statistisch wahrscheinlichste nächste Zeichen voraus. Bei kleinen, häufig vorkommenden Rechnungen (2+2, 10 % von 200) klappt das fast immer, weil das Muster oft genug in den Trainingsdaten vorkam. Bei grösseren oder ungewöhnlichen Rechnungen (mehrstellige Multiplikationen, verschachtelte Prozentrechnungen, Finanzmodelle mit vielen Zwischenschritten) steigt die Fehlerquote spürbar – ganz ohne dass sich das am selbstsicheren Ton der Antwort bemerkbar macht.

Beispiel für eine Falle:
"Wie viel ist 47.892 × 3.187?"

Ein reines Sprachmodell ohne Rechenwerkzeug tendiert dazu,
eine plausibel aussehende, aber falsche Zahl zu produzieren –
mit derselben Selbstsicherheit wie bei einer richtigen Antwort.

Viele Chat-Werkzeuge (ChatGPT, Copilot, Gemini) lösen das inzwischen, indem sie bei Rechenaufgaben im Hintergrund automatisch einen echten Code-Interpreter aufrufen, der die Zahlen tatsächlich berechnet statt sie vorherzusagen (Stand: 2026-07). Das funktioniert gut, solange das Werkzeug diesen Umweg auch wirklich nimmt – bei einfachen Fragen (“was ist 15 % von 80”) verlässt sich mancher Assistent weiterhin auf reine Texterzeugung.

Zählen

Verwandt mit dem Rechenproblem: Zählen, wie oft ein Buchstabe in einem Wort vorkommt, wie viele Wörter ein Absatz hat oder wie viele Elemente eine Liste enthält, ist für ein Sprachmodell überraschend fehleranfällig. Der Grund liegt in der Tokenisierung: Ein Modell “sieht” Text nicht als einzelne Buchstaben, sondern als Bruchstücke (Tokens), die mehrere Zeichen umfassen können. Mehr zur Technik dahinter: Tokens & Kontextfenster.

Klassisches Beispiel:
"Wie viele Buchstaben 'r' hat das Wort 'Erdbeere'?"

Weil das Modell das Wort nicht zwingend Buchstabe für Buchstabe
verarbeitet, sondern in Tokens zerlegt, kann selbst diese simple
Zählaufgabe danebengehen – ein Fehler, den kein Mensch macht,
der langsam mitliest.

Neuere Modelle mit stärkeren Reasoning-Fähigkeiten schneiden bei genau diesem Beispiel inzwischen oft besser ab, weil sie Zwischenschritte explizit ausschreiben (Stand: 2026-07) – das grundsätzliche Muster bleibt aber: Aufgaben auf Zeichenebene sind für ein Modell, das in Wortbruchstücken denkt, strukturell unbequemer als Aufgaben auf Wort- oder Satzebene.

Aktualität

Jedes Modell hat einen Wissensstichtag: den Zeitpunkt, bis zu dem Trainingsdaten gesammelt wurden. Fragst du nach Ereignissen danach, ohne dass das Werkzeug aktiv das Web durchsucht, erhältst du entweder eine ehrliche Absage (“das liegt nach meinem Wissensstand”) oder – schlechter – eine plausibel klingende, aber erfundene Antwort. Websuch-Funktionen (in ChatGPT, Copilot, Gemini, Perplexity) mildern das Problem stark, lösen es aber nicht vollständig: Bei sehr frischen, lokalen oder wenig berichteten Ereignissen kann selbst eine Websuche noch lückenhaft oder widersprüchlich sein.

Exakte Fakten, Zitate und Quellen

Namen, Jahreszahlen, Gesetzesartikel, Zitate oder Studienergebnisse gehören zu den Bereichen, in denen Sprachmodelle am ehesten halluzinieren – also selbstbewusst Dinge erfinden, die falsch oder frei erfunden sind. Das liegt daran, dass ein Modell Text statistisch vervollständigt statt eine Datenbank abzufragen; bei seltenen, sehr spezifischen Details ist das Risiko einer plausibel klingenden Erfindung besonders hoch. Dieses Thema ist so wichtig, dass es einen eigenen Vertiefungsartikel verdient: Warum KI halluziniert.

Lange, mehrstufige Logikketten

Je mehr Zwischenschritte eine Aufgabe braucht – eine komplexe Termin-Logistik mit vielen Bedingungen, eine mehrstufige Steuerberechnung, ein Regelwerk mit vielen Ausnahmen –, desto mehr Gelegenheiten gibt es für kleine Fehler, die sich aufaddieren. Ein einzelner falscher Zwischenschritt reicht, um das Endergebnis zu kippen, ohne dass die Antwort dadurch weniger überzeugend klingt.

Gesunder Menschenverstand in echten Grenzfällen

KI erkennt gut bekannte Muster zuverlässig, tut sich aber schwerer mit Situationen, die leicht von der Norm abweichen – ein Sonderfall in einer Firmenrichtlinie, eine ungewöhnliche Kombination aus mehreren Regeln, eine Anfrage mit widersprüchlichen Angaben. Menschen erkennen solche Ausnahmen oft intuitiv, ein Modell tendiert eher dazu, das häufigste Muster anzuwenden, auch wenn es im Einzelfall nicht passt.

Übersicht: Kann KI gut vs. (noch) nicht zuverlässig

BereichKann KI gutKann KI (noch) nicht zuverlässig
TextUmformulieren, zusammenfassen, übersetzen, Ton anpassenFaktendichte, kurze Texte fehlerfrei ohne Prüfung
ZahlenGrössenordnungen einschätzen, einfache RechnungenExakte grosse Berechnungen ohne Rechenwerkzeug
ZählenGrobe SchätzungenExaktes Zählen auf Zeichenebene
WissenAllgemeinwissen bis zum Stichtag erklärenEreignisse nach dem Stichtag ohne Websuche
QuellenBekannte, oft zitierte Fakten wiedergebenSeltene Zitate, Gesetzesartikel, Studien im Detail
CodeBoilerplate, bekannte Muster, DebuggingSehr spezifische, undokumentierte APIs
LogikKurze, klare SchlussfolgerungenLange Ketten mit vielen Zwischenschritten
KreativesVarianten, Brainstorming, Ideenskizzen”Die eine richtige” Antwort bei Geschmacksfragen

Entscheidungshilfe: Wie viel Vertrauen ist angemessen?

Kann ich das Ergebnis selbst in unter einer Minute prüfen
(Text lesen, Code ausführen, Zahl überschlagen)?
  → Ja: KI-Antwort direkt nutzen, kurz gegenlesen
  → Nein: weiter

Geht es um Zahlen, Fakten, Zitate, Recht oder Gesundheit?
  → Nein: normale Sorgfalt reicht
  → Ja: weiter

Hat das Werkzeug eine Quelle mit echtem Link geliefert,
und du hast den Link tatsächlich geöffnet?
  → Ja, Inhalt stimmt überein: verwendbar
  → Nein oder Link zeigt etwas anderes: nicht ungeprüft übernehmen
YouTube
Künstliche Intelligenz: Was kann sie, wo müssen wir Grenzen ziehen?

Erwartungsmanagement im Alltag

Ein paar konkrete Gewohnheiten helfen, mit den Grenzen produktiv umzugehen, statt sich von ihnen überraschen zu lassen:

  • Aufgaben nach Prüfbarkeit wählen. Nutze KI zuerst für Aufgaben, deren Ergebnis du schnell selbst kontrollieren kannst – das baut Vertrauen auf, ohne Risiko einzugehen.
  • Bei Zahlen: nachrechnen oder Werkzeuge nutzen lassen. Bitte das Modell explizit, einen Taschenrechner oder Code-Interpreter zu verwenden, statt “im Kopf” zu rechnen – viele Werkzeuge bieten das inzwischen an.
  • Bei Aktualität: Stichtag und Websuche im Blick behalten. Frag im Zweifel direkt nach: “Hast du dafür das Web durchsucht, oder ist das dein Trainingsstand?”
  • Bei Fakten: Quellen verlangen und öffnen. Eine Quellenangabe ohne funktionierenden Link zählt nicht als Beleg. Vertiefung dazu: Faktencheck bei KI-Output.
  • Stand kennzeichnen, wenn du KI-Output weitergibst. Wenn du eine KI-gestützte Recherche in ein Dokument, eine Präsentation oder eine Kundenantwort übernimmst, vermerke kurz, wann und womit sie erstellt wurde (“Recherchestand: KI-gestützt, geprüft am …”). Das schafft Transparenz und schützt dich, falls sich Fakten später als überholt herausstellen.
  • Ein Scheitern ist kein Modellfehler, sondern ein Signal. Wenn eine KI bei einer bestimmten Aufgabenart wiederholt danebenliegt, ist das kein Zufall – es ist ein Hinweis, diese Aufgabenart künftig anders anzugehen (Werkzeug wechseln, Zwischenschritte einfordern, Ergebnis immer gegenprüfen).

Kurz zusammengefasst

  • KI glänzt bei Sprache, Mustererkennung, Entwürfen, Erklärungen und Code – überall dort, wo du das Ergebnis leicht selbst prüfen kannst.
  • Typische Schwächen: exaktes Rechnen und Zählen (wegen Tokenisierung), Aktualität (Wissensstichtag), exakte Fakten/Zitate (Halluzinationsrisiko) sowie lange, mehrstufige Logikketten.
  • Diese Grenzen sind meist strukturell bedingt, nicht einfach “Kinderkrankheiten” – sie verschieben sich mit neuen Modellgenerationen, verschwinden aber nicht grundsätzlich.
  • Faustregel: Je schwerer ein Ergebnis überprüfbar ist (Zahl, Zitat, Rechtsfrage), desto vorsichtiger solltest du sein.
  • Kennzeichne den Stand, wenn du KI-gestützte Ergebnisse weitergibst – das schützt dich und schafft Transparenz.

Weiterlernen

Videos

YouTube
Künstliche Intelligenz: Was kann sie, wo müssen wir Grenzen ziehen?

Kommentare

Frage, Verbesserungsvorschlag oder eigene Erfahrung zu diesem Artikel? Schreib einen Kommentar. Neue Beiträge erscheinen nach kurzer Moderation.

  • Lade Kommentare …
Kommentar schreiben