Künstliche Intelligenz · KI einfach erklärt

Wie funktioniert KI? Schritt für Schritt erklärt

Wie funktioniert KI? Eine verständliche Schritt-für-Schritt-Anleitung zu Daten, maschinellem Lernen, neuronalen Netzen, Training, Inferenz, LLMs, Reasoning-Modellen und KI-Agenten.

Das Wichtigste auf einen Blick
  • Jedes moderne KI-System durchläuft zwei Phasen: Training (Lernen aus Daten) und Inferenz (Anwenden des Gelernten).
  • Neuronale Netze bestehen aus Schichten einfacher mathematischer Funktionen, deren Gewichte mithilfe von Gradientenabstieg und Backpropagation angepasst werden.
  • Große Sprachmodelle wandeln Text in Tokens und Embeddings um. Ein Transformer nutzt Attention, um das nächste Token vorherzusagen.
  • Chat-Assistenten lernen durch zusätzliche Trainingsschritte, etwa Instruction Tuning und Lernen aus menschlichem oder KI-Feedback, hilfreiche Antworten zu geben.
  • Reasoning-Modelle und KI-Agenten ergänzen dieselbe Grundidee um mehr Zeit zum Nachdenken, Werkzeuge und Gedächtnis.
Kurz gesagt

KI funktioniert, indem sie Muster in Daten lernt. Beim Training passt ein Algorithmus die internen Parameter eines Modells, meist eines neuronalen Netzes, so lange an, bis seine Ergebnisse zu den Beispielen passen, die es erhält. Bei der Inferenz wendet das trainierte Modell diese gelernten Muster auf neue Eingaben an, um eine Antwort vorherzusagen, etwas zu klassifizieren oder Inhalte zu erzeugen. Große Sprachmodelle tun dies, indem sie wiederholt das nächste Text-Token vorhersagen.

Das große Ganze

Klassische Software besteht aus Anweisungen, die Menschen schreiben: Wenn das passiert, tue jenes. KI kehrt dieses Prinzip um. Statt die Regeln vorzugeben, zeigen Entwickler einem System viele Beispiele und lassen einen Lernalgorithmus die Regeln selbst erkennen.

Fast jedes KI-System, das Sie heute nutzen, durchläuft dieselben Schritte.

PhaseWas passiertBeispiel: ein Chat-Assistent
DatenBeispiele sammeln und bereinigen.Große Mengen an Texten, Code und Gesprächen.
ModellEine Architektur mit anpassbaren Parametern auswählen.Ein neuronales Transformer-Netz mit Milliarden von Parametern.
TrainingParameter anpassen, um Fehler zu reduzieren.Das nächste Token vorhersagen und das Modell anschließend mithilfe von Feedback durch Menschen und KI verbessern.
EvaluierungMit Daten testen, die das Modell noch nicht gesehen hat.Benchmarks, Sicherheitstests und menschliche Überprüfung.
InferenzDas Modell mit neuen Eingaben nutzen.Ihre Nachricht in Sekunden beantworten.

Schritt 1: Daten

Daten sind der Rohstoff der KI. Ein Modell kann nur Muster lernen, die in seinen Trainingsdaten vorkommen. Qualität, Vielfalt und Fairness dieser Daten prägen daher alles, was folgt.

  • Strukturierte Daten: Tabellen, etwa mit Transaktionen, Sensormesswerten oder Patientenakten.
  • Unstrukturierte Daten: Texte, Bilder, Audio- und Videodateien. Sie machen den Großteil der Informationen weltweit aus.
  • Gelabelte Daten: Beispiele mit der richtigen Antwort, etwa Fotos mit der Kennzeichnung „Katze“ oder „Hund“.
  • Synthetische Daten: Beispiele, die andere KI-Modelle erzeugen. Sie werden inzwischen häufig für das Training und die Feinabstimmung neuer Modelle verwendet.

Vor dem Training werden Daten bereinigt, Duplikate entfernt, schädliche oder minderwertige Inhalte herausgefiltert und die Daten in Zahlen umgewandelt, die das Modell verarbeiten kann. Bei Text bedeutet das, ihn in Tokens zu zerlegen: Wörter oder Wortteile.

Schritt 2: Lernmethoden

Maschinelles Lernen bietet verschiedene Möglichkeiten, aus Daten zu lernen. Moderne Systeme kombinieren sie häufig.

Überwachtes Lernen

Lernt aus Beispielen mit bekannten Antworten. Wird für die Spam-Erkennung, die Klassifizierung medizinischer Bilder und Preisprognosen eingesetzt.

Unüberwachtes Lernen

Erkennt Strukturen in Daten ohne vorgegebene Antworten, etwa Kundensegmente oder ungewöhnliche Transaktionen.

Selbstüberwachtes Lernen

Erzeugt aus Rohdaten eigene Lernsignale, indem es zum Beispiel ein Wort verdeckt und vorhersagt. So werden LLMs vortrainiert.

Verstärkendes Lernen

Lernt durch Versuch und Irrtum anhand von Belohnungen. Wird für spielende KI, Robotik und das Training von Reasoning-Modellen eingesetzt.

Schritt 3: Neuronale Netze

Die meisten modernen KI-Systeme nutzen künstliche neuronale Netze. Ein solches Netz besteht aus Schichten kleiner Einheiten (Neuronen). Jede Einheit multipliziert ihre Eingaben mit Gewichtungen, addiert die Ergebnisse und leitet sie über eine einfache nichtlineare Funktion an die nächste Schicht weiter.

  • Die Eingabeschicht empfängt Zahlen, die die Daten darstellen, etwa Pixelwerte oder Token-Embeddings.
  • Verborgene Schichten wandeln diese Zahlen Schritt für Schritt in abstraktere Merkmale um, bei einem Bild etwa in Kanten, Formen und Objekte.
  • Die Ausgabeschicht liefert das Ergebnis, etwa eine Wahrscheinlichkeit für jedes mögliche nächste Wort.

Deep Learning bedeutet schlicht, dass ein Netz viele Schichten hat. Unterschiedliche Architekturen eignen sich für unterschiedliche Daten: Convolutional Neural Networks für Bilder, rekurrente Netze für ältere Spracherkennungssysteme, Diffusionsmodelle für die Bilderzeugung und Transformer für Sprache und zunehmend fast alles andere.

Schritt 4: Training

Training ist ein Optimierungsprozess, der sich milliardenfach wiederholt.

  1. Forward-Pass: Das Modell erstellt Vorhersagen für eine Gruppe von Beispielen.
  2. Verlust: Eine Verlustfunktion misst, wie stark die Vorhersage vom tatsächlichen Ergebnis abweicht.
  3. Backpropagation: Der Algorithmus berechnet, wie stark jedes Gewicht zum Fehler beigetragen hat.
  4. Gradientenabstieg: Jedes Gewicht wird leicht in die Richtung angepasst, die den Fehler verringert.

Führende Sprachmodelle werden über Wochen oder Monate mit riesigen Datenmengen und Tausenden spezialisierten Chips (GPUs oder TPUs) trainiert. Öffentlichen Schätzungen zufolge kostet das Training der größten Modelle mehrere zehn bis mehrere hundert Millionen US-Dollar. Deshalb entwickeln nur wenige Unternehmen solche Modelle von Grund auf.

Ein häufiges Problem ist Overfitting: Das Modell merkt sich die Trainingsbeispiele, statt allgemeine Muster zu lernen. Entwickler erkennen es, indem sie das Modell mit separaten Validierungsdaten testen. Mehr Daten, Regularisierung und frühzeitiges Stoppen helfen, es zu verhindern.

Schritt 5: Inferenz

Inferenz findet statt, wenn du KI tatsächlich nutzt. Die trainierten Modellgewichte bleiben unverändert, und deine Eingabe durchläuft das Netzwerk einmal (bei der Textgenerierung einmal pro generiertem Token), um eine Ausgabe zu erzeugen.

Die Ausführung von KI-Modellen ist deutlich günstiger als ihr Training. Bei Hunderten Millionen Nutzern sind dafür aber immer noch große Rechenzentren nötig. Deshalb bieten Anbieter Modelle in verschiedenen Größen an: kleine, schnelle Modelle für einfache Aufgaben und größere Modelle oder Modelle mit stärkerem logischem Denkvermögen für schwierige Probleme.

Wie große Sprachmodelle funktionieren

Große Sprachmodelle (LLMs) wie OpenAI GPT, Anthropic Claude und Google Gemini sowie Modelle mit frei verfügbaren Gewichten wie Llama, Mistral, Qwen oder DeepSeek entstehen in mehreren Schritten.

Token und Embeddings

Der Text wird in Tokens zerlegt. Jedes Token erhält ein Embedding, also eine lange Zahlenliste, die seine Bedeutung erfasst. Wörter mit ähnlicher Bedeutung haben ähnliche Embeddings.

Der Transformer und der Attention-Mechanismus

Die 2017 vorgestellte Transformer-Architektur nutzt einen Mechanismus namens Attention. Für jedes Token bestimmt Attention, welche anderen Tokens im Kontext am wichtigsten sind. So kann das Modell ein Pronomen dem richtigen Nomen oder eine Frage der passenden Stelle in einem langen Dokument zuordnen.

Vortraining

Das Modell liest riesige Mengen an Text und lernt, das nächste Token vorherzusagen. Damit das gut funktioniert, muss es Grammatik, Fakten, Denkweisen und Programmiermuster verinnerlichen.

Post-Training

Ein vortrainiertes Basismodell setzt lediglich Texte fort. Durch Instruction Tuning, Reinforcement Learning from Human Feedback (RLHF) und ähnliche Verfahren lernt es, Anweisungen zu befolgen, Gespräche zu führen, schädliche Anfragen abzulehnen und Unsicherheit einzugestehen.

Kontext und Tools

Bei der Inferenz sieht das Modell ein Kontextfenster mit Ihrer Unterhaltung, Anweisungen und manchmal abgerufenen Dokumenten. Retrieval-Augmented Generation (RAG) und die Websuche liefern dem Modell aktuelle Informationen, die es beim Training nicht gelernt hat.

Reasoning-Modelle und KI-Agenten

Seit 2024 haben zwei Entwicklungen verändert, wie leistungsfähige KI in der Praxis funktioniert.

Reasoning-Modelle werden oft durch Reinforcement Learning darauf trainiert, ein Problem Schritt für Schritt zu durchdenken, bevor sie eine endgültige Antwort geben. Mehr Rechenleistung bei der Antwort verbessert häufig die Ergebnisse bei Aufgaben in Mathematik, Naturwissenschaften, Programmierung und Planung. Die meisten großen Anbieter bieten inzwischen Reasoning- oder „Thinking“-Modi an.

KI-Agenten arbeiten mit einem Modell in einer Schleife: Sie planen, nutzen ein Tool, prüfen das Ergebnis und planen den nächsten Schritt. Tools können die Websuche, das Ausführen von Code, das Bearbeiten von Dateien oder andere Software umfassen. Agenten können mehrstufige Aufgaben erledigen, brauchen aber klare Ziele, Berechtigungen und eine Überprüfung durch Menschen.

Multi-Agenten-Systeme gehen noch einen Schritt weiter: Mehrere KI-Rollen arbeiten zusammen oder diskutieren miteinander. Studien zu „KI-Debatten“ deuten darauf hin, dass Modelle durch gegenseitige Kritik Fehler aufdecken können, die einem einzelnen Modell entgehen würden.

Was das für den Alltag bedeutet

Wer versteht, wie KI funktioniert, entwickelt bessere Gewohnheiten.

  • Gib Kontext. Das Modell kennt nur, was in seinen Trainingsdaten und deinem Prompt steht.
  • Frag bei wichtigen Fakten nach Begründungen und Quellen und überprüfe sie anschließend.
  • Nutze ein Reasoning-Modell für komplexe Aufgaben und ein schnelles Modell für erste Entwürfe.
  • Vergleiche Perspektiven. Verschiedene Modelle, die mit unterschiedlichen Daten trainiert wurden, können zu unterschiedlichen Schlussfolgerungen kommen.

Debatly macht den letzten Punkt einfach: Mehrere KI-Personas diskutieren deine Frage, und eine KI-Jury fasst zusammen, wer die besten Argumente hatte und warum. In derselben App kannst du auch direkt mit den neuesten Modellen von OpenAI, Anthropic und Google chatten.

Häufig gestellte Fragen

KI verarbeitet eine große Zahl von Beispielen und passt sich schrittweise an, bis sie für eine bestimmte Eingabe die passende Ausgabe vorhersagen kann. Nach dem Training nutzt sie diese gelernten Muster, um Fragen zu beantworten, Bilder zu erkennen oder neue Inhalte zu erstellen, die sie so noch nie gesehen hat.
Nur sehr bedingt. Künstliche neuronale Netze sind von Nervenzellen inspiriert, bestehen aber aus mathematischen Funktionen, die auf Computerchips ausgeführt werden. Sie lernen statistische Muster und haben keine menschlichen Erfahrungen, Gefühle oder Absichten, auch wenn ihre Antworten sehr menschlich klingen können.
ChatGPT zerlegt Ihre Nachricht in Tokens, verarbeitet sie mit einem neuronalen Transformer-Netz und sagt Token für Token voraus, was als Nächstes am besten passt, bis die Antwort vollständig ist. Durch zusätzliches Training mit menschlichem Feedback lernt es, Anweisungen zu befolgen und hilfreich zu antworten. Werkzeuge wie die Websuche können aktuelle Informationen ergänzen.
Das hängt vom Modell ab. Sprachmodelle werden mit großen Sammlungen von Text und Code trainiert, etwa mit öffentlich zugänglichen Webseiten, Büchern und lizenzierten Daten. Bildmodelle lernen aus Bildern mit zugehörigen Bildbeschreibungen. Unternehmen müssen ihre Trainingsdaten zunehmend dokumentieren, beispielsweise nach dem EU AI Act.
Ein Sprachmodell erzeugt die plausibelste Fortsetzung eines Textes, keine überprüfte Tatsache. Wenn die Trainingsdaten zu einem Thema lückenhaft sind oder eine Frage mehrdeutig ist, können plausible und wahre Antworten auseinanderfallen. Antworten anhand von Quellen zu prüfen, nachzufragen und mehrere Perspektiven zu vergleichen, verringert das Risiko.
Training ist die aufwendige Lernphase: Das Modell passt seine Parameter anhand riesiger Datensätze an, oft wochenlang auf Tausenden spezialisierter Chips. Inferenz ist die alltägliche Nutzung des fertigen Modells, um eine Anfrage zu beantworten. Das dauert nur Sekunden.

Sehen Sie mehreren KI-Modellen dabei zu, wie sie über Ihre Frage nachdenken

Auf Debatly diskutieren KI-Personas Ihre Frage aus verschiedenen Blickwinkeln, und ein KI-Richter bewertet die Argumente. So sehen Sie, wie KI zu ihren Schlüssen kommt, wo die Modelle übereinstimmen und wo sie unsicher sind.

So funktionieren KI-Debatten

5 Tage kostenlos testen. Jederzeit kündbar.