KI-Glossar
Fachbegriffe verständlich erklärt
Umfassendes Nachschlagewerk für KI- und Data-Science-Terminologie.
+ Agent
Ein KI-Agent ist ein Softwaresystem, das eigenständig Aufgaben bearbeitet: Es nimmt ein Ziel entgegen, plant die Schritte, nutzt Werkzeuge (z. B. Suche, Datenbanken, APIs) und handelt, um das Ziel zu erreichen – ohne dass jeder Einzelschritt vorgegeben wird.
Funktionsweise: Ein Agent kombiniert ein Sprachmodell (LLM) mit einem Gedächtnis und Werkzeugen. Er zerlegt eine Aufgabe in Teilschritte, entscheidet bei jedem Schritt, welches Werkzeug er aufruft, wertet das Ergebnis aus und plant den nächsten Schritt – bis das Ziel erreicht ist.
Unternehmensbeispiel: Ein Mittelständler setzt einen Agenten im Einkauf ein: Dieser liest Angebots-E-Mails, gleicht Preise mit dem ERP ab, erstellt eine Vergleichstabelle und legt einen Bestellvorschlag zur Freigabe vor.
Anwendungsfelder:
- Automatisierung wiederkehrender Büro- und Verwaltungsprozesse
- Recherche und Aufbereitung von Informationen
- Kundenservice mit Zugriff auf interne Systeme
- Datenpflege und Abgleich zwischen Anwendungen
Abgrenzung: Im Gegensatz zu einem Bot, der festen Regeln folgt, trifft ein Agent eigene Entscheidungen und nutzt Werkzeuge flexibel.
Verwandte Begriffe: Agentic AI, Bot
+ Agentic AI
Agentic AI bezeichnet KI-Systeme, die aus mehreren zusammenarbeitenden Agenten bestehen und komplexe Vorhaben weitgehend selbstständig umsetzen. Statt eines einzelnen Anfrage-Antwort-Austauschs verfolgen sie über viele Schritte ein übergeordnetes Ziel.
Funktionsweise: Mehrere spezialisierte Agenten übernehmen Teilrollen (z. B. Planer, Rechercheur, Prüfer) und stimmen sich untereinander ab. Sie planen, führen aus, kontrollieren ihre Zwischenergebnisse und korrigieren sich selbst, bis das Gesamtergebnis vorliegt.
Unternehmensbeispiel: Für die Angebotserstellung arbeiten drei Agenten zusammen: einer sammelt Anforderungen, einer kalkuliert auf Basis des ERP, einer formuliert das Angebot – der Mitarbeiter prüft nur noch das Endergebnis.
Anwendungsfelder:
- Durchgängige Automatisierung mehrstufiger Geschäftsprozesse
- Erstellung und Prüfung von Dokumenten und Berichten
- Datenanalyse mit anschließender Handlungsempfehlung
- Orchestrierung mehrerer Fachsysteme
Abgrenzung: Während ein einzelner Agent eine Aufgabe übernimmt, koordiniert Agentic AI mehrere Agenten für größere, mehrstufige Vorhaben.
+ AI Governance
AI Governance bezeichnet die Gesamtheit der Regeln, Prozesse und Verantwortlichkeiten, mit denen ein Unternehmen den Einsatz von Künstlicher Intelligenz steuert – von der Auswahl und Freigabe von KI-Systemen über Risikobewertung und Dokumentation bis zur laufenden Überwachung im Betrieb.
Funktionsweise: Ein AI-Governance-Rahmen legt fest, wer KI-Systeme freigibt, nach welchen Kriterien Risiken bewertet werden und wie Modelle dokumentiert, getestet und überwacht werden. Typische Bausteine sind ein Inventar aller eingesetzten KI-Systeme, klare Rollen und Freigabeprozesse, Richtlinien für Datenqualität und Transparenz sowie regelmäßige Prüfungen. Regulatorische Vorgaben wie die KI-Verordnung (EU AI Act) geben den äußeren Rahmen vor.
Unternehmensbeispiel: Ein Automobilzulieferer führt KI-gestützte Sichtprüfung und Prognosemodelle in mehreren Werken ein. Ein zentrales KI-Inventar erfasst jedes System mit Zweck, Risikoklasse und Verantwortlichem; neue Anwendungsfälle durchlaufen eine Risikobewertung, bevor sie produktiv gehen.
Anwendungsfelder:
- Aufbau von KI-Inventaren und Freigabeprozessen
- Risikoklassifizierung von KI-Anwendungsfällen nach der KI-Verordnung
- Richtlinien für den Einsatz generativer KI im Arbeitsalltag
- Nachweis- und Dokumentationspflichten gegenüber Kunden und Behörden
Abgrenzung: Data Governance regelt den Umgang mit Daten; AI Governance setzt darauf auf und regelt zusätzlich Modelle, deren Risiken und deren Einsatz. MLOps liefert die technische Umsetzung (Versionierung, Monitoring), ersetzt aber nicht die organisatorischen Regeln.
Verwandte Begriffe: KI-Verordnung (EU AI Act), Data Governance, MLOps, Explainable AI (XAI)
+ Anomalieerkennung (Anomaly Detection)
Anomalieerkennung (Anomaly Detection) ist ein Verfahren des maschinellen Lernens und der Statistik, das Datenpunkte identifiziert, die deutlich vom erwarteten Normalverhalten abweichen. Anders als bei der Klassifizierung sind die gesuchten Ausnahmefälle meist selten und oft nicht vorab gelabelt.
Funktionsweise: Ein Modell lernt zunächst, wie "normale" Daten aussehen – etwa über statistische Verteilungen, Dichteschätzung, Clustering oder Autoencoder. Neue Datenpunkte werden dann daran gemessen, wie stark sie von diesem Normalmuster abweichen; überschreitet die Abweichung einen Schwellenwert, wird ein Alarm ausgelöst. Je nachdem, wie viele gelabelte Beispiele vorliegen, kommen überwachte, halbüberwachte oder unüberwachte Ansätze zum Einsatz.
Unternehmensbeispiel: Ein Maschinenbauunternehmen überwacht Vibrations- und Temperatursensoren seiner Fertigungsanlagen. Ein Anomalieerkennungsmodell meldet ungewöhnliche Sensormuster, bevor ein Lager ausfällt – die Wartung kann geplant statt notfallmäßig erfolgen.
Anwendungsfelder:
- Predictive Maintenance und Zustandsüberwachung von Maschinen
- Qualitätskontrolle in der Fertigung
- Betrugserkennung bei Transaktionen
- Erkennung von Messfehlern in Sensor- und Felddaten (z. B. Landwirtschaft, Fernerkundung)
- IT-Sicherheit und Netzwerküberwachung
Verwandte Begriffe: Unüberwachtes Lernen, Clustering, Mustererkennung, Maschinelles Lernen
+ Anwendungsprogrammierschnittstelle (API)
Eine API (Application Programming Interface) ist eine klar definierte Schnittstelle, über die verschiedene Softwareanwendungen miteinander kommunizieren und Daten austauschen können. Die API legt fest, welche Anfragen gestellt werden können, in welchem Format Daten übertragen werden und wie Fehler behandelt werden.
Funktionsweise: Eine API funktioniert nach dem Prinzip von Anfrage und Antwort. Eine Anwendung sendet eine strukturierte Anfrage (Request) an die API, diese verarbeitet sie und liefert eine Antwort (Response) – häufig im JSON- oder XML-Format – zurück.
Unternehmensbeispiel: Ein Online-Shop bindet über eine API den Versanddienstleister ein: Sobald eine Bestellung eingeht, übermittelt die API automatisch die Lieferdaten, ohne dass ein Mitarbeiter manuell eingreifen muss.
Anwendungsfelder:
- Verbindung von Business-Intelligence-Tools mit verschiedenen Datenquellen
- Integration von Zahlungsdienstleistern, Versanddiensten oder CRM-Systemen
- Nutzung externer KI-Modelle (z. B. von OpenAI oder Google) in eigenen Anwendungen
- Automatisierung von Datenpipelines zwischen internen Systemen
Abgrenzung: Im Gegensatz zu einer direkten Datenbankverbindung abstrahiert eine API die technische Infrastruktur – der Aufrufer muss nicht wissen, wie die Daten intern gespeichert sind.
Verwandte Begriffe: Microservices, Data Engineer, ETL
+ ArcGIS
ArcGIS ist die kommerzielle Geoinformationssystem-Plattform des Herstellers Esri und dient dem Erfassen, Verwalten, Analysieren und Veröffentlichen von Geodaten. Sie umfasst die Desktop-Anwendung ArcGIS Pro, Serverkomponenten für die Datenbereitstellung sowie ArcGIS Online für Web-Karten und Dashboards.
Funktionsweise: Geodaten werden als Layer in Projekten organisiert und über Werkzeugketten (Geoprocessing) verarbeitet – Verschneidung, Pufferbildung, Interpolation, Netzwerkanalyse. Analysen lassen sich über Python und die ArcPy-Schnittstelle automatisieren; das Modul arcgis.learn bündelt Deep-Learning-Modelle für Fernerkundungsaufgaben wie Objekterkennung, Bildsegmentierung und Punktwolkenklassifikation und bindet damit PyTorch-basierte Verfahren in die GIS-Umgebung ein. Neben ArcGIS ist QGIS die verbreitete Open-Source-Alternative, häufig ergänzt um Bibliotheken wie GDAL.
Unternehmensbeispiel: Eine Behörde verwaltet Flächen- und Infrastrukturdaten in einer ArcGIS-Umgebung. Ein Data-Science-Team trainiert außerhalb der Plattform ein Segmentierungsmodell zur Erkennung versiegelter Flächen und stellt es als Geoprocessing-Werkzeug bereit, sodass Fachanwender die Auswertung ohne Programmierkenntnisse auf neue Luftbilder anwenden können.
Anwendungsfelder:
- Verwaltung und Pflege raumbezogener Fachdatenbestände
- Netzwerk-, Erreichbarkeits- und Einzugsgebietsanalysen
- Auswertung von Luft- und Satellitenbildern
- Karten, Dashboards und Feldanwendungen für Fachabteilungen
- Bereitstellung trainierter Modelle für GIS-Anwender
Verwandte Begriffe: Fernerkundung (Remote Sensing), Standortanalyse (Location Analysis), Punktwolke (Point Cloud), Python
+ AWS (Amazon Web Services)
AWS (Amazon Web Services) ist die Public-Cloud-Plattform von Amazon und gemessen am Marktanteil der größte Cloud-Anbieter weltweit. Sie umfasst mehrere hundert Dienste von Rechenleistung und Speicher bis zu Datenbanken, Analytik und maschinellem Lernen.
Funktionsweise: Infrastruktur wird per API oder Konsole nach Bedarf bereitgestellt und nutzungsbasiert abgerechnet. Für Datenprojekte zentral sind S3 als Objektspeicher (häufig Grundlage eines Data Lake), EC2 und Lambda für Rechenleistung, Redshift und Athena für Analytik sowie SageMaker für Training, Deployment und Monitoring von Machine-Learning-Modellen; Bedrock stellt Foundation Models als Dienst bereit.
Unternehmensbeispiel: Ein Agrarunternehmen speichert Satelliten- und Sensordaten in S3, verarbeitet sie mit serverlosen Funktionen zu Feldkennzahlen und trainiert Ertragsprognosemodelle in SageMaker. Rechenintensive Trainingsläufe skalieren stundenweise hoch, ohne dass eigene Hardware vorgehalten wird.
Anwendungsfelder:
- Skalierbare Daten- und Analyseplattformen
- Training und Betrieb von ML-Modellen (SageMaker, Bedrock)
- Hosting von Anwendungen, APIs und Microservices
- Archivierung und Verarbeitung großer Sensor- und Bilddatenmengen
Verwandte Begriffe: Microsoft Azure, Data Lake / Datensee, MLOps
+ Bag of Words
Bag of Words ist ein Verfahren zur Textrepräsentation, das ein Dokument als ungeordnete Sammlung seiner Wörter mit den jeweiligen Häufigkeiten abbildet und die Reihenfolge der Wörter dabei verwirft.
Funktionsweise: Zunächst wird aus dem gesamten Korpus ein Vokabular gebildet. Jedes Dokument erhält anschließend einen Vektor in der Länge dieses Vokabulars, dessen Einträge angeben, wie oft der jeweilige Begriff im Dokument vorkommt. Üblich vorgeschaltet sind Tokenisierung, Kleinschreibung, das Entfernen von Stoppwörtern sowie Stemming oder Lemmatisierung. Mit n-Grammen lassen sich kurze Wortfolgen wie "nicht defekt" zusätzlich erfassen und damit ein Teil der verworfenen Wortreihenfolge zurückgewinnen.
Unternehmensbeispiel: Ein Agrarhandelsunternehmen sortiert eingehende E-Mails automatisch nach Bestellung, Reklamation und Preisanfrage. Ein Bag-of-Words-Modell, das auf einigen tausend historischen Nachrichten trainiert wurde, liefert dafür eine belastbare erste Lösung, die ohne GPU trainiert und betrieben werden kann.
Anwendungsfelder:
- Klassifizierung von E-Mails, Tickets und Formularen
- Themenmodellierung in Dokumentenbeständen
- Baseline-Modelle vor dem Einsatz aufwendigerer Verfahren
- Aufbau einfacher Suchindizes
- Explorative Auswertung von Freitextfeldern
Abgrenzung: Embeddings kodieren Bedeutung als Vektor; kontextuelle Varianten stellen "Bank" je nach Satz unterschiedlich dar. Bag of Words unterscheidet solche Bedeutungen nicht.
Verwandte Begriffe: TF-IDF, Text Mining, Natural Language Processing (NLP), Token / Tokenisierung
+ BERT
BERT (Bidirectional Encoder Representations from Transformers) ist ein 2018 von Google veröffentlichtes Sprachmodell, das jedes Wort im beidseitigen Satzkontext kodiert und als vortrainierte Grundlage für Aufgaben wie Textklassifikation, Entitätenerkennung und semantische Suche dient.
Funktionsweise: BERT nutzt den Encoder-Teil der Transformer-Architektur. Im Vortraining werden einzelne Token maskiert und aus dem umgebenden Text rekonstruiert, wodurch das Modell Kontext von links und rechts gleichzeitig auswertet. Für eine konkrete Aufgabe folgt ein Fine-Tuning mit vergleichsweise wenigen gelabelten Beispielen. Neben dem allgemeinen Modell existieren fachlich vortrainierte Varianten, etwa für biomedizinische oder deutschsprachige Texte.
Unternehmensbeispiel: Ein Pharmaunternehmen liest aus Studien- und Sicherheitsberichten Wirkstoffnamen, Dosierungen und unerwünschte Ereignisse aus. Ein auf Fachtexten vortrainiertes BERT-Modell wird mit einigen hundert annotierten Absätzen nachtrainiert und erreicht damit eine Genauigkeit, die mit regelbasierter Extraktion nicht zu erzielen war.
Anwendungsfelder:
- Entitätenerkennung in Fach- und Regulierungstexten
- Semantische Suche und Dokumenten-Retrieval
- Klassifikation von Support-Anfragen und Berichten
- Ähnlichkeitsabgleich zur Dublettenprüfung
- Vektorisierung von Textabschnitten für Retrieval-Augmented Generation (RAG)
Abgrenzung: BERT liest und kodiert Text, erzeugt aber selbst keine längeren Antworten. Generative Modelle vom Typ Large Language Model (LLM) nutzen dafür den Decoder-Teil der Transformer-Architektur.
Verwandte Begriffe: Transformer-Architektur, Fine-Tuning, Natural Language Processing (NLP), Embedding / Vektordarstellung
+ Bilderkennung
Bilderkennung ist ein Teilgebiet der Computer Vision und bezeichnet die Fähigkeit von Softwaresystemen, Inhalte in Bildern oder Videos automatisch zu identifizieren, zu klassifizieren und zu interpretieren. Grundlage sind neuronale Netzwerke, insbesondere Convolutional Neural Networks (CNNs).
Funktionsweise: Das Modell wird auf großen, beschrifteten Bilddatensätzen trainiert. Es lernt dabei schrittweise, einfache Merkmale (Kanten, Farben) zu komplexeren Strukturen (Formen, Objekte) zusammenzusetzen. Nach dem Training kann es neue, unbekannte Bilder klassifizieren.
Unternehmensbeispiel: Ein Maschinenhersteller setzt Bilderkennung in der Qualitätskontrolle ein: Eine Kamera fotografiert jedes Bauteil, das Modell erkennt Risse oder Abweichungen in Millisekunden – schneller und gleichmäßiger als eine Sichtprüfung von Hand.
Anwendungsfelder:
- Qualitätssicherung in der Produktion
- Gesichtserkennung und Zugangskontrolle
- Medizinische Bildanalyse (Röntgen, MRT)
- Autonomes Fahren (Objekterkennung im Straßenverkehr)
- Pflanzenkrankheits- oder Schädlingserkennung in der Landwirtschaft
Abgrenzung: Bilderkennung klassifiziert Bilder (z. B. "Katze" oder "Hund"). Objekterkennung geht einen Schritt weiter und lokalisiert mehrere Objekte gleichzeitig innerhalb eines Bildes mit Rahmen (Bounding Boxes).
Verwandte Begriffe: Neuronales Netzwerk, Deep Learning, Überwachtes Lernen
+ Bildsegmentierung (Image Segmentation)
Bildsegmentierung (Image Segmentation) ist die pixelweise Zerlegung eines Bildes in inhaltlich zusammengehörige Bereiche, bei der jedem Bildpunkt eine Klasse oder eine Objektinstanz zugewiesen wird.
Funktionsweise: Die semantische Segmentierung vergibt Klassen je Bildpunkt, ohne einzelne Objekte zu trennen; die Instanzsegmentierung unterscheidet zusätzlich jedes Objekt für sich; die panoptische Segmentierung verbindet beides. Encoder-Decoder-Modelle wie U-Net und regionenbasierte Modelle wie Mask R-CNN sind die verbreiteten Architekturen. Trainiert wird mit von Hand erstellten Masken, bewertet wird über Kennzahlen wie Intersection over Union oder den Dice-Koeffizienten. Für Aufnahmen, die nicht in den Grafikspeicher passen, kommt gekachelte Inferenz zum Einsatz.
Unternehmensbeispiel: Ein Life-Science-Labor bestimmt Zellzahl und Zellfläche aus Mikroskopaufnahmen. Ein vortrainiertes Spezialmodell wie Cellpose segmentiert die Zellen und ersetzt das bisherige manuelle Auszählen, das je Versuchsreihe mehrere Stunden Arbeitszeit einer Fachkraft gebunden hat.
Anwendungsfelder:
- Flächenermittlung in der Fernerkundung
- Zell- und Gewebesegmentierung in Mikroskopie und Diagnostik
- Vermessung von Defektflächen in der Materialprüfung
- Auswertung medizinischer Bildgebung
- Freistellen von Objekten für nachgelagerte Messungen
Abgrenzung: Objekterkennung (Object Detection) markiert Objekte mit Rechtecken, Bildsegmentierung folgt der tatsächlichen Objektkontur. Sobald Fläche, Umriss oder Anteil gemessen werden sollen, führt an der Segmentierung kein Weg vorbei.
Verwandte Begriffe: Objekterkennung (Object Detection), U-Net, Mask R-CNN, Gekachelte Inferenz (Tiled Inference)
+ BLAST (Basic Local Alignment Search Tool)
BLAST (Basic Local Alignment Search Tool) ist ein bioinformatisches Suchverfahren, das eine DNA- oder Proteinsequenz mit den Einträgen einer Sequenzdatenbank vergleicht und lokal ähnliche Abschnitte samt statistischer Bewertung zurückgibt.
Funktionsweise: BLAST zerlegt die Anfragesequenz in kurze Wörter und sucht zunächst nach Übereinstimmungen dieser Wörter in der Datenbank. Von diesen Ansatzpunkten aus wird das Alignment in beide Richtungen verlängert, solange der Ähnlichkeitswert steigt. Der ausgegebene E-Wert gibt an, wie viele Treffer dieser Güte in einer Datenbank gleicher Größe rein zufällig zu erwarten wären, und dient als Filterkriterium. Für die verschiedenen Vergleichsrichtungen zwischen Nukleotid- und Proteinsequenzen existieren eigene Programmvarianten. Das vom US-amerikanischen National Center for Biotechnology Information (NCBI) bereitgestellte Werkzeug ist frei verfügbar und lässt sich als Kommandozeilenprogramm in eigene Auswertungen einbinden.
Unternehmensbeispiel: Ein Agrarlabor sequenziert Pilzisolate aus Feldproben. Ein automatisierter BLAST-Abgleich gegen eine kuratierte Referenzdatenbank bestimmt die Art und weist auf bekannte Resistenzmarker hin, bevor der Befund an den Berater geht.
Anwendungsfelder:
- Artbestimmung und taxonomische Zuordnung
- Funktionsannotation neu sequenzierter Gene
- Suche nach verwandten Sequenzen in anderen Organismen
- Prüfung von Primern und Sonden auf unerwünschte Bindungsstellen
- Kontaminationskontrolle in Sequenzierdaten
Verwandte Begriffe: FASTQ, Mustererkennung, Datenpipeline
+ Blockchain
Eine Blockchain ist eine dezentrale, manipulationsresistente Datenstruktur, die Transaktionen oder Informationen in einer chronologischen Kette von Blöcken speichert. Kein zentraler Akteur kontrolliert die Daten – stattdessen wird die Kette auf vielen Computern gleichzeitig gespeichert und von allen Teilnehmern gemeinsam validiert.
Funktionsweise: Jeder Block enthält einen kryptografischen Hash des vorherigen Blocks, einen Zeitstempel und die eigentlichen Transaktionsdaten. Wird ein Block nachträglich verändert, ändert sich sein Hash – und damit werden alle nachfolgenden Blöcke ungültig. Dadurch wird eine nachträgliche Änderung sofort erkennbar.
Unternehmensbeispiel: Ein Lebensmittelhersteller nutzt Blockchain, um die gesamte Lieferkette vom Bauernhof bis zum Supermarktregal zu dokumentieren. Jede Station wird unveränderlich erfasst – im Rückruffall lässt sich die Herkunft eines Produkts in Sekunden nachverfolgen.
Anwendungsfelder:
- Kryptowährungen (Bitcoin, Ethereum)
- Supply-Chain-Transparenz
- Automatisch ausgeführte Vertragslogik (Smart Contracts)
- Echtheitsnachweis für Dokumente und Zertifikate
- Gesundheitswesen (sichere Patientendaten)
Abgrenzung: Eine Blockchain ist keine Datenbank im klassischen Sinne – sie ist optimiert für Unveränderlichkeit und Vertrauen, nicht für schnelle Abfragen oder flexible Datenstrukturen.
Verwandte Begriffe: Data Warehouse, Strukturierte Daten
+ Bot
Ein Bot ist ein Programm, das definierte, wiederkehrende Aufgaben automatisch ausführt – etwa das Beantworten von Standardfragen oder das Ausfüllen von Formularen. Klassische Bots folgen dabei festen Regeln oder Skripten.
Funktionsweise: Ein Bot reagiert auf einen Auslöser (z. B. eine Nachricht oder einen Zeitplan) und arbeitet eine vorgegebene Abfolge ab. Moderne Chatbots kombinieren dies mit einem Sprachmodell, um freier formulierte Anfragen zu verstehen.
Unternehmensbeispiel: Ein Chatbot auf der Website beantwortet häufige Kundenfragen zu Öffnungszeiten, Versand und Preisen und leitet nur komplexe Fälle an einen Mitarbeiter weiter.
Anwendungsfelder:
- Kundenservice und FAQ-Automatisierung
- Terminbuchung und Ausfüllen von Formularen
- Überwachung und Benachrichtigung (Monitoring)
- Routineaufgaben in Chat- und Messaging-Kanälen
Abgrenzung: Ein Bot folgt festen Regeln; ein Agent plant eigenständig und nutzt Werkzeuge flexibel, um ein Ziel zu erreichen.
Verwandte Begriffe: Agent, Agentic AI
+ Business Intelligence (BI)
Business Intelligence bezeichnet den systematischen Einsatz von Technologien, Prozessen und Methoden zur Erfassung, Aufbereitung und Visualisierung von Unternehmensdaten – mit dem Ziel, fundierte Entscheidungen auf Basis von Fakten zu ermöglichen.
Funktionsweise: BI-Systeme greifen auf Daten aus verschiedenen Quellen zu (ERP, CRM, Datenbanken), bereiten sie in einem zentralen Data Warehouse auf und stellen sie über Dashboards und Berichte übersichtlich dar. Nutzer können Daten interaktiv filtern, aufschlüsseln und analysieren – ohne Programmierkenntnisse.
Unternehmensbeispiel: Der Vertriebsleiter öffnet morgens sein BI-Dashboard und sieht sofort: Welche Region hat gestern die Umsatzziele verfehlt? Welches Produkt läuft besser als geplant? Auf dieser Basis trifft er noch vor dem ersten Meeting fundierte Entscheidungen.
Anwendungsfelder:
- Umsatz- und Kostenanalysen
- Kunden- und Marktsegmentierung
- Operative Kennzahlenüberwachung (KPIs)
- Finanz- und Budgetplanung
Abgrenzung: BI erklärt, was in der Vergangenheit passiert ist (Deskriptive Analytik). Prädiktive Analytik geht einen Schritt weiter und sagt voraus, was als Nächstes passieren wird.
Verwandte Begriffe: Data Warehouse, Deskriptive Analytik, Data Scientist
+ C++ (Programmiersprache)
C++ ist eine kompilierte Programmiersprache für systemnahe und performancekritische Software, die direkte Kontrolle über Speicher und Hardware mit abstrakten Sprachmitteln verbindet. In der Datenwissenschaft ist C++ die Sprache unter der Haube: Viele Kernbibliotheken des Python-Ökosystems sind in C++ implementiert.
Funktionsweise: C++-Code wird vor der Ausführung in Maschinencode übersetzt und erreicht dadurch – zusammen mit manueller Speicherkontrolle und Compiler-Optimierungen – Laufzeiten, die interpretierte Sprachen nicht bieten. Die Rechenkerne von PyTorch, TensorFlow oder OpenCV sind in C++ geschrieben und werden über Schnittstellen (Bindings) aus Python genutzt.
Unternehmensbeispiel: Ein Vermessungsdienstleister verarbeitet Laserscan-Punktwolken mit Milliarden Punkten. Die Filter- und Registrierungsalgorithmen sind in C++ implementiert, damit die Verarbeitung Stunden statt Tage dauert; die Analyse-Workflows darüber steuert das Team bequem aus Python.
Anwendungsfelder:
- Performancekritische Verarbeitung großer Daten (Punktwolken, Bilder, Signale)
- Implementierung von ML-Framework- und Datenbank-Kernen
- Embedded- und Echtzeitsysteme, Robotik
- Beschleunigung einzelner Python-Engpässe über native Erweiterungen
Verwandte Begriffe: Python, Punktwolke (Point Cloud), Signalverarbeitung
+ CAD (Computer-Aided Design)
CAD (Computer-Aided Design, dt. computergestützte Konstruktion) bezeichnet die rechnergestützte Erstellung und Bearbeitung geometrischer Modelle von Bauteilen, Anlagen und Gebäuden. CAD-Modelle beschreiben Geometrie parametrisch und exakt und bilden die verbindliche Grundlage für Fertigung, Montage und Dokumentation.
Funktionsweise: Ein CAD-System verwaltet Volumen-, Flächen- und Kurvengeometrie samt Maßen, Toleranzen und Materialangaben; Änderungen an einem Parameter wirken über die Konstruktionshistorie auf abhängige Elemente. Für die Verbindung zu Messdaten ist der umgekehrte Weg relevant: Beim Reverse Engineering wird eine Punktwolke (Point Cloud) aus einem Laserscan zunächst in Flächen und Regelgeometrien überführt und daraus ein CAD-Modell abgeleitet. Der Austausch zwischen Systemen erfolgt über Formate wie STEP oder IGES, für den Bauwerksbereich über IFC.
Unternehmensbeispiel: Ein Maschinenbauunternehmen betreibt eine Altanlage, für die keine vollständigen Zeichnungen mehr vorliegen. Die Anlage wird per Laserscanner erfasst, die Punktwolke automatisiert in Rohre, Behälter und Stahlbau segmentiert und daraus ein CAD-Modell aufgebaut, das als Grundlage für die Planung eines Umbaus dient.
Anwendungsfelder:
- Konstruktion von Bauteilen, Werkzeugen und Anlagen
- Reverse Engineering aus Scandaten
- Soll-Ist-Vergleich von Planung und Bestand
- Digitale Zwillinge und Simulationsmodelle
- Bestandsdokumentation von Gebäuden und Infrastruktur
Verwandte Begriffe: Punktwolke (Point Cloud), Industrie 4.0, PDAL, Signalverarbeitung
+ Cellpose
Cellpose ist ein quelloffenes Deep-Learning-Werkzeug zur Segmentierung von Zellen und Zellkernen in mikroskopischen Aufnahmen. Es ist als generalistisches Modell angelegt: ein einmal trainiertes Netz segmentiert Zellen unterschiedlicher Form, Größe und Aufnahmemodalität, ohne dass für jeden neuen Datensatz ein eigenes Modell nötig ist.
Funktionsweise: Das Modell sagt für jedes Pixel nicht direkt eine Klassenzugehörigkeit vorher, sondern ein Vektorfeld, das in Richtung des jeweiligen Zellzentrums zeigt. Die Pixel werden anschließend entlang dieser Vektoren zusammengeführt, wodurch auch aneinandergrenzende und ungleichmäßig geformte Zellen getrennt bleiben. Cellpose bietet eine grafische Oberfläche, eine Kommandozeile und eine Python-Schnittstelle; mit wenigen manuell korrigierten Bildern lässt sich das Modell auf schwierige Präparate nachtrainieren.
Unternehmensbeispiel: Ein Pharmaunternehmen wertet Zellkulturplatten aus einem Wirkstoffscreening aus. Cellpose segmentiert die Einzelzellen in mehreren Tausend Aufnahmen pro Lauf, anschließend werden Fläche, Form und Fluoreszenzintensität je Zelle gemessen und über Konzentrationsreihen verglichen – eine Auswertung, die manuell nicht in vertretbarer Zeit möglich wäre.
Anwendungsfelder:
- Zellzählung und Morphometrie in der Mikroskopie
- Hochdurchsatz-Screening in der Wirkstoffforschung
- Auswertung histologischer und immunfluoreszenzgefärbter Präparate
- Zellverfolgung in Zeitrafferaufnahmen
- Erzeugung von Annotationen für nachgelagerte Analysen
Abgrenzung: StarDist modelliert Objekte als sternkonvexe Polygone und ist damit besonders stark bei runden, dicht gepackten Zellkernen; Cellpose ist flexibler bei stark unregelmäßigen Zellformen. In der Praxis werden beide Werkzeuge auf denselben Daten verglichen.
Verwandte Begriffe: StarDist, Bildsegmentierung (Image Segmentation), U-Net, Bilderkennung
+ CI/CD
CI/CD (Continuous Integration / Continuous Delivery bzw. Deployment) ist eine Software-Engineering-Praxis, bei der Codeänderungen automatisiert gebaut, getestet und ausgeliefert werden. Ziel sind kleine, häufige und risikoarme Releases statt seltener Großumstellungen.
Funktionsweise: Bei Continuous Integration wird jede Änderung nach dem Einchecken automatisch kompiliert und durch Test-Suiten geprüft, sodass Fehler früh auffallen. Continuous Delivery hält jeden erfolgreich getesteten Stand auslieferbar; Continuous Deployment bringt ihn ohne manuellen Zwischenschritt in Produktion. Umgesetzt wird das mit Pipeline-Werkzeugen wie GitHub Actions, GitLab CI oder Azure DevOps.
Unternehmensbeispiel: Ein Softwareteam eines Agrarunternehmens pflegt eine Feldmanagement-Anwendung. Jede Änderung durchläuft automatisch Format-, Test- und Sicherheitsprüfungen und wird zunächst in eine Staging-Umgebung ausgerollt; erst nach bestandener Prüfung geht sie in Produktion – mehrmals pro Woche statt einmal pro Quartal.
Anwendungsfelder:
- Automatisierte Qualitätssicherung bei jeder Codeänderung
- Auslieferung von Anwendungen, APIs und Microservices
- Deployment von Datenpipelines und ML-Modellen (als Teil von MLOps)
- Infrastruktur-Änderungen per Infrastructure as Code
Verwandte Begriffe: MLOps, Microservices, Anwendungsprogrammierschnittstelle (API)
+ Clustering
Clustering ist ein Verfahren des unüberwachten Lernens, bei dem ein Algorithmus Datenpunkte anhand ihrer Ähnlichkeit automatisch in Gruppen (Cluster) einteilt – ohne dass die Gruppen vorab definiert wurden.
Funktionsweise: Der Algorithmus misst die Ähnlichkeit zwischen Datenpunkten (z. B. anhand von Abständen) und gruppiert ähnliche Punkte zusammen. Die Verfahren gehen dabei unterschiedlich vor: K-Means teilt Daten in eine vorher festgelegte Anzahl von Clustern, hierarchisches Clustering baut schrittweise eine Baumstruktur auf, DBSCAN erkennt auch unregelmäßig geformte Cluster und filtert Ausreißer heraus.
Unternehmensbeispiel: Ein E-Commerce-Unternehmen clustert seine Kunden anhand von Kaufverhalten und Interessen. Ergebnis: Cluster wie "Schnäppchenjäger", "Markenfans" und "Gelegenheitskäufer" – auf die dann gezielt unterschiedliche Marketingmaßnahmen zugeschnitten werden.
Anwendungsfelder:
- Kundensegmentierung im Marketing
- Anomalie- und Betrugserkennung
- Gruppierung thematisch ähnlicher Dokumente
- Genexpressionsanalyse in der Bioinformatik
Abgrenzung: Beim Clustering gibt es keine vordefinierten Kategorien – der Algorithmus entdeckt die Struktur selbst. Bei der Klassifizierung hingegen sind die Kategorien bekannt, und das Modell lernt, neue Daten zuzuordnen.
Verwandte Begriffe: Unüberwachtes Lernen, Klassifizierung, Feature Engineering
+ CNN (Convolutional Neural Network)
CNN (Convolutional Neural Network, dt. faltendes neuronales Netz) ist eine Architektur tiefer neuronaler Netze, die Bilddaten mit lernbaren Filtern abtastet und daraus schichtweise Merkmale von einfachen Kanten über Texturen bis zu vollständigen Objekten ableitet.
Funktionsweise: In den Faltungsschichten wandern kleine Filter über das Bild und berechnen an jeder Position eine Antwort. Da dieselben Filtergewichte überall gelten, benötigt ein CNN deutlich weniger Parameter als ein vollständig verbundenes Netz und erkennt Muster unabhängig von ihrer Position. Pooling-Schichten verringern die Auflösung, sodass tiefere Schichten größere Bildbereiche überblicken. Abgeleitete Architekturen wie U-Net, Fast R-CNN und Mask R-CNN setzen auf demselben Merkmalsextraktor auf und ergänzen ihn um Ausgabeköpfe für Segmentierung oder Objekterkennung.
Unternehmensbeispiel: Ein Zulieferer der Automobilindustrie prüft lackierte Oberflächen auf Einschlüsse und Kratzer. Ein auf allgemeinen Bilddaten vortrainiertes CNN wird mit einigen tausend Zeilenkamera-Aufnahmen aus der Fertigungslinie nachtrainiert und übernimmt die Vorsortierung der Prüfbilder; nur Grenzfälle gehen an die manuelle Sichtprüfung.
Anwendungsfelder:
- Bildklassifikation in der optischen Qualitätsprüfung
- Grundlage für Objekterkennung und Segmentierung
- Landbedeckungsklassifikation in der Fernerkundung
- Auswertung mikroskopischer Aufnahmen
- Analyse bildhaft dargestellter Sensordaten, etwa Spektrogramme
Verwandte Begriffe: Deep Learning, Bilderkennung, U-Net, Objekterkennung (Object Detection)
+ Conformal Prediction
Conformal Prediction ist ein statistisches Rahmenwerk zur Unsicherheitsquantifizierung, das die Punktvorhersagen beliebiger Machine-Learning-Modelle um Vorhersageintervalle bzw. Vorhersagemengen mit garantierter Abdeckung (Coverage) ergänzt. Die Garantie gilt verteilungsfrei; sie setzt lediglich voraus, dass Kalibrier- und Anwendungsdaten austauschbar sind.
Funktionsweise: Auf einem zurückgehaltenen Kalibrierdatensatz wird gemessen, wie stark die Modellvorhersagen typischerweise von den wahren Werten abweichen (Nonconformity-Scores). Aus der Verteilung dieser Scores wird ein Quantil bestimmt, das neue Vorhersagen zu Intervallen (Regression) oder Klassenmengen (Klassifizierung) erweitert. Bei einem Konfidenzniveau von 90 % enthalten die Intervalle den wahren Wert dann in mindestens 90 % der Fälle – unabhängig vom verwendeten Modell.
Unternehmensbeispiel: Ein Agrarunternehmen ergänzt seine Ertragsprognosen um Conformal-Prediction-Intervalle. Statt "7,2 t/ha" erhält die Einkaufsplanung "6,5 bis 7,9 t/ha mit 90 % Abdeckung" und kann Lager- und Logistikentscheidungen am Risiko ausrichten.
Anwendungsfelder:
- Verlässliche Unsicherheitsangaben für Prognosen in Planung und Einkauf
- Absicherung von Modellen in regulierten Bereichen (Pharma, Medizintechnik)
- Triage: unsichere Fälle automatisch an menschliche Experten weiterleiten
- Nachrüsten von Unsicherheitsangaben für bereits trainierte Modelle
Verwandte Begriffe: Statistischer Rückschluss, Maschinelles Lernen, Regression, Klassifizierung
+ Dagster
Dagster ist ein Open-Source-Orchestrierungswerkzeug für Datenplattformen, das nicht einzelne Tasks, sondern Datenbestände (Assets) in den Mittelpunkt stellt: Tabellen, Dateien und Modelle werden als deklarierte Assets mit Abhängigkeiten definiert und automatisch in der richtigen Reihenfolge aktualisiert.
Funktionsweise: Entwickler beschreiben in Python, welche Assets es gibt, woraus sie entstehen und wann sie als veraltet gelten. Dagster leitet daraus den Abhängigkeitsgraphen ab, plant Läufe (zeit- oder ereignisgesteuert), protokolliert jede Materialisierung und macht Datenherkunft (Lineage) und Aktualität in einer Web-Oberfläche sichtbar. Integrationen für dbt, Spark oder Cloud-Speicher sind bereits enthalten.
Unternehmensbeispiel: Ein Agrarunternehmen orchestriert mit Dagster seine tägliche Datenverarbeitung: Wetterdaten und Satellitenbilder werden eingelesen, zu Feldkennzahlen verrechnet und in Prognosemodelle gespeist. Schlägt ein Zwischenschritt fehl, zeigt Dagster genau, welche nachgelagerten Assets veraltet sind, und berechnet nur diese neu.
Anwendungsfelder:
- Orchestrierung von ETL- und ELT-Strecken
- Koordination von Modell-Trainings- und Feature-Pipelines
- Data-Lineage- und Aktualitäts-Monitoring
- Verwaltung heterogener Werkzeuge (dbt, Spark, Python) unter einer Oberfläche
Abgrenzung: Dagster orchestriert, wann und in welcher Reihenfolge Transformationen laufen; Werkzeuge wie dbt führen die Transformation selbst aus. In der Praxis steuert Dagster häufig dbt-Läufe.
Verwandte Begriffe: Datenpipeline, ETL (Extract, Transform, Load), dbt
+ Data Engineer
Data Engineers sind die Architekten der Dateninfrastruktur. Sie bauen, betreiben und optimieren die Datenpipelines, die Rohdaten aus verschiedenen Quellen erfassen, transformieren und für die Analyse bereitstellen. Ihre Arbeit bildet das Fundament, auf dem Data Scientists arbeiten können.
Funktionsweise: Data Engineers entwickeln und warten ETL-Prozesse (Extrahieren, Transformieren, Laden), implementieren Datenbanken und Data Warehouses, verwalten Cloud-Infrastrukturen und stellen sicher, dass Daten vollständig, korrekt und rechtzeitig verfügbar sind.
Unternehmensbeispiel: Ein Einzelhandelskonzern hat Verkaufsdaten in fünf verschiedenen regionalen Systemen. Der Data Engineer baut eine Pipeline, die diese Daten nächtlich zusammenführt, bereinigt und in ein zentrales Data Warehouse lädt – sodass das BI-Team morgens aktuelle, konsistente Daten vorfindet.
Kernaufgaben:
- Aufbau und Wartung von Datenpipelines
- Datenbereinigung und -transformation
- Implementierung und Verwaltung von Datenbanken
- Cloud-Plattform-Management (AWS, Azure, GCP)
- Sicherstellung von Datenqualität und -verfügbarkeit
- Entwicklung von APIs zur Datenbereitstellung
Abgrenzung: Data Engineers bauen die Infrastruktur, Data Scientists nutzen sie. Ein Data Scientist analysiert Daten und entwickelt Modelle – ein Data Engineer sorgt dafür, dass die richtigen Daten in der richtigen Qualität ankommen.
Verwandte Begriffe: Data Scientist, Data Warehouse, Datenpipeline
+ Data Governance
Data Governance umfasst die Regeln, Zuständigkeiten und Prozesse, mit denen ein Unternehmen Qualität, Sicherheit und Nutzbarkeit seiner Daten sicherstellt. Sie legt fest, wem welche Daten gehören, welche Qualitätsstandards gelten und wer worauf zugreifen darf – die Grundlage, auf die sich Analytik- und KI-Projekte verlassen können.
Funktionsweise: Data Governance benennt Verantwortliche je Datendomäne (Data Ownership), definiert Standards für Datenqualität, Zugriffsrechte und Aufbewahrung und verankert sie in Prozessen und Werkzeugen wie Datenkatalogen. Qualitätskennzahlen werden laufend gemessen; Änderungen an zentralen Datenbeständen folgen definierten Freigabewegen.
Unternehmensbeispiel: Ein Maschinenbauer will Sensordaten aus mehreren Werken für Predictive Maintenance nutzen. Erst nachdem einheitliche Signaldefinitionen, klare Verantwortlichkeiten und dokumentierte Qualitätsregeln stehen, werden die Datensätze vergleichbar – und die Modelle zuverlässig.
Anwendungsfelder:
- Datenqualitätsstandards für Analytik- und KI-Projekte
- Zugriffs- und Berechtigungskonzepte für sensible Daten
- Datenkataloge und Data Ownership
- Voraussetzung für Compliance (DSGVO, KI-Verordnung)
Abgrenzung: Data Governance setzt die Regeln; das Datenmanagement und Werkzeuge wie Data Warehouse oder Datenpipeline setzen sie um. AI Governance überträgt denselben Gedanken von den Daten auf KI-Systeme.
Verwandte Begriffe: AI Governance, Data Warehouse, Datenpipeline, Data Engineer
+ Data Lake / Datensee
Ein Data Lake ist ein zentraler Speicherort, in dem große Mengen an Rohdaten in ihrem ursprünglichen Format abgelegt werden – strukturiert, halbstrukturiert oder unstrukturiert. Anders als ein Data Warehouse erzwingt ein Data Lake keine vorher definierte Datenstruktur.
Funktionsweise: Daten werden zunächst unverändert gespeichert ("Schema on Read"). Die Struktur wird erst beim Lesen und Analysieren definiert – je nach Fragestellung. Moderne Data Lakes werden meist auf Cloud-Speichersystemen wie AWS S3, Azure Data Lake Storage oder Google Cloud Storage aufgebaut.
Unternehmensbeispiel: Ein Pharmaunternehmen speichert klinische Studiendaten, Laborergebnisse, Patientenakten und Sensordaten aus Produktionsanlagen in einem Data Lake. Je nach Analysebedarf – Wirksamkeit, Sicherheit oder Produktionseffizienz – werden unterschiedliche Teilmengen dieser Daten abgerufen und analysiert.
Vorteile:
- Maximale Flexibilität bei der Datenspeicherung
- Kostengünstig für sehr große Datenmengen
- Geeignet für explorative Analysen und Machine Learning
Nachteile:
- Ohne sorgfältige Verwaltung entsteht schnell ein unübersichtlicher "Data Swamp"
- Langsamere Abfragen als bei optimierten Data Warehouses
Abgrenzung: Ein Data Warehouse speichert strukturierte, bereits aufbereitete Daten für definierte Analysen. Ein Data Lake speichert alles – roh und unbearbeitet – für noch unbekannte, zukünftige Fragestellungen.
Verwandte Begriffe: Data Warehouse, Data Engineer, Unstrukturierte Daten
+ Data Scientist
Data Scientists verbinden statistische Expertise, Programmierkenntnisse und Domänenwissen, um aus großen Datenmengen verwertbare Erkenntnisse zu gewinnen. Sie entwickeln Modelle, die Muster in Daten erkennen und Vorhersagen ermöglichen.
Funktionsweise: Ein typisches Data-Science-Projekt folgt einem iterativen Prozess: Problemdefinition → Datenbeschaffung → Data Wrangling → Explorative Analyse → Modellentwicklung → Validierung → Deployment → Monitoring.
Unternehmensbeispiel: Ein Versicherungsunternehmen beauftragt einen Data Scientist, ein Modell zur Betrugserkennung zu entwickeln. Das Modell analysiert historische Schadensmeldungen, erkennt verdächtige Muster und markiert neue Fälle automatisch zur manuellen Prüfung – das entlastet die Sachbearbeitung spürbar.
Kernaufgaben:
- Explorative Datenanalyse (EDA)
- Entwicklung und Validierung von Machine-Learning-Modellen
- Statistische Auswertungen und Hypothesentests
- Kommunikation von Ergebnissen an nicht-technische Stakeholder
- Zusammenarbeit mit Data Engineers für den Produktiveinsatz
Abgrenzung: Ein Data Scientist entwickelt Modelle und gewinnt Erkenntnisse. Ein Data Engineer baut die Infrastruktur dafür. Ein BI-Analyst erstellt Berichte und Dashboards auf Basis bestehender Strukturen – ohne Modellentwicklung.
Verwandte Begriffe: Data Engineer, Maschinelles Lernen, Feature Engineering
+ Data Staging Area
Eine Data Staging Area ist ein temporärer Zwischenspeicher im ETL-Prozess. Hier werden Daten aus verschiedenen Quellsystemen gesammelt, bevor sie transformiert und in das Zielsystem (z. B. ein Data Warehouse) geladen werden.
Funktionsweise: Die Staging Area isoliert den Ladevorgang vom Produktivsystem. Rohdaten werden zunächst unverändert abgelegt, geprüft und erst nach erfolgreicher Validierung weiterverarbeitet. Bei Fehlern kann der Prozess ohne Auswirkungen auf das Zielsystem wiederholt werden.
Unternehmensbeispiel: Ein Anbieter von Fernerkundungsdiensten sammelt nachts die Szenen mehrerer Satellitenmissionen sowie Referenzmessungen aus dem Feld in einer Staging Area. Dort werden Kachelgrenzen, Aufnahmezeitpunkte und Koordinatenbezugssysteme geprüft; nur geprüfte Szenen gehen weiter in das Auswertungssystem. Als eine Mission zeitweise unvollständige Metadaten lieferte, blieb der Fehler in der Staging Area hängen, statt die bestehenden Zeitreihen zu beschädigen.
Vorteile:
- Höhere Datenqualität und -integrität
- Fehlertoleranz: Probleme werden abgefangen, bevor sie das Data Warehouse erreichen
- Ermöglicht schnelle Wiederholung fehlgeschlagener Ladevorgänge
Nachteile:
- Zusätzlicher Speicher- und Wartungsaufwand
- Erhöhte Komplexität der Datenpipeline
Verwandte Begriffe: Data Warehouse, Daten extrahieren, Data Engineer
+ Data Warehouse
Ein Data Warehouse ist eine zentrale, strukturierte Datenbank, die Daten aus verschiedenen Quellsystemen zusammenführt, vereinheitlicht und für Analysen und Berichte optimiert bereitstellt. Es ist das Herzstück vieler Business-Intelligence-Architekturen.
Funktionsweise: Daten werden über ETL-Prozesse aus operativen Systemen extrahiert, transformiert (vereinheitlicht, bereinigt) und in das Data Warehouse geladen. Die Datenstruktur wird im Voraus definiert ("Schema on Write"), was schnelle, konsistente Abfragen ermöglicht.
Unternehmensbeispiel: Ein Handelskonzern konsolidiert Verkaufsdaten aus 200 Filialen, dem Online-Shop und dem ERP-System in einem zentralen Data Warehouse. Das BI-Team kann damit regionsübergreifende Auswertungen auf Knopfdruck abrufen.
Gängige Lösungen:
- Cloud-basiert: AWS Redshift, Google BigQuery, Snowflake, Azure Synapse
- On-Premises: SAP BW, Oracle Exadata, IBM Db2 Warehouse
Abgrenzung: Ein Data Warehouse ist strukturiert und für bekannte Analysen optimiert. Ein Data Lake speichert Rohdaten flexibel für unbekannte, zukünftige Fragestellungen.
Verwandte Begriffe: Data Lake, Business Intelligence, ETL
+ Data Wrangling
Data Wrangling (auch: Data Munging) bezeichnet den Prozess der Bereinigung, Transformation und Vereinheitlichung von Rohdaten, um sie für die Analyse oder den Einsatz in Machine-Learning-Modellen nutzbar zu machen. In der Praxis entfällt auf diesen Schritt oft der größte Teil der Arbeitszeit eines Data Scientists.
Funktionsweise: Rohdaten aus der realen Welt sind selten sauber: Es fehlen Werte, Formate sind inkonsistent, Duplikate existieren, Einheiten stimmen nicht überein. Data Wrangling adressiert all das systematisch, bevor die eigentliche Analyse beginnt.
Typische Schritte:
- Zusammenführung von Daten aus verschiedenen Quellen
- Behandlung fehlender Werte (löschen, interpolieren, ersetzen)
- Entfernung von Duplikaten und Ausreißern
- Vereinheitlichung von Formaten (Datum, Währung, Schreibweise)
- Typ-Konvertierungen und Einheitenumrechnung
- Erstellung neuer, abgeleiteter Variablen
Unternehmensbeispiel: Ein Logistikunternehmen erfasst Lieferdaten aus drei Systemen in unterschiedlichen Formaten. Bevor Routen optimiert werden können, müssen Adressen normalisiert, fehlende Zeitstempel geschätzt und doppelte Einträge entfernt werden – das ist Data Wrangling.
Abgrenzung: Data Wrangling ist ein vorbereitender Schritt vor der eigentlichen Analyse. Es geht nicht darum, Erkenntnisse zu gewinnen, sondern darum, die Datenqualität sicherzustellen. "Garbage in, garbage out" – ohne sorgfältiges Wrangling sind alle nachgelagerten Analysen unzuverlässig.
Verwandte Begriffe: Data Engineer, Feature Engineering, Dateningestion
+ Dataiku
Dataiku ist eine kommerzielle End-to-End-Plattform für Data Science und Machine Learning, die Datenaufbereitung, Modellentwicklung, Deployment und Monitoring in einer gemeinsamen, kollaborativen Umgebung bündelt. Sie richtet sich sowohl an Data Scientists (Code) als auch an Fachanwender (visuelle Workflows).
Funktionsweise: Nutzer bauen in Dataiku sogenannte Flows: visuelle Datenpipelines aus Datenquellen, Aufbereitungsschritten (Recipes) und Modellen. Code-Schritte in Python, R oder SQL lassen sich mit No-Code-Bausteinen mischen; trainierte Modelle werden über die Plattform versioniert, bereitgestellt und überwacht.
Unternehmensbeispiel: Ein Pharmaunternehmen standardisiert seine Analytik-Projekte auf Dataiku: Laborteams bereiten Studiendaten visuell auf, während Data Scientists in derselben Umgebung Vorhersagemodelle in Python entwickeln. Governance-Funktionen dokumentieren, welche Daten und Modellversionen in welche Auswertung eingeflossen sind.
Anwendungsfelder:
- Kollaborative Data-Science-Projekte über Team- und Rollengrenzen hinweg
- Aufbau und Betrieb wiederkehrender Datenpipelines
- Modell-Deployment und -Monitoring (MLOps)
- Self-Service-Analytik für Fachabteilungen
Verwandte Begriffe: Maschinelles Lernen, MLOps, Datenpipeline
+ Daten extrahieren
Das Extrahieren von Daten ist der erste Schritt im ETL-Prozess. Dabei werden Daten aus einem oder mehreren Quellsystemen ausgelesen und für die weitere Verarbeitung bereitgestellt.
Funktionsweise: Die Extraktion muss die Quellsysteme möglichst wenig belasten (z. B. durch inkrementelle Extraktion – nur neue oder geänderte Datensätze werden geladen) und gleichzeitig Vollständigkeit sicherstellen.
Unternehmensbeispiel: Ein Pharmaunternehmen liest für sein Qualitätsreporting täglich Chargendaten aus dem ERP-System, Messreihen aus den Laborsystemen und Umgebungswerte der Reinräume aus. Damit der laufende Betrieb nicht ausgebremst wird, greift die Extraktion auf ein Replikat der Produktivdatenbank zu und überträgt nur die seit dem letzten Lauf geänderten Sätze.
Typische Quellen: Datenbanken, ERP-Systeme, Web-APIs, Log-Dateien, externe Datenfeeds.
Verwandte Begriffe: Daten transformieren, Daten laden, Datenpipeline
+ Daten laden
Das Laden ist der letzte Schritt im ETL-Prozess: Die transformierten Daten werden in das Zielsystem geschrieben – typischerweise ein Data Warehouse, eine Datenbank oder ein Data Lake.
Funktionsweise: Der Ladeschritt schreibt die aufbereiteten Daten in die Zielstruktur, etwa in die Faktentabellen eines Data Warehouse oder in das Dateilayout eines Data Lake. Schema, Schlüsselbeziehungen und Integritätsregeln des Zielsystems müssen dabei eingehalten werden; Ladevorgänge laufen deshalb in der Regel transaktional, sodass ein Abbruch keine halb gefüllten Tabellen hinterlässt. Große Mengen werden gebündelt geschrieben (Bulk Load) statt Datensatz für Datensatz – das ist um Größenordnungen schneller. Ebenso wichtig ist Wiederholbarkeit: Ein Ladelauf, der ein zweites Mal ausgeführt wird, darf keine Duplikate erzeugen.
Unternehmensbeispiel: Ein Maschinenbauunternehmen lädt jede Nacht die Produktionsdaten des Vortags aus der Fertigungssteuerung in sein Data Warehouse. Übertragen werden nicht alle Schichtprotokolle, sondern nur die seit dem letzten Lauf hinzugekommenen (Incremental Load); nachträglich korrigierte Prüfergebnisse aus der Qualitätssicherung überschreiben die bereits vorhandenen Datensätze (Upsert). Am Morgen liegen den Fachbereichen damit aktuelle Auswertungen vor.
Varianten:
- Full Load: Komplettes Neuschreiben aller Daten (einfach, aber ressourcenintensiv)
- Incremental Load: Nur neue oder geänderte Datensätze werden geladen (effizienter)
- Upsert: Neue Datensätze werden eingefügt, bestehende aktualisiert
Verwandte Begriffe: Daten extrahieren, Daten transformieren, Data Warehouse
+ Daten transformieren
Das Transformieren ist der zweite Schritt im ETL-Prozess: Rohdaten werden dabei in ein einheitliches, analysierbares Format gebracht.
Funktionsweise: Die Transformation steht zwischen Extraktion und Laden: Sie bringt Daten unterschiedlicher Herkunft auf ein gemeinsames Schema, gemeinsame Einheiten und gemeinsame Schlüssel. Die Regeln dafür werden einmal festgelegt und bei jedem Lauf identisch angewendet, damit Auswertungen über verschiedene Zeiträume hinweg vergleichbar bleiben. Ob die Transformation vor dem Laden stattfindet (ETL) oder erst im Zielsystem (ELT), hängt vor allem von dessen Rechenleistung ab – moderne Cloud-Data-Warehouses übernehmen den Schritt häufig selbst.
Unternehmensbeispiel: Ein landwirtschaftlicher Betrieb führt Ertragsdaten aus der Mähdrescher-Telemetrie, Bodenproben aus dem Labor und Wetterdaten eines externen Anbieters zusammen. In der Transformation werden die je Quelle unterschiedlichen Flächenbezeichnungen auf die interne Schlagnummer zurückgeführt, Erträge auf eine gemeinsame Einheit umgerechnet und Messwerte zu Tagesmitteln aggregiert. Erst danach lassen sich die drei Quellen gemeinsam auswerten.
Typische Transformationsschritte:
- Entfernung von Duplikaten und inkonsistenten Werten
- Vereinheitlichung von Formaten und Datentypen
- Anreicherung mit Daten aus anderen Quellen
- Aggregation (z. B. tägliche Summen aus einzelnen Transaktionen bilden)
- Berechnung abgeleiteter Kennzahlen
Verwandte Begriffe: Daten extrahieren, Daten laden, Data Wrangling
+ Dateningestion
Dateningestion beschreibt den ersten Schritt einer Datenpipeline: den Import von Daten aus verschiedenen Quellen in ein Zielsystem zur unmittelbaren Verarbeitung oder Speicherung.
Funktionsweise: Es wird zwischen Batch-Ingestion (Daten werden in regelmäßigen Abständen gesammelt, z. B. täglich) und Streaming-Ingestion (Daten werden kontinuierlich in Echtzeit übertragen) unterschieden. Während der Ingestion werden Daten auf Vollständigkeit und grundlegende Konsistenz geprüft.
Unternehmensbeispiel: Ein Betreiber von Windparks überträgt Messwerte aus mehreren tausend Sensoren kontinuierlich über ein Streaming-System in eine zentrale Plattform, während Wartungsberichte und Abrechnungsdaten einmal täglich als Dateien übernommen werden. Beide Wege prüfen beim Eintreffen lediglich, ob Zeitstempel und Anlagenkennung vorhanden sind; die inhaltliche Aufbereitung folgt in späteren Schritten der Pipeline.
Typische Quellen:
- Relationale Datenbanken (SQL)
- REST-APIs und Webservices
- Dateibasierte Quellen (CSV, JSON, Parquet)
- Streaming-Systeme (Kafka, Kinesis)
- IoT-Sensoren und Gerätedaten
Abgrenzung: Dateningestion ist der Einstiegspunkt der Datenpipeline – noch vor dem Data Wrangling. Sie überträgt Daten, verändert sie aber möglichst nicht.
Verwandte Begriffe: Datenpipeline, Data Wrangling, ETL
+ Datenpipeline
Eine Datenpipeline ist ein automatisierter Prozess, der Daten von einer oder mehreren Quellen erfasst, transformiert und in ein Zielsystem überführt. Sie ist die technische Infrastruktur, auf der datengetriebene Anwendungen basieren.
Funktionsweise: Eine Pipeline besteht aus einer Abfolge von Schritten: Daten werden extrahiert (z. B. aus einer API oder Datenbank), transformiert (bereinigt, angereichert, aggregiert) und geladen (in ein Data Warehouse, einen Data Lake oder direkt in eine Anwendung). Moderne Pipelines sind event-getrieben oder zeitgesteuert und laufen vollautomatisch.
Unternehmensbeispiel: Ein FinTech-Unternehmen hat eine Echtzeit-Datenpipeline, die Transaktionsdaten in unter einer Sekunde auf Betrugsanzeichen prüft und bei Verdacht automatisch eine Benachrichtigung auslöst.
Anwendungsfelder:
- Echtzeit-Analysen (Streaming-Pipelines)
- Nächtliche Batch-Verarbeitung für BI-Systeme
- ML-Feature-Pipelines für Modelltraining und -inferenz
Abgrenzung: Eine Datenpipeline ist der Transportweg der Daten. ETL ist das Muster, nach dem viele Pipelines aufgebaut sind. Ein Data Warehouse ist das Zielsystem, das eine Pipeline häufig beliefert.
Verwandte Begriffe: Data Engineer, ETL, Data Lake
+ Datenwissenschaft (Data Science)
Datenwissenschaft ist ein interdisziplinäres Feld, das Methoden aus Statistik, Informatik und Domänenwissen kombiniert, um aus Daten Erkenntnisse zu gewinnen und datengetriebene Entscheidungen zu ermöglichen. Sie verbindet Theorie und Praxis: von der Datenerhebung über die Modellentwicklung bis zur Kommunikation von Ergebnissen.
Funktionsweise: Am Anfang steht eine fachliche Fragestellung, die in eine analytische Aufgabe übersetzt wird – etwa eine Prognose, eine Klassifizierung oder das Aufdecken von Zusammenhängen. Danach werden die benötigten Daten erschlossen, bereinigt und in aussagekräftige Merkmale überführt (Feature Engineering). Auf dieser Grundlage werden Modelle trainiert, an zurückgehaltenen Daten getestet und gemeinsam mit dem Fachbereich validiert. Der Ablauf ist iterativ: Was eine Runde zeigt, verändert die Fragestellung, die Datenbasis oder die Modellwahl für die nächste.
Kernbereiche:
- Statistische Analyse und Wahrscheinlichkeitsrechnung
- Machine Learning und Modellierung
- Data Wrangling und Datenaufbereitung
- Datenvisualisierung und Storytelling
- Deployment und Monitoring von Modellen (MLOps)
Unternehmensbeispiel: Ein Krankenhaus setzt Data Science ein, um Wiederaufnahmeraten zu senken: Modelle analysieren Patientendaten, um Risikopatienten frühzeitig zu identifizieren und gezielt in die Nachsorge zu übernehmen.
Abgrenzung: Data Science ist breiter als Business Intelligence (das primär historische Daten auswertet) und breiter als Machine Learning allein (das nur einen Teilbereich der eingesetzten Methoden umfasst). Data Science schließt den gesamten Prozess von der Frage bis zur Entscheidung ein.
Verwandte Begriffe: Data Scientist, Maschinelles Lernen, Business Intelligence
+ dbt
dbt (data build tool) ist ein Open-Source-Werkzeug für die Transformation von Daten direkt im Data Warehouse: Transformationslogik wird als versionierte SQL-Modelle definiert, die dbt in der richtigen Abhängigkeitsreihenfolge ausführt, testet und dokumentiert. Neben dem Open-Source-Kern (dbt Core) existiert der kommerzielle Cloud-Dienst des Herstellers dbt Labs.
Funktionsweise: Jedes dbt-Modell ist eine SELECT-Anweisung, die eine Tabelle oder View im Data Warehouse erzeugt. Modelle referenzieren einander, woraus dbt den Abhängigkeitsgraphen ableitet. Eingebaute Tests (z. B. Eindeutigkeit, Nicht-Null, referenzielle Integrität) prüfen die Ergebnisse bei jedem Lauf; Dokumentation und Lineage werden aus dem Code generiert.
Unternehmensbeispiel: Ein Pharmaunternehmen führt Vertriebs-, Produktions- und Qualitätsdaten in einem Cloud-Warehouse zusammen. Mit dbt definiert das Datenteam daraus geprüfte Kennzahlentabellen; jede Änderung an der Logik durchläuft Code-Review und automatisierte Tests, bevor sie die Berichte der Fachbereiche erreicht.
Anwendungsfelder:
- Aufbau geprüfter Kennzahlen- und Berichtsschichten im Warehouse
- ELT-Strecken: Transformation nach dem Laden der Rohdaten
- Datenqualitätstests und automatisch generierte Dokumentation
- Versionierte, per CI/CD ausgelieferte Transformationslogik
Abgrenzung: dbt übernimmt nur das "T" in ETL/ELT – Extraktion und Laden erledigen andere Werkzeuge; die Ablaufsteuerung übernimmt oft ein Orchestrator wie Dagster.
Verwandte Begriffe: SQL, Data Warehouse, ETL (Extract, Transform, Load), Dagster
+ Deep Learning
Deep Learning (auch: tiefes Lernen) ist ein Teilbereich des maschinellen Lernens, der auf mehrschichtigen neuronalen Netzwerken basiert. Durch die große Zahl an Schichten können diese Modelle extrem komplexe Muster und Repräsentationen erlernen – ohne manuelle Feature-Engineering-Schritte.
Funktionsweise: Jede Schicht des Netzwerks lernt zunehmend abstrakte Repräsentationen der Eingabedaten. Bei der Bilderkennung etwa: Schicht 1 erkennt Kanten, Schicht 2 Formen, Schicht 5 Gesichter. Training erfordert große Datenmengen und erhebliche Rechenleistung (typischerweise GPUs).
Unternehmensbeispiel: Ein Radiologe wird von einem Deep-Learning-Modell unterstützt, das auf Millionen von Röntgenbildern trainiert wurde und Anomalien in neuen Aufnahmen mit hoher Genauigkeit markiert – als zweite Meinung, nicht als Ersatz.
Wichtige Architekturen:
- Convolutional Neural Networks (CNN): Bilderkennung
- Recurrent Neural Networks (RNN / LSTM): Zeitreihen, Text
- Transformer: NLP, LLMs
- Generative Adversarial Networks (GAN): Bildsynthese
Abgrenzung: Deep Learning ist eine Untermenge des maschinellen Lernens, die speziell auf tiefe neuronale Netzwerke setzt. Klassisches ML (z. B. Random Forest, lineare Regression) benötigt weder tiefe Netzwerke noch zwingend große Datensätze.
Verwandte Begriffe: Neuronales Netzwerk, Maschinelles Lernen, Transformer-Architektur
+ Deskriptive Analytik
Die deskriptive Analytik beantwortet die Frage: "Was ist passiert?" Sie analysiert historische Daten und fasst sie in verständlichen Berichten, Kennzahlen und Visualisierungen zusammen.
Funktionsweise: Auf Basis von Datenaggregation und statistischen Kennzahlen (Mittelwert, Median, Verteilungen) werden Trends, Muster und Anomalien sichtbar gemacht – häufig in Dashboards oder standardisierten Berichten.
Unternehmensbeispiel: Ein Einzelhändler analysiert die vergangene Weihnachtssaison: Welche Produkte haben sich am besten verkauft? In welchen Regionen? Welche Rabattaktionen haben den Umsatz am stärksten gesteigert?
Typische Visualisierungen:
- Balken- und Liniendiagramme
- Heatmaps und geografische Karten
- Pivot-Tabellen und KPI-Kacheln
Abgrenzung: Deskriptive Analytik schaut zurück. Prädiktive Analytik schaut voraus. Präskriptive Analytik empfiehlt Handlungen.
Verwandte Begriffe: Business Intelligence, Prädiktive Analytik, Präskriptive Analytik
+ Dimensionsreduktion (Dimensionality Reduction)
Dimensionsreduktion (Dimensionality Reduction) bezeichnet Verfahren, die die Anzahl der Merkmale eines Datensatzes verringern und dabei die wesentliche Information möglichst erhalten. Sie macht hochdimensionale Daten visualisierbar, beschleunigt das Modell-Training und mindert Probleme wie den "Fluch der Dimensionalität".
Funktionsweise: Lineare Verfahren wie die Hauptkomponentenanalyse (PCA) projizieren die Daten auf wenige Achsen maximaler Varianz. Nichtlineare Verfahren wie t-SNE und UMAP erhalten lokale Nachbarschaften und eignen sich besonders für die 2D-Visualisierung; Autoencoder lernen komprimierte Repräsentationen über neuronale Netze. Alternativ wählt Feature Selection eine Teilmenge der Originalmerkmale aus, statt neue zu konstruieren.
Unternehmensbeispiel: Ein Pharmaunternehmen analysiert Genexpressionsdaten mit über 20.000 Merkmalen pro Probe. Nach einer PCA auf wenige Dutzend Komponenten werden Probengruppen im Clustering sichtbar, und nachgelagerte Modelle trainieren schneller und stabiler.
Anwendungsfelder:
- Visualisierung hochdimensionaler Daten (Omics, Spektren, Sensorik)
- Vorverarbeitung vor Clustering und Klassifizierung
- Rauschunterdrückung und Datenkompression
- Beschleunigung von Training und Inferenz
Abgrenzung: Feature Engineering erzeugt gezielt neue, fachlich motivierte Merkmale; Dimensionsreduktion verdichtet vorhandene Merkmale datengetrieben. Beides wird oft kombiniert.
Verwandte Begriffe: Unüberwachtes Lernen, Clustering, Feature Engineering, Self-Organizing Map (SOM)
+ Edge AI
Edge AI bezeichnet den Betrieb von KI-Modellen direkt auf Geräten im Feld – Maschinensteuerungen, Kameras, Fahrzeugen oder Industrie-PCs – statt in der Cloud. Die Daten werden dort ausgewertet, wo sie entstehen.
Funktionsweise: Das Modell wird zentral trainiert (Cloud oder Rechenzentrum) und anschließend für die Zielhardware optimiert: durch Quantisierung und Pruning verkleinert und in ein laufzeitoptimiertes Format überführt. Die Inferenz läuft danach lokal mit geringer Latenz, funktioniert ohne stabile Internetverbindung – und Rohdaten verlassen das Gerät nicht.
Unternehmensbeispiel: Ein Zulieferer prüft Bauteile direkt in der Fertigungslinie: Kamera und Industrie-PC bewerten jedes Teil innerhalb der Taktzeit. Die Entscheidung fällt in Millisekunden auf dem Gerät – kein Bild muss in die Cloud übertragen werden.
Anwendungsfelder:
- Visuelle Qualitätsprüfung im Produktionstakt
- Zustandsüberwachung von Maschinen und Fahrzeugen
- Autonome mobile Maschinen (z. B. Landtechnik)
- Datenschutzkritische Auswertungen, bei denen Daten vor Ort bleiben müssen
Abgrenzung: Bei Cloud-KI wandern die Daten zu einem zentralen Dienst, der das Ergebnis zurückliefert – flexibel, aber abhängig von Bandbreite und Latenz. Edge AI tauscht diese Flexibilität gegen Geschwindigkeit, Autonomie und Datenhoheit; oft werden beide kombiniert (Training in der Cloud, Inferenz am Gerät).
Verwandte Begriffe: Bilderkennung, Industrie 4.0, Predictive Maintenance, CNN (Convolutional Neural Network)
+ Elastic Stack
Der Elastic Stack ist eine Software-Suite des Herstellers Elastic rund um die Suchmaschine Elasticsearch, ergänzt um Kibana (Visualisierung), Logstash und Beats (Datensammlung), zur Speicherung, Durchsuchung und Analyse großer Text-, Log- und Ereignisdatenmengen. Die Kernkomponenten sind quelloffen verfügbar, erweiterte Funktionen kommerziell lizenziert.
Funktionsweise: Elasticsearch legt Dokumente in invertierten Indizes ab und beantwortet Volltext- und Aggregationsabfragen nahezu in Echtzeit, auch über verteilte Cluster hinweg. Logstash und Beats übernehmen die Dateningestion aus Logdateien, Datenbanken oder Sensoren; Kibana stellt die Ergebnisse in interaktiven Dashboards dar.
Unternehmensbeispiel: Ein Maschinenbauunternehmen führt die Logdaten seiner Fertigungsanlagen im Elastic Stack zusammen. Instandhalter durchsuchen Fehlermeldungen über alle Linien hinweg und erkennen in Kibana-Dashboards, welche Störungsmuster sich häufen, bevor es zu Stillständen kommt.
Anwendungsfelder:
- Log- und Ereignisanalyse (Observability) für IT und Produktion
- Volltextsuche in Dokumentenarchiven und Produktkatalogen
- Security-Monitoring (SIEM)
- Monitoring-Dashboards für Sensor- und Zeitreihendaten
Verwandte Begriffe: Unstrukturierte Daten, Dateningestion, Text Mining
+ Embedding / Vektordarstellung
Ein Embedding ist eine numerische Darstellung von Objekten – typischerweise Text, Bilder oder andere Daten – als Vektor in einem hochdimensionalen Raum. Ähnliche Objekte liegen dabei nah beieinander, unähnliche weiter voneinander entfernt.
Funktionsweise: Ein Embedding-Modell (z. B. Word2Vec, BERT oder text-embedding-3 von OpenAI) verarbeitet einen Eingabewert und gibt einen Zahlenvektor zurück – z. B. 1536 Zahlen für einen Text. Dieser Vektor kodiert die semantische Bedeutung. Wenn "König" minus "Mann" plus "Frau" ungefähr "Königin" ergibt – dann funktionieren Embeddings.
Unternehmensbeispiel: Ein Kundenservice-System speichert alle bisherigen Supportanfragen als Embeddings. Kommt eine neue Anfrage herein, findet das System sofort die semantisch ähnlichsten alten Anfragen und schlägt bewährte Antworten vor.
Anwendungsfelder:
- Semantische Suche (Suche nach Bedeutung, nicht nur Stichwörtern)
- Empfehlungssysteme
- Duplikaterkennung in großen Textmengen
- Grundlage für RAG-Systeme
- Ähnlichkeitsanalysen in Produktkatalogen
Abgrenzung: Ein Embedding ist keine Klassifizierung – es ordnet nichts einer Kategorie zu, sondern repräsentiert Objekte als Punkt in einem semantischen Raum. Erst durch Vergleich von Embeddings (z. B. via Kosinus-Ähnlichkeit) entstehen Aussagen über Ähnlichkeit.
Verwandte Begriffe: Large Language Model, RAG, Tokenisierung
+ ETL (Extract, Transform, Load)
ETL (Extract, Transform, Load) bezeichnet ein Grundmuster der Datenintegration, bei dem Daten aus Quellsystemen extrahiert, in ein Zielschema transformiert und anschließend in ein Zielsystem wie ein Data Warehouse geladen werden. Es ist seit Jahrzehnten der Standardansatz, um verstreute Betriebsdaten analysierbar zusammenzuführen.
Funktionsweise:
- Extract: Daten aus Quellen wie ERP-Systemen, Datenbanken, Dateien oder APIs auslesen (Daten extrahieren).
- Transform: Bereinigen, vereinheitlichen, anreichern und in das Zielschema überführen (Daten transformieren).
- Load: Das Ergebnis in das Zielsystem schreiben (Daten laden), meist zeitgesteuert oder inkrementell.
Unternehmensbeispiel: Ein Pharmaunternehmen führt nächtlich Daten aus Produktionsanlagen, Laborsystemen und dem ERP per ETL-Strecke in ein zentrales Warehouse über. Erst dort lassen sich Chargenqualität, Anlagenauslastung und Lieferdaten gemeinsam auswerten.
Anwendungsfelder:
- Befüllung von Data Warehouses und Reporting-Schichten
- Zusammenführung heterogener Quellsysteme nach Fusionen oder Systemwechseln
- Aufbereitung von Trainingsdaten für Machine-Learning-Modelle
- Migration von Altsystemen
Abgrenzung: Beim jüngeren ELT-Muster werden Rohdaten zuerst geladen und erst im Zielsystem transformiert (z. B. mit dbt) – sinnvoll, wenn das Warehouse genug Rechenleistung mitbringt.
Verwandte Begriffe: Daten extrahieren, Daten transformieren, Daten laden, Datenpipeline
+ Explainable AI (XAI)
Explainable AI (XAI, dt. erklärbare KI) ist ein Teilgebiet der künstlichen Intelligenz, das Methoden bereitstellt, um die Entscheidungen von Machine-Learning-Modellen für Menschen nachvollziehbar zu machen. XAI ist der Oberbegriff für konkrete Erklärungsverfahren wie SHAP und LIME.
Funktionsweise: Zwei Wege führen zu erklärbaren Systemen: Entweder werden von vornherein interpretierbare Modelle eingesetzt (etwa Logistische Regression oder Entscheidungsbäume), oder komplexe Modelle wie Deep Learning-Netze werden nachträglich (post-hoc) erklärt – lokal für einzelne Vorhersagen oder global für das Gesamtverhalten. Typische Werkzeuge sind Merkmalsbeiträge, Surrogatmodelle, Partial-Dependence-Analysen und Saliency Maps für Bilder.
Unternehmensbeispiel: Ein Medizintechnikhersteller muss gegenüber der benannten Stelle belegen, wie sein Diagnose-Unterstützungsmodell zu Empfehlungen kommt. Mit XAI-Verfahren dokumentiert das Team die maßgeblichen Einflussfaktoren je Empfehlung und erfüllt so die Transparenzanforderungen.
Anwendungsfelder:
- Regulatorische Anforderungen (EU AI Act, Medizinprodukte, Finanzwesen)
- Akzeptanz von KI-Systemen bei Fachanwendern
- Modell-Debugging und Aufdecken von Verzerrungen (Bias)
- Wissenschaftliche Erkenntnis: Was hat das Modell gelernt?
Verwandte Begriffe: SHAP (SHapley Additive exPlanations), LIME (Local Interpretable Model-agnostic Explanations), Künstliche Intelligenz (KI), Deep Learning
+ Fast R-CNN
Fast R-CNN ist ein regionenbasiertes Verfahren zur Objekterkennung, das ein Bild einmal durch ein Convolutional Neural Network schickt und alle Objektvorschläge anschließend auf der gemeinsam genutzten Merkmalskarte auswertet.
Funktionsweise: Das ältere R-CNN führte für jeden Objektvorschlag einen eigenen Netzdurchlauf aus und war entsprechend langsam. Fast R-CNN kehrt die Reihenfolge um: Zuerst entsteht eine Merkmalskarte des gesamten Bildes, dann schneidet RoI-Pooling für jeden Objektvorschlag einen Bereich fester Größe heraus. Zwei Ausgabeköpfe bestimmen daraus Klasse und korrigierte Boxkoordinaten, beide werden gemeinsam trainiert. Die Objektvorschläge selbst stammen noch aus einem vorgelagerten Verfahren; erst der Nachfolger Faster R-CNN integriert diesen Schritt als Region Proposal Network in das Netz.
Unternehmensbeispiel: Ein Industrieunternehmen erkennt auf Prüfstandsaufnahmen mehrere Bauteiltypen gleichzeitig und protokolliert deren Position im Bild. Die zweistufige Architektur liefert dabei auch bei teilweise verdeckten Teilen zuverlässige Ergebnisse.
Anwendungsfelder:
- Objekterkennung mit Bounding Boxes
- Grundlage der Instanzsegmentierung mit Mask R-CNN
- Vergleichsmaßstab bei der Modellauswahl
- Erkennungsaufgaben mit wenigen, klar abgegrenzten Objektklassen
Abgrenzung: Zweistufige Detektoren dieser Familie galten lange als genauer, aber langsamer als einstufige Verfahren wie YOLO oder SSD. Für Echtzeitanwendungen fällt die Wahl meist auf ein einstufiges Modell.
Verwandte Begriffe: Objekterkennung (Object Detection), Mask R-CNN, CNN (Convolutional Neural Network), Bilderkennung
+ FASTQ
FASTQ ist ein textbasiertes Dateiformat der DNA-Sequenzierung, das für jeden gelesenen Sequenzabschnitt sowohl die Abfolge der Basen als auch einen Qualitätswert je Base speichert.
Funktionsweise: Ein Eintrag umfasst vier Zeilen: eine Kennung, die Basenabfolge, eine Trennzeile und eine Zeichenkette, deren Zeichen die Qualitätswerte der einzelnen Basen kodieren. Diese Werte geben die geschätzte Fehlerwahrscheinlichkeit der jeweiligen Base an und stammen aus dem Sequenziergerät. Da ein einzelner Lauf leicht mehrere Hundert Millionen Reads erzeugt, liegen die Dateien komprimiert vor und erreichen dennoch mehrere Gigabyte. In der Auswertung folgen zunächst Qualitätskontrolle und das Abschneiden schlechter Endbereiche, danach das Alignment gegen eine Referenz oder die De-novo-Assemblierung.
Unternehmensbeispiel: Ein Life-Science-Unternehmen erhält täglich Sequenzierläufe von einem externen Dienstleister. Eine Datenpipeline prüft die Qualitätswerte automatisch, verwirft unbrauchbare Reads und übergibt die bereinigten Daten an die nachgelagerte Analyse, unter anderem an BLAST.
Anwendungsfelder:
- Austauschformat für Rohdaten aus der Sequenzierung
- Qualitätskontrolle und Filterung von Reads
- Eingangsformat bioinformatischer Auswertungspipelines
- Archivierung und Nachvollziehbarkeit von Sequenzierläufen
- Metagenomik und Mikrobiomanalysen
Abgrenzung: Das ältere FASTA-Format speichert nur die Sequenz selbst. FASTQ ergänzt sie um die Qualitätswerte, die für eine belastbare Filterung der Rohdaten benötigt werden.
Verwandte Begriffe: BLAST (Basic Local Alignment Search Tool), Datenpipeline, Unstrukturierte Daten
+ Feature Engineering
Feature Engineering bezeichnet den Prozess, aus Rohdaten die relevantesten und informativsten Merkmale (Features) für ein Machine-Learning-Modell zu extrahieren, zu transformieren oder neu zu erzeugen. Gutes Feature Engineering ist oft entscheidender für die Modellgüte als die Wahl des Algorithmus.
Funktionsweise: Ein Feature ist eine einzelne messbare Eigenschaft eines Datenpunkts. Aus einem Transaktions-Zeitstempel lassen sich z. B. Wochentag, Uhrzeit, Tage seit dem letzten Kauf und Jahreszeit ableiten – alles potenziell informative Features. Feature Selection wählt dann die relevantesten aus, um Overfitting zu vermeiden.
Unternehmensbeispiel: Für ein Kreditrisiko-Modell sind die Rohdaten (Kontonummer, Geburtsdatum, Transaktionen) wenig aussagekräftig. Feature Engineering erzeugt daraus: durchschnittliches Monatseinkommen, Volatilität der Ausgaben, Anzahl Zahlungsausfälle in den letzten 12 Monaten – Features, die das Modell tatsächlich nutzen kann.
Wichtige Techniken:
- Normalisierung und Standardisierung numerischer Werte
- One-Hot-Encoding kategorischer Variablen
- Zeitbasierte Features aus Zeitstempeln ableiten
- Interaktions-Features (Produkt oder Verhältnis zweier Features)
- Dimensionsreduktion (PCA)
Abgrenzung: Feature Engineering ist manuell und domänenwissensgetrieben. Deep-Learning-Modelle können viele Features automatisch erlernen (automatisches Feature Learning) – was manuelles Feature Engineering in manchen Bereichen verdrängt, aber nicht überall ersetzt.
Verwandte Begriffe: Data Wrangling, Maschinelles Lernen, Überwachtes Lernen
+ Fernerkundung (Remote Sensing)
Fernerkundung ist die Erfassung von Informationen über die Erdoberfläche mit Sensoren, die sich nicht in direktem Kontakt mit dem Messobjekt befinden – typischerweise auf Satelliten, Flugzeugen oder Drohnen. Die Sensoren zeichnen reflektierte oder emittierte Strahlung in mehreren Wellenlängenbereichen auf, aus der sich Eigenschaften von Boden, Vegetation, Wasser und Bebauung ableiten lassen.
Funktionsweise:
- Aufnahme: optische, multispektrale, hyperspektrale, thermale oder Radarsensoren erfassen die Szene, LiDAR-Systeme zusätzlich die Höhe.
- Vorverarbeitung: geometrische Entzerrung, Atmosphärenkorrektur und Kalibrierung auf physikalische Reflexionswerte.
- Auswertung: Berechnung von Indizes wie NDVI (Normalized Difference Vegetation Index) oder Klassifikation der Bildpunkte, zunehmend mit Deep Learning-Modellen.
- Ausgabe: Karten, Zeitreihen oder Flächenstatistiken für die weitere Analyse.
Unternehmensbeispiel: Ein Agrarhandelsunternehmen wertet frei verfügbare Sentinel-2-Aufnahmen für alle Vertragsflächen einer Region aus. Aus dem Verlauf der Vegetationsindizes über die Saison entstehen Karten des Bestandszustands, die den Feldberatern zeigen, welche Schläge vorrangig kontrolliert werden sollten.
Anwendungsfelder:
- Zustands- und Ertragsmonitoring landwirtschaftlicher Flächen
- Landnutzungs- und Landbedeckungsklassifikation
- Forst-, Gewässer- und Umweltmonitoring
- Erkennung von Bauwerken und Infrastrukturänderungen
- Schadens- und Risikobewertung nach Extremwetterereignissen
Verwandte Begriffe: NDVI (Normalized Difference Vegetation Index), Bildsegmentierung (Image Segmentation), ArcGIS, Punktwolke (Point Cloud)
+ Fine-Tuning
Fine-Tuning bezeichnet den Prozess, ein vortrainiertes Modell – z. B. ein Large Language Model – auf einem spezifischen, kleineren Datensatz weiterzutrainieren, um es an eine bestimmte Aufgabe oder Domäne anzupassen.
Funktionsweise: Ein vortrainiertes Modell hat bereits ein breites Allgemeinwissen. Beim Fine-Tuning wird dieses Modell mit domänenspezifischen Beispielen (z. B. interne Dokumente, spezifische Schreibstile, Fachterminologie) weiter optimiert. Das Modell behält sein Grundwissen weitgehend, lernt aber die spezifischen Anforderungen der neuen Aufgabe.
Unternehmensbeispiel: Ein Pharmaunternehmen nimmt ein allgemeines Sprachmodell und führt Fine-Tuning mit internen Forschungsberichten durch. Das resultierende Modell beantwortet Fragen zu internen Studien präziser und nutzt die unternehmenseigene Fachsprache korrekt.
Varianten:
- Full Fine-Tuning: Alle Modellparameter werden angepasst (aufwendig, teuer)
- Parameter-Efficient Fine-Tuning (PEFT): Nur ein kleiner Teil der Parameter wird angepasst (z. B. LoRA – effizienter und kostengünstiger)
- Instruction Tuning: Das Modell wird trainiert, Anweisungen besser zu folgen
- RLHF (Reinforcement Learning from Human Feedback): Das Modell wird anhand menschlicher Bewertungen optimiert
Abgrenzung: Fine-Tuning verändert das Modell selbst. Prompt Engineering verändert nur die Eingabe – das Modell bleibt unverändert. RAG reichert die Eingabe mit externem Wissen an, ohne das Modell zu verändern.
Verwandte Begriffe: Large Language Model, Prompt Engineering, Transfer Learning
+ Gauß-Prozess (Gaussian Process)
Ein Gauß-Prozess ist ein statistisches Modellierungsverfahren, das zu jeder Vorhersage auch deren Unsicherheit liefert. Statt einer einzelnen Funktion beschreibt es eine Wahrscheinlichkeitsverteilung über plausible Funktionen – und eignet sich damit besonders für kleine, teuer zu gewinnende Datensätze.
Funktionsweise: Grundlage ist eine Kernfunktion, die festlegt, wie ähnlich sich Vorhersagen an benachbarten Eingabepunkten sein sollen. Aus den Trainingspunkten ergibt sich für jeden neuen Punkt eine Normalverteilung: Der Mittelwert ist die Vorhersage, die Streuung das Vertrauensintervall. In der Nähe von Messpunkten ist das Modell sicher, weit entfernt wird es ehrlich unsicher – diese Eigenschaft macht Gauß-Prozesse zum Standardwerkzeug der bayesschen Optimierung und für Surrogate Models.
Unternehmensbeispiel: Ein Entwicklungsteam kalibriert einen Motorprüfstand mit nur 60 teuren Versuchsläufen. Ein Gauß-Prozess sagt das Kennfeld zwischen den Messpunkten vorher und zeigt zugleich, wo die Unsicherheit am größten ist – dort wird der nächste Versuch platziert, was die Zahl der nötigen Prüfläufe deutlich senkt.
Anwendungsfelder:
- Surrogatmodelle für teure Simulationen und Versuche
- Bayessche Optimierung von Prozess- und Konstruktionsparametern
- Kalibrierung von Sensoren und Prüfständen
- Interpolation räumlicher Messdaten (Kriging)
Abgrenzung: Ein Neuronales Netzwerk braucht viele Datenpunkte und liefert standardmäßig keine Unsicherheitsangabe; ein Gauß-Prozess glänzt bei wenigen Datenpunkten, skaliert aber schlecht auf sehr große Datensätze.
Verwandte Begriffe: Surrogate Model (Ersatzmodell), Regression, Statistischer Rückschluss, Conformal Prediction
+ Gekachelte Inferenz (Tiled Inference)
Gekachelte Inferenz (Tiled Inference) ist ein Verfahren, bei dem sehr große Bilder für die Modellanwendung in überlappende Kacheln zerlegt, kachelweise verarbeitet und die Einzelergebnisse anschließend wieder zu einem Gesamtergebnis zusammengesetzt werden.
Funktionsweise:
- Das Bild wird in Kacheln der Größe zerlegt, für die das Modell trainiert wurde; benachbarte Kacheln überlappen sich an den Rändern. Ohne diese Überlappung werden Objekte an den Kachelgrenzen zerschnitten und doppelt oder gar nicht erkannt.
- Das Modell verarbeitet die Kacheln einzeln oder als Stapel, wodurch der Grafikspeicherbedarf unabhängig von der Bildgröße konstant bleibt.
- Die Teilergebnisse werden zusammengeführt: Segmentierungsmasken werden im Überlappungsbereich verrechnet, Bounding Boxes per Non-Maximum Suppression von Dubletten befreit.
- Die Koordinaten werden in das Gesamtbild und, bei Geodaten, in das Referenzsystem zurückgerechnet.
Unternehmensbeispiel: Ein Geodatendienstleister wertet Satellitenszenen mit einer Kantenlänge von mehreren zehntausend Bildpunkten aus. Statt die Szene herunterzuskalieren und dabei kleine Strukturen zu verlieren, läuft die Segmentierung gekachelt in voller Auflösung durch.
Anwendungsfelder:
- Auswertung von Satelliten- und Luftbildern
- Whole-Slide-Aufnahmen in Pathologie und Mikroskopie
- Hochauflösende Inspektionsaufnahmen in der Fertigung
- Orthomosaike aus Drohnenbefliegungen
Verwandte Begriffe: Bildsegmentierung (Image Segmentation), Objekterkennung (Object Detection), Fernerkundung (Remote Sensing), U-Net
+ Generative KI
Generative KI bezeichnet KI-Systeme, die neue Inhalte erzeugen können – Texte, Bilder, Audio, Video, Code oder synthetische Daten. Im Gegensatz zu klassischen KI-Modellen, die Daten nur klassifizieren oder vorhersagen, bringen generative Modelle eigenständige Ausgaben hervor.
Funktionsweise: Generative Modelle lernen die statistische Struktur ihrer Trainingsdaten so gut, dass sie neue Daten erzeugen können, die dieser Struktur entsprechen. Die bekanntesten Architekturen sind Transformer-basierte Large Language Models für Text sowie Diffusionsmodelle für Bilder (z. B. Stable Diffusion, DALL·E).
Unternehmensbeispiel: Ein Marketingteam nutzt generative KI, um in Minuten Dutzende Textvarianten für A/B-Tests zu erstellen. Ein Softwareunternehmen beschleunigt die Code-Entwicklung, indem Entwickler Codeschnipsel per natürlichsprachiger Anfrage generieren lassen.
Anwendungsfelder:
- Texterstellung und -zusammenfassung
- Code-Generierung und -Vervollständigung
- Bild- und Videosynthese
- Synthese von Trainingsdaten für andere Modelle
- Automatisierte Berichterstellung
- Personalisierte Kundenkommunikation
Abgrenzung: Klassische KI erkennt und klassifiziert (z. B. "Ist das Spam?"). Generative KI erschafft (z. B. "Schreibe eine E-Mail"). Generative KI birgt dabei auch Risiken: Halluzinationen, Deepfakes oder urheberrechtliche Fragen.
Verwandte Begriffe: Large Language Model, Transformer-Architektur, Halluzination
+ Gradient Boosting
Gradient Boosting ist ein Ensemble-Verfahren des maschinellen Lernens, das viele einfache Modelle – meist flache Entscheidungsbäume – nacheinander trainiert, wobei jedes neue Modell die Fehler der bisherigen korrigiert. Auf strukturierten, tabellarischen Daten zählt Gradient Boosting zu den leistungsfähigsten Standardverfahren.
Funktionsweise: Das Verfahren startet mit einer einfachen Vorhersage und berechnet die verbleibenden Fehler (Residuen). Ein neuer Baum wird darauf trainiert, genau diese Fehler vorherzusagen, und mit geringem Gewicht (Lernrate) zum Gesamtmodell addiert. Dieser Schritt wiederholt sich hundert- bis tausendfach, bis sich die Vorhersagequalität nicht mehr verbessert. Verbreitete Implementierungen sind XGBoost, LightGBM und CatBoost.
Unternehmensbeispiel: Ein Agrarunternehmen prognostiziert Erträge auf Schlagebene aus Bodendaten, Wetterhistorie und Bewirtschaftungsdaten. Ein Gradient-Boosting-Modell verarbeitet die gemischten tabellarischen Merkmale direkt und bildet auch nichtlineare Zusammenhänge ab, an denen lineare Modelle scheitern.
Anwendungsfelder:
- Ertrags- und Nachfrageprognosen auf tabellarischen Daten
- Risikobewertung und Scoring
- Klassifizierung und Regression in industriellen Datenprojekten
- Ranking-Aufgaben, etwa in Such- und Empfehlungssystemen
Abgrenzung: Beim Random Forest werden viele Bäume unabhängig voneinander trainiert und gemittelt; beim Gradient Boosting bauen die Bäume sequentiell aufeinander auf, was oft höhere Genauigkeit bringt, aber sorgfältigeres Tuning erfordert.
Verwandte Begriffe: XGBoost, Random Forest, Überwachtes Lernen
+ Graphdatenbank (Graph Database)
Eine Graphdatenbank ist ein Datenbanksystem, das Daten als Graph speichert: Knoten repräsentieren Entitäten (z. B. Kunden, Produkte, Gene), Kanten deren Beziehungen. Das Datenmodell stellt Verbindungen gleichberechtigt neben die Objekte selbst und eignet sich damit für stark vernetzte Daten.
Funktionsweise: Anders als in relationalen Datenbanken, wo Beziehungen erst zur Abfragezeit über Joins zusammengesetzt werden, sind sie im Graphmodell direkt gespeichert. Abfragen navigieren (traversieren) von Knoten zu Knoten; die Kosten hängen von der Zahl der besuchten Kanten ab, kaum von der Gesamtgröße der Datenbank. Typische Abfragesprachen sind Cypher, Gremlin und der ISO-Standard GQL.
Unternehmensbeispiel: Ein Agrarkonzern verknüpft Sorten, Feldversuche, Standorte und Umweltbedingungen in einer Graphdatenbank. Züchter fragen ab, über welche Versuchsreihen zwei Sorten miteinander verwandt sind und unter welchen Bedingungen verwandte Linien bereits geprüft wurden.
Anwendungsfelder:
- Wissensgraphen für Forschung und Produktdaten
- Netzwerk- und Abhängigkeitsanalysen (Lieferketten, IT-Infrastruktur)
- Empfehlungs- und Betrugserkennungssysteme
- Verknüpfung heterogener Datenquellen über gemeinsame Entitäten
Abgrenzung: Eine Vektordatenbank findet Ähnliches über numerische Distanzen; eine Graphdatenbank beantwortet Fragen über explizit modellierte Beziehungen. Beide werden zunehmend kombiniert, etwa in Wissensgraphen mit Embedding-Suche.
Verwandte Begriffe: Neo4j, Ontologien (Ontologies), Strukturierte Daten
+ Halluzination
Halluzination bezeichnet das Phänomen, dass ein KI-Sprachmodell Aussagen generiert, die plausibel klingen, aber faktisch falsch oder frei erfunden sind – ohne dass das Modell dies kenntlich macht.
Funktionsweise: Sprachmodelle generieren Text, indem sie statistisch wahrscheinliche Fortsetzungen berechnen. Sie "wissen" nicht, ob eine Aussage wahr ist – sie erzeugen das, was sprachlich kohärent wirkt. In Bereichen, in denen das Modell wenig Trainingsdaten hat oder gezielt nach spezifischen Fakten gefragt wird, steigt das Halluzinationsrisiko.
Unternehmensbeispiel: Ein Mitarbeiter fragt ein KI-System nach einem internen Unternehmensstandard. Das Modell nennt selbstsicher ein konkretes Dokument – das es frei erfunden hat. Ohne Gegenprüfung wird die falsche Information weiterverwendet.
Typische Halluzinationstypen:
- Erfundene Fakten (falsche Zahlen, Namen, Datumsangaben)
- Nicht existierende Quellen oder Zitate
- Fehlinterpretation von Kontext
- Scheinlogische, aber inhaltlich falsche Schlussfolgerungen
Gegenmaßnahmen:
- Retrieval-Augmented Generation (RAG): Modell erhält geprüfte Quellen als Kontext
- Fine-Tuning auf verifizierten Daten
- Menschliche Überprüfung kritischer Ausgaben
- Modelle mit Quellenangaben einsetzen
Abgrenzung: Halluzination ist kein "Fehler" im klassischen Sinne – das Modell funktioniert technisch korrekt. Es ist eine strukturelle Eigenschaft generativer Modelle, die durch geeignete Systemarchitektur gemindert, aber nicht vollständig eliminiert werden kann.
Verwandte Begriffe: Large Language Model, RAG, Generative KI
+ Industrie 4.0
Industrie 4.0 bezeichnet die digitale Transformation der industriellen Produktion durch die Vernetzung von Maschinen, Anlagen und Prozessen – auch als vierte industrielle Revolution bekannt. Kern ist die Integration von cyber-physischen Systemen, dem Internet of Things (IoT) und datengetriebenen Algorithmen.
Funktionsweise: Sensoren erfassen kontinuierlich Maschinendaten (Temperatur, Vibration, Auslastung). Diese Daten werden in Echtzeit übertragen, analysiert und zur Steuerung von Prozessen genutzt – entweder automatisch durch Algorithmen oder als Entscheidungsgrundlage für Bediener.
Unternehmensbeispiel: Eine Fabrik überwacht alle Fertigungsanlagen per Sensor. Ein Algorithmus erkennt anhand von Vibrationsdaten, dass eine Maschine in den nächsten 48 Stunden voraussichtlich ausfallen wird – und löst automatisch einen Wartungsauftrag aus, bevor es zur ungeplanten Unterbrechung kommt (Predictive Maintenance).
Kerntechnologien:
- Internet of Things (IoT)
- Edge Computing
- Cloud-Plattformen
- Maschinelles Lernen für Predictive Maintenance
- Digitale Zwillinge
Verwandte Begriffe: Maschinelles Lernen, Zeitreihenanalyse, Mustererkennung
+ KI-Verordnung (EU AI Act)
Die KI-Verordnung (EU AI Act) ist die Verordnung der Europäischen Union für Künstliche Intelligenz. Sie verfolgt einen risikobasierten Ansatz: Je höher das Risiko eines KI-Systems für Gesundheit, Sicherheit oder Grundrechte, desto strenger die Pflichten – von Transparenzhinweisen bis zu umfassenden Anforderungen an Hochrisiko-Systeme; einzelne Praktiken sind ganz verboten. Sie gilt in ihrer aktuellen, durch die Digitaler-Omnibus-Änderungen angepassten Fassung.
Funktionsweise: Die Verordnung teilt KI-Systeme in Risikoklassen ein (verbotene Praktiken, Hochrisiko, begrenztes Risiko, minimales Risiko) und unterscheidet Rollen: Anbieter, die ein KI-System entwickeln oder unter eigenem Namen auf den Markt bringen, tragen die umfangreichsten Pflichten; Betreiber, die ein System beruflich einsetzen, haben eigene, geringere Pflichten. Nach Art. 4 müssen Unternehmen zudem für ausreichende KI-Kompetenz der Beschäftigten sorgen, die KI-Systeme einsetzen.
Unternehmensbeispiel: Ein Maschinenbauer setzt KI an drei Stellen ein: Sichtprüfung in der Fertigung, ein internes LLM-Werkzeug für Dokumente und ein Prognosemodell im Service. Eine Bestandsaufnahme ordnet jedes System einer Risikoklasse und einer Rolle (Anbieter oder Betreiber) zu und leitet daraus ab, wo Dokumentation, menschliche Aufsicht und Schulungen nötig sind.
Anwendungsfelder:
- Risikoklassifizierung des eigenen KI-Portfolios
- Klärung der eigenen Rolle als Anbieter oder Betreiber
- Aufbau von KI-Kompetenz im Unternehmen (Art. 4)
- Dokumentations- und Transparenzpflichten in KI-Projekten
Abgrenzung: Die DSGVO regelt den Umgang mit personenbezogenen Daten, die KI-Verordnung den Einsatz von KI-Systemen – beide können dasselbe Projekt gleichzeitig betreffen. AI Governance ist der unternehmensinterne Rahmen, mit dem solche Vorgaben umgesetzt werden.
Verwandte Begriffe: AI Governance, Künstliche Intelligenz (KI), Explainable AI (XAI)
+ Klassifizierung
Klassifizierung ist eine Methode des überwachten Lernens, bei der ein Modell lernt, neue Datenpunkte einer von mehreren vordefinierten Kategorien zuzuordnen.
Funktionsweise: Das Modell wird mit gelabelten (annotierten) Trainingsdaten trainiert (z. B. E-Mails, die als "Spam" oder "kein Spam" markiert sind). Es lernt, welche Merkmale für welche Klasse typisch sind. Bei neuen, unbekannten Datenpunkten trifft es dann auf Basis dieser erlernten Muster eine Zuordnungsentscheidung.
Unternehmensbeispiel: Eine Bank trainiert ein Klassifizierungsmodell auf historischen Kreditanträgen. Das Modell lernt, welche Kombination aus Einkommen, Schulden und Zahlungshistorie zu Ausfällen geführt hat – und klassifiziert neue Antragsteller als "geringes Risiko" oder "hohes Risiko".
Gängige Algorithmen:
- Logistische Regression
- Entscheidungsbäume und Random Forests
- Support Vector Machines (SVM)
- Gradient Boosting (XGBoost, LightGBM)
- Neuronale Netzwerke
Abgrenzung: Bei der Klassifizierung sind die möglichen Ausgaben diskrete Kategorien (z. B. "Ja/Nein", "A/B/C"). Bei der Regression wird ein kontinuierlicher Wert vorhergesagt (z. B. ein Preis oder eine Temperatur).
Verwandte Begriffe: Überwachtes Lernen, Clustering, Feature Engineering
+ Konfusionsmatrix (Confusion Matrix)
Die Konfusionsmatrix (Confusion Matrix) ist eine Tabelle zur Bewertung von Klassifikationsmodellen, die vorhergesagte Klassen den tatsächlichen Klassen gegenüberstellt. Aus ihr lassen sich alle gängigen Gütemaße eines Klassifikators direkt ablesen.
Funktionsweise: Für ein binäres Problem enthält die Matrix vier Felder: richtig positive, richtig negative, falsch positive und falsch negative Vorhersagen. Daraus werden Kennzahlen wie Genauigkeit (Accuracy), Präzision, Sensitivität (Recall) und F1-Score berechnet. Bei mehr als zwei Klassen zeigt die Matrix zusätzlich, welche Klassen das Modell systematisch verwechselt – daher der Name.
Unternehmensbeispiel: Ein Maschinenbauunternehmen prüft ein Modell zur automatischen Defekterkennung. Die Konfusionsmatrix zeigt, dass zwar 97 % der Teile korrekt bewertet werden, aber ein erheblicher Anteil der echten Defekte unerkannt bleibt – das Team justiert daraufhin den Entscheidungsschwellenwert zugunsten der Fehlererkennung.
Anwendungsfelder:
- Bewertung von Modellen zur Klassifizierung
- Auswahl des Entscheidungsschwellenwerts bei unausgeglichenen Klassen
- Qualitätsnachweis vor der Produktivsetzung eines Modells
- Fehleranalyse: Welche Klassen werden verwechselt?
Abgrenzung: Die reine Accuracy täuscht bei seltenen Klassen (z. B. 1 % Defekte) hohe Güte vor; die Konfusionsmatrix macht solche Verzerrungen sichtbar, indem sie richtige und falsche Vorhersagen je Klasse getrennt ausweist.
Verwandte Begriffe: Klassifizierung, Überwachtes Lernen, Maschinelles Lernen
+ Künstliche Intelligenz (KI)
Künstliche Intelligenz bezeichnet Computersysteme, die Aufgaben ausführen, für die bislang menschliche Intelligenz erforderlich war – wie Sprachverstehen, visuelle Wahrnehmung, Entscheidungsfindung oder das Lösen komplexer Probleme.
Funktionsweise: Moderne KI basiert fast ausschließlich auf datengetriebenem maschinellem Lernen: Statt explizit programmierter Regeln lernen Modelle Muster aus großen Datensätzen. Die leistungsfähigsten aktuellen Systeme sind Large Language Models und multimodale Modelle.
Unternehmensbeispiel: KI-Systeme automatisieren heute Aufgaben in nahezu allen Branchen: von der automatischen Dokumentenprüfung im Versicherungswesen über KI-gestützte Diagnoseunterstützung in der Medizin bis zur automatisierten Qualitätskontrolle in der Fertigung.
KI-Teilgebiete:
- Machine Learning und Deep Learning
- Natural Language Processing (NLP)
- Computer Vision / Bilderkennung
- Robotik und autonome Systeme
- Generative KI
Abgrenzung: "KI" ist oft ein Sammelbegriff. Enge KI (Narrow AI) beherrscht nur eine spezifische Aufgabe (z. B. Schach spielen). Breite oder allgemeine KI (AGI), die menschliche Intelligenz auf beliebige Aufgaben überträgt, existiert heute noch nicht.
Verwandte Begriffe: Maschinelles Lernen, Large Language Model, Generative KI
+ Large Language Model (LLM)
Ein Large Language Model (LLM) ist ein KI-Modell, das auf sehr großen Textmengen trainiert wurde und natürliche Sprache versteht, generiert und verarbeitet. LLMs bilden die technische Grundlage von Systemen wie ChatGPT, Claude oder Gemini.
Funktionsweise: LLMs basieren auf der Transformer-Architektur. Sie werden zunächst selbstüberwacht (self-supervised) auf enormen Textkorpora im Umfang von Billionen Tokens trainiert, um Sprachstrukturen zu erlernen. Anschließend werden sie durch Fine-Tuning und RLHF (Reinforcement Learning from Human Feedback) für hilfreiche, sichere Konversationen optimiert.
Unternehmensbeispiel: Ein Versicherungskonzern setzt ein intern gehostetes LLM ein, das Sachbearbeiter bei der Analyse und Zusammenfassung langer Schadenberichte unterstützt. Die Bearbeitungszeit pro Fall sinkt deutlich.
Anwendungsfelder:
- Textzusammenfassung und -extraktion
- Automatisierter Kundenservice (Chatbots)
- Code-Assistenz für Entwickler
- Dokumentenanalyse und -klassifizierung
- Interne Wissenssuche (RAG)
- Automatisierte Berichterstellung
Bekannte Modelle: GPT (OpenAI), Claude (Anthropic), Gemini (Google), Llama (Meta), Mistral (Mistral AI).
Abgrenzung: LLMs sind ein Teilbereich der Generativen KI und spezialisiert auf Sprache. Multimodale Modelle können zusätzlich Bilder, Audio oder Video verarbeiten. Klassische NLP-Modelle (z. B. Named Entity Recognition) sind kleiner und aufgabenspezifischer.
Verwandte Begriffe: Transformer-Architektur, Prompt Engineering, RAG, Fine-Tuning, Halluzination
+ LIME (Local Interpretable Model-agnostic Explanations)
LIME (Local Interpretable Model-agnostic Explanations) ist ein Verfahren der Explainable AI (XAI), das einzelne Vorhersagen beliebiger Machine-Learning-Modelle erklärt, indem es das Modell in der Umgebung des betrachteten Datenpunkts durch ein einfaches, interpretierbares Ersatzmodell annähert. "Model-agnostic" bedeutet: Es funktioniert mit jedem Modelltyp, vom Random Forest bis zum neuronalen Netz.
Funktionsweise: LIME erzeugt viele leicht abgewandelte Varianten des zu erklärenden Datenpunkts, lässt das Originalmodell diese bewerten und trainiert auf den Ergebnissen ein gewichtetes lineares Modell, das nahe Varianten stärker berücksichtigt. Dessen Koeffizienten zeigen, welche Merkmale die konkrete Vorhersage lokal nach oben oder unten ziehen. Das Prinzip funktioniert für Tabellendaten, Texte und Bilder.
Unternehmensbeispiel: Ein Agrardienstleister nutzt ein Bildmodell zur Erkennung von Blattkrankheiten. LIME hebt die Bildregionen hervor, die für die Diagnose ausschlaggebend waren – Agronomen können so prüfen, ob das Modell tatsächlich auf Läsionen statt auf Bildartefakte reagiert.
Anwendungsfelder:
- Stichprobenartige Erklärung einzelner Modellentscheidungen
- Plausibilitätsprüfung von Bild- und Textklassifikatoren
- Kommunikation von Modellverhalten an Fachanwender
- Aufdecken von Scheinkorrelationen im Training
Abgrenzung: LIME erklärt lokal und approximativ; SHAP verteilt Beiträge auf spieltheoretischer Grundlage konsistent auf die Merkmale, ist dafür rechenaufwendiger. In der Praxis ergänzen sich beide.
Verwandte Begriffe: Explainable AI (XAI), SHAP (SHapley Additive exPlanations), Maschinelles Lernen
+ Logistische Regression (Logistic Regression)
Die logistische Regression (Logistic Regression) ist ein statistisches Verfahren des überwachten Lernens, das die Wahrscheinlichkeit einer Klassenzugehörigkeit modelliert und trotz des Namens für Klassifizierung eingesetzt wird. Sie ist wegen ihrer Einfachheit und Interpretierbarkeit oft das erste Modell in einem Klassifikationsprojekt.
Funktionsweise: Das Modell bildet eine gewichtete Summe der Eingangsmerkmale und transformiert sie über die logistische Funktion (Sigmoid) in eine Wahrscheinlichkeit zwischen 0 und 1; ab einem Schwellenwert (z. B. 0,5) wird ein Fall der positiven Klasse zugeordnet. Die gelernten Koeffizienten zeigen direkt, wie stark und in welche Richtung jedes Merkmal das Ergebnis beeinflusst – ein Vorteil überall dort, wo Entscheidungen begründbar sein müssen.
Unternehmensbeispiel: Ein Pharmaunternehmen schätzt aus Prozessparametern die Wahrscheinlichkeit, dass eine Produktionscharge die Qualitätsprüfung nicht besteht. Die Koeffizienten des Modells zeigen dem Fachteam zugleich, welche Parameter das Risiko maßgeblich erhöhen.
Anwendungsfelder:
- Binäre Klassifikation (gut/schlecht, Ausfall/kein Ausfall)
- Risiko-Scoring in Medizin und Qualitätswesen
- Baseline-Modell vor komplexeren Verfahren
- A/B-Test-Auswertung und Wirkungsanalysen
Abgrenzung: Anders als die lineare Regression sagt die logistische Regression keine kontinuierliche Größe, sondern eine Klassenwahrscheinlichkeit vorher.
Verwandte Begriffe: Regression, Klassifizierung, Überwachtes Lernen
+ LSTM (Long Short-Term Memory)
LSTM (Long Short-Term Memory) ist eine Variante rekurrenter neuronaler Netze, die über sogenannte Gates gezielt steuert, welche Informationen einer Sequenz gespeichert, überschrieben oder ausgegeben werden, und dadurch auch weit zurückliegende Abhängigkeiten abbildet.
Funktionsweise: Jede LSTM-Zelle führt einen Speicherzustand mit, der über ein Input-, ein Forget- und ein Output-Gate geregelt wird. Diese Gates sind selbst gelernte Funktionen und entscheiden in jedem Zeitschritt, welcher Anteil neuer Information übernommen und welcher Anteil des Speichers verworfen wird. Damit umgeht ein LSTM das Problem verschwindender Gradienten, an dem einfache rekurrente Netze bei langen Sequenzen scheitern.
Unternehmensbeispiel: Ein Anlagenbetreiber wertet Schwingungs- und Temperaturzeitreihen einer Produktionslinie aus. Ein LSTM lernt den normalen Verlauf über mehrere Betriebszyklen hinweg und meldet Abweichungen, die auf beginnenden Lagerverschleiß hindeuten, oft mehrere Tage vor dem Stillstand.
Anwendungsfelder:
- Prognose von Bedarfs-, Ertrags- und Sensorzeitreihen
- Vorausschauende Instandhaltung
- Anomalieerkennung in Messreihen
- Sequenzmodellierung in Sprache und Handschrift
- Auswertung kontinuierlicher Signale in der Signalverarbeitung
Abgrenzung: In der Sprachverarbeitung haben Transformer-Modelle LSTMs weitgehend abgelöst. Bei industriellen Zeitreihen mit wenigen Trainingsdaten und begrenzter Rechenleistung bleiben LSTMs eine praktikable Wahl.
Verwandte Begriffe: Neuronales Netzwerk, Deep Learning, Transformer-Architektur, Anomalieerkennung (Anomaly Detection)
+ Maschinelles Lernen
Maschinelles Lernen (ML, engl. Machine Learning) ist ein Teilbereich der Künstlichen Intelligenz, bei dem Algorithmen aus Daten lernen, Muster zu erkennen und Vorhersagen zu treffen – ohne explizit für jede Situation programmiert zu werden.
Funktionsweise: Ein ML-Modell wird auf einem Trainingsdatensatz optimiert, indem es iterativ seine internen Parameter anpasst, um einen definierten Fehler zu minimieren. Das Ergebnis ist ein Modell, das auf neuen, unbekannten Daten generalisiert.
Lernparadigmen:
- Überwachtes Lernen: Lernen mit gelabelten Beispielen
- Unüberwachtes Lernen: Muster ohne Label finden
- Reinforcement Learning: Lernen durch Belohnung und Bestrafung
Unternehmensbeispiel: Ein Energieversorger setzt ML ein, um den Stromverbrauch für die nächsten 24 Stunden vorherzusagen – auf Basis von Wetterdaten, Tageszeit und historischen Verbrauchsmustern. Das ermöglicht eine effizientere Netzsteuerung.
Abgrenzung: ML ist ein Werkzeug innerhalb des breiteren Feldes der KI. Nicht alle KI-Systeme nutzen ML (regelbasierte Systeme z. B. nicht). Deep Learning ist ein Teilbereich des ML, der auf mehrschichtigen neuronalen Netzwerken basiert.
Verwandte Begriffe: Deep Learning, Feature Engineering, Überwachtes Lernen
+ Mask R-CNN
Mask R-CNN ist eine Deep-Learning-Architektur für die Instanzsegmentierung, die für jedes erkannte Objekt gleichzeitig eine Klasse, ein umschließendes Rechteck und eine pixelgenaue Maske ausgibt.
Funktionsweise: Die Architektur erweitert den Detektor Faster R-CNN um einen dritten, parallel arbeitenden Ausgabekopf, der je Objektvorschlag eine binäre Maske vorhersagt. Damit die Maske exakt zum Bild passt, ersetzt eine interpolierende Zuordnung der Merkmalskarte (RoIAlign) das gröbere RoI-Pooling der Vorgänger. Als Merkmalsextraktor dient ein CNN-Backbone, üblicherweise ergänzt um eine Feature-Pyramide für Objekte unterschiedlicher Größe.
Unternehmensbeispiel: Ein Saatgutzüchter erfasst Versuchsparzellen per Drohne. Mask R-CNN trennt einzelne Pflanzen voneinander, sodass Bestandsdichte und Blattfläche je Pflanze ausgewertet werden können statt nur der Deckungsgrad der Gesamtfläche.
Anwendungsfelder:
- Zählen und Vermessen einzelner Objekte
- Instanzsegmentierung in Mikroskopie und Labordiagnostik
- Erkennung und Abgrenzung von Bauteilen in der Fertigung
- Erfassung von Fahrzeugen und Gebäuden in Luftbildern
- Automatische Vorannotation großer Bildbestände
Abgrenzung: Die semantische Segmentierung, etwa mit U-Net, markiert alle Bildpunkte einer Klasse als eine Fläche. Mask R-CNN trennt darüber hinaus die einzelnen Objekte innerhalb dieser Fläche, was für das Zählen einzelner Objekte nötig ist.
Verwandte Begriffe: Bildsegmentierung (Image Segmentation), Objekterkennung (Object Detection), Fast R-CNN, CNN (Convolutional Neural Network)
+ Microservices
Microservices sind ein Softwarearchitekturmuster, bei dem eine Anwendung aus einer Sammlung kleiner, unabhängig voneinander bereitstellbarer Dienste besteht, die jeweils eine klar abgegrenzte Funktion erfüllen und über definierte Schnittstellen (APIs) kommunizieren.
Funktionsweise: Statt einer monolithischen Anwendung, in der alle Funktionen eng verwoben sind, besteht eine Microservice-Architektur aus Diensten wie "Authentifizierung", "Bestellverwaltung" oder "Empfehlungsdienst", die unabhängig voneinander entwickelt, getestet, skaliert und aktualisiert werden können.
Unternehmensbeispiel: Ein E-Commerce-Unternehmen kann am Black Friday nur den "Checkout"-Microservice zusätzlich skalieren – statt die gesamte Anwendung aufzurüsten. Im Fehlerfall eines Dienstes laufen alle anderen weiter.
Vorteile:
- Unabhängige Skalierbarkeit einzelner Komponenten
- Schnellere Entwicklung durch paralleles Arbeiten mehrerer Teams
- Technologie-Flexibilität (jeder Service kann in der jeweils am besten geeigneten Sprache geschrieben werden)
- Bessere Fehlertoleranz
Abgrenzung: Im Gegensatz zu einem Monolithen (alles in einer Anwendung) oder einer Service-orientierten Architektur (SOA) sind Microservices kleiner, autonomer und stärker auf unabhängiges Deployment ausgelegt.
Verwandte Begriffe: API, Datenpipeline
+ Microsoft Azure
Microsoft Azure ist die Public-Cloud-Plattform von Microsoft mit weltweit verteilten Rechenzentren und Diensten für Rechenleistung, Speicher, Datenbanken, Analytik und maschinelles Lernen. Neben AWS (Amazon Web Services) ist Azure einer der beiden größten Cloud-Anbieter und vor allem in Unternehmen verbreitet, die ohnehin Microsoft-Software einsetzen.
Funktionsweise: Ressourcen wie virtuelle Maschinen, Kubernetes-Cluster, Datenbanken oder Data-Lake-Speicher werden nach Bedarf bereitgestellt und nutzungsbasiert abgerechnet. Für Datenprojekte relevant sind vor allem Azure Machine Learning (Training und Deployment von Modellen), Microsoft Fabric und Synapse (Analytik), Azure OpenAI (LLM-Dienste) sowie die enge Anbindung an Microsoft 365 und Power BI.
Unternehmensbeispiel: Ein Maschinenbauunternehmen betreibt seine IoT-Datenplattform auf Azure: Maschinen senden Telemetrie an einen Event Hub, die Daten landen in einem Data Lake, Modelle zur Anomalieerkennung laufen in Azure Machine Learning, und die Ergebnisse erreichen die Werksleitung als Power-BI-Dashboard.
Anwendungsfelder:
- Cloud-Datenplattformen (Data Lake, Warehouse, Streaming)
- Training und Betrieb von Machine-Learning-Modellen
- Bereitstellung von Anwendungen und Microservices
- Generative-AI-Dienste über Azure OpenAI
Verwandte Begriffe: AWS (Amazon Web Services), Power BI, MLOps
+ MLOps
MLOps (Machine Learning Operations) bezeichnet die Praktiken und Werkzeuge, mit denen Machine-Learning-Modelle zuverlässig entwickelt, ausgeliefert und im laufenden Betrieb überwacht werden. Das Konzept überträgt DevOps-Prinzipien wie Automatisierung und CI/CD auf den Modell-Lebenszyklus, der zusätzlich Daten und trainierte Artefakte umfasst.
Funktionsweise: Typische Bausteine sind versionierte Daten und Modelle, reproduzierbare Trainings-Pipelines, automatisierte Tests vor dem Deployment sowie Monitoring im Betrieb. Verschlechtert sich die Modellgüte, etwa weil sich die Eingangsdaten verschieben (Data Drift), stößt die Pipeline ein Retraining an oder löst einen Alarm aus. Verbreitete Werkzeuge sind MLflow, Kubeflow und die ML-Dienste der Cloud-Anbieter.
Unternehmensbeispiel: Ein Maschinenbauunternehmen betreibt ein Modell zur Ausschussvorhersage in der Fertigung. Über eine MLOps-Pipeline wird jede neue Modellversion automatisch gegen historische Daten getestet, schrittweise ausgerollt und im Betrieb überwacht; driftet die Vorhersagequalität, wird automatisch mit aktuellen Produktionsdaten nachtrainiert.
Anwendungsfelder:
- Automatisiertes Training, Deployment und Rollback von Modellen
- Monitoring von Modellgüte, Data Drift und Latenz im Betrieb
- Versionierung und Nachvollziehbarkeit von Daten, Code und Modellen
- Governance- und Compliance-Anforderungen an produktive KI
Abgrenzung: DevOps betrachtet nur Code; MLOps ergänzt Daten und Modelle als eigene, sich verändernde Artefakte mit eigenem Test- und Überwachungsbedarf.
Verwandte Begriffe: CI/CD, Maschinelles Lernen, Datenpipeline
+ Multimodales Modell
Ein multimodales Modell ist ein KI-System, das mehrere Datenmodalitäten – typischerweise Text, Bilder, Audio und Video – gemeinsam verarbeiten und verstehen kann.
Funktionsweise: Multimodale Modelle verfügen über separate Encoder für verschiedene Modalitäten, deren Ausgaben in einem gemeinsamen Repräsentationsraum zusammengeführt werden. Das Modell lernt, Zusammenhänge zwischen Modalitäten zu verstehen – z. B. den Inhalt eines Bildes in Textform zu beschreiben oder aus einer Textbeschreibung ein Bild zu generieren.
Unternehmensbeispiel: Ein Versicherungsunternehmen lässt Schadensfotos automatisch von einem multimodalen Modell analysieren: Das Modell beschreibt den Schaden, schätzt die Reparaturkosten und generiert einen Erstentwurf des Schadensberichts – alles in einem Schritt.
Anwendungsfelder:
- Automatische Bildbeschreibung (Image Captioning)
- Visuelle Dokumentenanalyse (Rechnungen, Formulare)
- Video-Analyse mit Sprachverständnis
- Medizinische Diagnoseunterstützung (Bild + Text)
Bekannte Modelle: GPT-4o (OpenAI), Gemini (Google), Claude (Anthropic).
Abgrenzung: Ein reines LLM verarbeitet nur Text. Ein multimodales Modell erweitert dies um weitere Eingabetypen. Generative multimodale Modelle können auch Bilder oder Audio ausgeben (z. B. DALL·E, Sora).
Verwandte Begriffe: Large Language Model, Generative KI, Bilderkennung
+ Mustererkennung
Mustererkennung beschäftigt sich mit der automatischen Identifikation von Regelmäßigkeiten, Strukturen und verborgenen Zusammenhängen in Daten – unabhängig davon, ob diese als Bilder, Texte, Zeitreihen oder Messwerte vorliegen.
Funktionsweise: Algorithmen analysieren Datenpunkte auf gemeinsame Eigenschaften oder wiederkehrende Strukturen. Je nach Aufgabe kommen regelbasierte Verfahren, statistische Methoden oder neuronale Netzwerke zum Einsatz.
Unternehmensbeispiel: Ein Telekommunikationsanbieter erkennt durch Mustererkennung in Netzwerkdaten typische frühe Anzeichen eines Geräteausfalls – und kann präventiv eingreifen, bevor Kunden betroffen sind.
Anwendungsfelder:
- Anomalieerkennung in Produktionsprozessen
- Betrugserkennung in Finanztransaktionen
- Spracherkennung und -verarbeitung
- Biometrische Authentifizierung
Verwandte Begriffe: Maschinelles Lernen, Bilderkennung, Signalverarbeitung
+ Natural Language Processing (NLP)
Natural Language Processing (NLP; Natürliche Sprachverarbeitung) ist ein Teilgebiet der KI, das sich mit dem Verständnis, der Analyse und der Generierung menschlicher Sprache durch Computersysteme befasst.
Funktionsweise: NLP-Systeme verarbeiten Text in mehreren Schritten: Tokenisierung (Text in Einheiten zerlegen), Parsing (grammatikalische Strukturen erkennen), semantische Analyse (Bedeutung verstehen) und pragmatische Analyse (Kontext berücksichtigen). Moderne NLP-Systeme basieren auf Transformer-Architekturen und haben die Leistungsfähigkeit früherer regelbasierter Ansätze weit übertroffen.
Unternehmensbeispiel: Ein Energiekonzern analysiert täglich Tausende Kundenbeschwerden aus E-Mails und Chats automatisch per NLP: Themen werden erkannt, Dringlichkeit eingestuft und Tickets automatisch den richtigen Teams zugewiesen.
Anwendungsfelder:
- Automatische Textzusammenfassung
- Stimmungsanalyse (Sentiment Analysis)
- Chatbots und virtuelle Assistenten
- Maschinelle Übersetzung
- Informationsextraktion aus unstrukturierten Dokumenten
Abgrenzung: Klassisches NLP nutzte regelbasierte und statistische Methoden für spezifische Teilaufgaben. Moderne LLMs können nahezu alle NLP-Aufgaben in einem einzigen Modell erledigen – auf deutlich höherem Niveau.
Verwandte Begriffe: Large Language Model, Token / Tokenisierung, Text Mining
+ NDVI (Normalized Difference Vegetation Index)
Der NDVI (Normalized Difference Vegetation Index) ist ein aus Fernerkundungsdaten berechneter Vegetationsindex, der die Reflexion im nahen Infrarot und im roten Spektralbereich verrechnet und damit die Vitalität und Dichte der Vegetation beschreibt. Er ist der älteste und am weitesten verbreitete Vegetationsindex der Fernerkundung (Remote Sensing).
Funktionsweise: Der Index berechnet sich als (NIR − Rot) / (NIR + Rot) und liegt damit zwischen −1 und +1. Gesunde Pflanzen reflektieren nahes Infrarot stark und absorbieren rotes Licht für die Photosynthese, was zu Werten von etwa 0,3 bis 0,9 führt; unbewachsener Boden liegt nahe 0,1 bis 0,2, Wasserflächen im negativen Bereich. Bei dichten Beständen tritt eine Sättigung ein, sodass Unterschiede nicht mehr abgebildet werden – hier sind Indizes wie der EVI oder Red-Edge-basierte Varianten besser geeignet.
Unternehmensbeispiel: Ein Landwirtschaftsbetrieb lässt für jeden Schlag den NDVI-Verlauf aus wöchentlichen Satellitenaufnahmen berechnen. Auffällig niedrige Werte in Teilbereichen weisen früh auf Verdichtung, Nährstoffmangel oder Schädlingsbefall hin und werden als Teilflächen in die Applikationskarte für die Düngung übernommen.
Anwendungsfelder:
- Bestandsüberwachung und teilflächenspezifische Düngung
- Ertragsschätzung und Ernteterminplanung
- Erkennung von Trockenstress und Schadflächen
- Abgrenzung von Vegetations- und Landnutzungsklassen
- Zeitreihen als Feature im Feature Engineering für Ertragsmodelle
Verwandte Begriffe: Fernerkundung (Remote Sensing), Raum-zeitliche Statistik (Spatio-temporal Statistics), Prädiktive Analytik, Feature Engineering
+ Neo4j
Neo4j ist eine native Graphdatenbank, die Daten als Knoten und Kanten mit Eigenschaften speichert und über die Abfragesprache Cypher zugänglich macht. Sie gilt als das verbreitetste System ihrer Klasse und ist in einer Open-Source-Community-Edition sowie kommerziellen Varianten (u. a. als Cloud-Dienst AuraDB) verfügbar.
Funktionsweise: Beziehungen werden in Neo4j nicht über Fremdschlüssel und Joins berechnet, sondern direkt als Verweise gespeichert (index-free adjacency). Abfragen wie "alle Zulieferer eines Zulieferers" traversieren den Graphen entlang der Kanten, wodurch mehrstufige Beziehungsabfragen auch bei großen Datenmengen schnell bleiben. Die Graph Data Science Library ergänzt Algorithmen wie Community-Erkennung oder Pfadsuche.
Unternehmensbeispiel: Ein Maschinenbauunternehmen bildet seine Lieferkette als Graph in Neo4j ab: Teile, Lieferanten, Werke und Transportwege als Knoten und Kanten. Fällt ein Lieferant aus, zeigt eine einzige Cypher-Abfrage, welche Endprodukte über wie viele Stufen betroffen sind.
Anwendungsfelder:
- Wissensgraphen und Stammdaten-Vernetzung
- Lieferketten- und Abhängigkeitsanalysen
- Betrugserkennung über Beziehungsmuster
- Empfehlungssysteme
Verwandte Begriffe: Graphdatenbank (Graph Database), Ontologien (Ontologies), Vektordatenbank
+ Neuronaler Operator (Neural Operator)
Ein Neuronaler Operator ist ein neuronales Netzwerk, das nicht einzelne Zahlenwerte, sondern ganze Funktionen aufeinander abbildet – etwa die Geometrie und Randbedingungen eines Bauteils auf das vollständige Spannungs- oder Strömungsfeld. Damit lassen sich physikalische Simulationen lernen und drastisch beschleunigen.
Funktionsweise: Klassische neuronale Netzwerke lernen Abbildungen zwischen Vektoren fester Größe. Neuronale Operatoren (z. B. Fourier Neural Operators) lernen dagegen Abbildungen zwischen Funktionenräumen: Auf vielen Simulationsläufen trainiert, sagen sie das komplette Ergebnisfeld einer Simulation direkt vorher – unabhängig von der Auflösung des Rechengitters. Eine Vorhersage dauert nach dem Training Millisekunden statt Stunden.
Unternehmensbeispiel: Ein Fahrzeughersteller trainiert einen Neuronalen Operator auf hunderten CFD-Läufen zur Umströmung von Karosserievarianten. In der frühen Designphase sehen die Ingenieure den Luftwiderstand einer neuen Variante nahezu in Echtzeit, statt tagelang auf Simulationsergebnisse zu warten.
Anwendungsfelder:
- Beschleunigung von CFD- und FEM-Simulationen
- Interaktive Designexploration in der Produktentwicklung
- Echtzeitmodelle für digitale Zwillinge
- Wetter- und Strömungsvorhersagen in Forschung und Industrie
Abgrenzung: Ein klassisches Surrogate Model (Ersatzmodell) sagt meist einzelne Kenngrößen für einen festen Simulationsaufbau vorher; ein Neuronaler Operator sagt ganze Felder vorher und verallgemeinert über Geometrien und Auflösungen hinweg.
Verwandte Begriffe: Surrogate Model (Ersatzmodell), Neuronales Netzwerk, Deep Learning
+ Neuronales Netzwerk
Ein künstliches neuronales Netzwerk (KNN) ist ein Rechenmodell, das lose von der Struktur des menschlichen Gehirns inspiriert ist. Es besteht aus Schichten von miteinander verbundenen Knoten (Neuronen), die gemeinsam komplexe Muster in Daten erlernen können.
Funktionsweise: Informationen fließen von der Eingabeschicht durch mehrere verdeckte Schichten zur Ausgabeschicht. Jede Verbindung hat ein Gewicht, das während des Trainings durch Backpropagation angepasst wird, um den Vorhersagefehler zu minimieren. Mit mehr Schichten entstehen tiefe neuronale Netzwerke (Deep Learning).
Unternehmensbeispiel: Ein Kreditkartenanbieter setzt ein neuronales Netzwerk zur Betrugserkennung ein. Es analysiert in Echtzeit über 100 Merkmale einer Transaktion und entscheidet in Millisekunden, ob ein Betrugsversuch vorliegt.
Anwendungsfelder:
- Bild- und Spracherkennung
- Vorhersagemodelle
- Empfehlungssysteme
- Medizinische Diagnose
Abgrenzung: Flache neuronale Netzwerke haben wenige Schichten und sind für einfachere Aufgaben geeignet. Deep Learning bezeichnet Netzwerke mit vielen Schichten, die komplexere Zusammenhänge modellieren können.
Verwandte Begriffe: Deep Learning, Maschinelles Lernen, Transformer-Architektur
+ Objekterkennung (Object Detection)
Objekterkennung (Object Detection) ist eine Aufgabe der Bildanalyse, bei der ein Modell alle interessierenden Objekte in einem Bild lokalisiert und jedem davon eine Klasse sowie ein umschließendes Rechteck (Bounding Box) zuweist.
Funktionsweise: Trainiert wird mit Bildern, in denen Objekte von Hand mit Rechtecken und Klassen annotiert wurden. Zweistufige Verfahren wie Fast R-CNN erzeugen zunächst Objektvorschläge und klassifizieren sie anschließend; einstufige Verfahren wie YOLO sagen Boxen und Klassen in einem Durchgang vorher. Jede Vorhersage trägt einen Konfidenzwert, mehrfache Erkennungen desselben Objekts werden über Non-Maximum Suppression verworfen. Die Bewertung erfolgt über die Überlappung mit der Referenzbox (Intersection over Union) und die daraus abgeleitete mittlere durchschnittliche Präzision (mean Average Precision).
Unternehmensbeispiel: Ein landwirtschaftlicher Lohnunternehmer befliegt Felder mit einer Drohne und lokalisiert Unkrautnester im Bestand. Aus den Boxkoordinaten entsteht eine Applikationskarte, mit der die Spritze nur die betroffenen Teilflächen behandelt, was den Herbizideinsatz über den ganzen Schlag senkt.
Anwendungsfelder:
- Fehler- und Fremdkörpererkennung in der Qualitätsprüfung
- Zählaufgaben in Produktion, Logistik und Landwirtschaft
- Erfassung von Objekten in Luft- und Satellitenbildern
- Überwachung von Zugängen und Verkehrsflächen
- Vorstufe für die Verfolgung bewegter Objekte
Abgrenzung: Objekterkennung liefert je Objekt ein Rechteck und ist damit für Zähl- und Positionsaufgaben ausreichend. Bildsegmentierung (Image Segmentation) geht weiter und weist jedem einzelnen Bildpunkt eine Klasse zu, was für Flächen- und Formmessungen nötig ist.
Verwandte Begriffe: Bildsegmentierung (Image Segmentation), Fast R-CNN, Mask R-CNN, Bilderkennung
+ Offene Daten (Open Data)
Offene Daten sind Datensätze, die von jedem und für jeden Zweck frei zugänglich, nutzbar und weiterverbreitbar sind – höchstens unter der Auflage, die Quelle zu nennen und Bearbeitungen unter denselben Bedingungen weiterzugeben.
Funktionsweise: Offene Daten werden typischerweise von Regierungen, Forschungseinrichtungen oder Unternehmen unter Open-Data-Lizenzen (z. B. Creative Commons) veröffentlicht. Sie sind in standardisierten, maschinenlesbaren Formaten (CSV, JSON, XML) verfügbar.
Unternehmensbeispiel: Ein Logistik-Startup nutzt offene Geodaten des Bundesamts für Kartographie und Geodäsie sowie Wetterdaten des Deutschen Wetterdienstes kostenlos für sein Routenoptimierungsmodell – ohne eigene Datenerhebung.
Wichtige Quellen:
- GovData (Deutschland): Offene Verwaltungsdaten
- Eurostat: Statistische Daten der EU
- OpenStreetMap: Kartendaten
- UCI Machine Learning Repository: Datensätze für ML-Forschung
- Destatis: Statistisches Bundesamt
Abgrenzung: Offene Daten sind nicht gleichbedeutend mit anonymisierten Daten. Datenschutzrechtlich sensible Daten (z. B. personenbezogene Daten) dürfen auch dann nicht veröffentlicht werden, wenn sie technisch verfügbar sind.
Verwandte Begriffe: Data Lake, Dateningestion
+ Ontologien (Ontologies)
Eine Ontologie ist ein formales, maschinenlesbares Modell eines Wissensbereichs, das dessen Begriffe (Klassen), Eigenschaften und die zulässigen Beziehungen zwischen ihnen explizit definiert. Sie legt fest, was Begriffe wie "Wirkstoff", "Charge" oder "Feldversuch" in einem Datenbestand genau bedeuten und wie sie zusammenhängen.
Funktionsweise: Ontologien werden in Standards wie OWL oder RDF Schema beschrieben und definieren Klassenhierarchien (z. B. "Weizen ist ein Getreide"), Eigenschaften und logische Regeln. Auf dieser Grundlage können Systeme Daten aus verschiedenen Quellen eindeutig zuordnen und neue Fakten per Inferenz ableiten. In der Praxis bilden Ontologien häufig das Schema eines Wissensgraphen in einer Graphdatenbank.
Unternehmensbeispiel: Ein Pharmaunternehmen harmonisiert Forschungsdaten aus mehreren Standorten über eine gemeinsame Ontologie: Substanzen, Targets und Studientypen sind einheitlich definiert, sodass Suchanfragen standortübergreifend dieselben Konzepte treffen – unabhängig davon, wie das jeweilige Quellsystem sie benennt.
Anwendungsfelder:
- Schema und kontrolliertes Vokabular für Wissensgraphen
- Datenintegration über heterogene Systeme und Fachsprachen hinweg
- Fachterminologien in Life Science (z. B. Gene Ontology) und Industrie
- Grundlage für semantische Suche und Retrieval-Augmented Generation (RAG)
Abgrenzung: Eine Taxonomie ordnet Begriffe nur hierarchisch; eine Ontologie beschreibt zusätzlich Eigenschaften, Beziehungstypen und Regeln.
Verwandte Begriffe: Graphdatenbank (Graph Database), Neo4j, Strukturierte Daten
+ Pandas
Pandas ist eine Open-Source-Bibliothek für die Programmiersprache Python zur Analyse und Verarbeitung tabellarischer Daten. Ihr zentrales Objekt, der DataFrame, ist der De-facto-Standard für Tabellendaten im Python-Ökosystem.
Funktionsweise: Ein DataFrame hält Daten spaltenweise im Arbeitsspeicher und bietet Operationen zum Filtern, Gruppieren, Verknüpfen (Joins) und Umformen sowie Lese- und Schreibfunktionen für CSV, Excel, Parquet und Datenbanken. Die Rechenoperationen basieren auf NumPy und arbeiten vektorisiert, also spaltenweise statt zeilenweise in Schleifen.
Unternehmensbeispiel: Ein Agrarunternehmen führt Wetterdaten, Bodenproben und Ertragsdaten aus drei Systemen mit Pandas zusammen: einlesen, Einheiten vereinheitlichen, über Feld-IDs verknüpfen, fehlende Werte behandeln – das Ergebnis dient als Eingabe für ein Ertragsprognosemodell.
Anwendungsfelder:
- Explorative Datenanalyse in Notebooks
- Datenbereinigung und Data Wrangling
- Feature-Aufbereitung für Machine-Learning-Modelle
- Kleinere ETL-Aufgaben und Formatkonvertierungen
Abgrenzung: Pandas arbeitet im Arbeitsspeicher eines Rechners; für deutlich größere Datenmengen kommen Warehouses (SQL) oder Engines wie Spark oder Polars, die auf Datenmengen jenseits des Arbeitsspeichers ausgelegt sind zum Einsatz.
Verwandte Begriffe: Python, Data Wrangling, Strukturierte Daten
+ PDAL
PDAL (Point Data Abstraction Library) ist eine quelloffene Bibliothek zur Verarbeitung von Punktwolkendaten, die Lese-, Schreib- und Filteroperationen für Formate wie LAS, LAZ, COPC und Datenbanktabellen bereitstellt. Sie übernimmt für 3D-Punktdaten die Rolle, die GDAL für Raster- und Vektordaten hat.
Funktionsweise: Verarbeitungsschritte werden als Pipeline in einer JSON-Datei beschrieben: ein oder mehrere Reader, eine Kette von Filtern und ein Writer. Typische Filter reprojizieren Koordinaten, dünnen Punkte aus, entfernen Rauschen, klassifizieren Bodenpunkte, berechnen Höhen über Grund oder rastern die Punktwolke zu einem Geländemodell. Die Pipelines lassen sich per Kommandozeile oder über die Python-Bindings ausführen und damit in automatisierte Datenpipelines einbinden.
Unternehmensbeispiel: Ein Ingenieurdienstleister erhält wöchentlich Laserscans von Baustellen in unterschiedlichen Koordinatensystemen. Eine PDAL-Pipeline vereinheitlicht Projektion und Punktdichte, filtert Rauschen und schreibt sowohl eine bereinigte LAZ-Datei als auch ein abgeleitetes Geländemodell. Dieser Schritt läuft unbeaufsichtigt als Teil der nächtlichen Verarbeitung.
Anwendungsfelder:
- Vorverarbeitung von LiDAR- und Laserscandaten
- Formatkonvertierung und Reprojektion großer Punktdatensätze
- Ableitung von Gelände- und Oberflächenmodellen
- Vorbereitung von Trainingsdaten für Punktwolkenklassifikation
- Automatisierte Geodatenverarbeitung in Datenpipelines
Verwandte Begriffe: Punktwolke (Point Cloud), Datenpipeline, Python, Fernerkundung (Remote Sensing)
+ Power BI
Power BI ist die Business-Intelligence-Plattform von Microsoft zur Erstellung interaktiver Berichte und Dashboards, eng integriert in Microsoft 365, Microsoft Azure und Microsoft Fabric. Berichte werden in der Desktop-Anwendung entwickelt und über den Cloud-Dienst im Unternehmen geteilt.
Funktionsweise: Power BI lädt Daten aus Dateien, Datenbanken und Cloud-Diensten, bereitet sie mit Power Query auf und modelliert Kennzahlen mit der Formelsprache DAX. Die Visualisierungen eines Berichts sind interaktiv verknüpft; veröffentlichte Berichte aktualisieren sich zeitgesteuert oder per Direktabfrage der Quelle.
Unternehmensbeispiel: Ein Maschinenbauunternehmen konsolidiert Vertriebs- und Servicedaten in einem Power-BI-Bericht: Die Geschäftsführung sieht Auftragseingang, Servicefälle und Ersatzteilumsätze je Region in einem Dashboard, das sich täglich automatisch aus dem Data Warehouse aktualisiert.
Anwendungsfelder:
- Standard-Reporting und Management-Dashboards
- Self-Service-Analysen in Fachabteilungen
- Verteilung von Kennzahlen über Microsoft-365-Arbeitsumgebungen
- Visualisierungsschicht über Data Warehouses und Lakehouses
Abgrenzung: Power BI visualisiert und aggregiert; die Modellentwicklung und Datenaufbereitung im großen Stil finden vorgelagert statt, etwa mit SQL, dbt oder Python.
Verwandte Begriffe: Business Intelligence (BI), Tibco Spotfire, Microsoft Azure
+ Prädiktive Analytik
Prädiktive Analytik beantwortet die Frage: "Was wird passieren?" Sie nutzt historische Daten, statistische Modelle und Machine-Learning-Algorithmen, um Wahrscheinlichkeiten für zukünftige Ereignisse oder Entwicklungen zu berechnen.
Funktionsweise: Auf Basis historischer Muster lernt das Modell, welche Faktoren zukünftige Ereignisse beeinflussen. Das Modell wird auf Trainingsdaten optimiert und anschließend auf neuen Daten eingesetzt, um Vorhersagen zu treffen.
Unternehmensbeispiel: Ein Telekommunikationsanbieter analysiert Nutzungsmuster, Beschwerdehistorie und Vertragsdaten, um die Wahrscheinlichkeit vorherzusagen, dass ein Kunde in den nächsten 30 Tagen kündigt (Churn-Prediction). Kunden mit hohem Risiko erhalten proaktiv ein Angebot.
Anwendungsfelder:
- Churn-Prediction (Kundenbindung)
- Predictive Maintenance (Maschinenausfälle vorhersagen)
- Nachfrageprognosen und Bestandsplanung
- Kreditrisikobewertung
- Wettervorhersagen
Abgrenzung: Deskriptive Analytik beschreibt die Vergangenheit. Prädiktive Analytik prognostiziert künftige Entwicklungen. Präskriptive Analytik geht einen Schritt weiter und empfiehlt konkrete Handlungen.
Verwandte Begriffe: Deskriptive Analytik, Präskriptive Analytik, Maschinelles Lernen
+ Präskriptive Analytik
Präskriptive Analytik beantwortet die Frage: "Was sollten wir tun?" Sie geht über Beschreibung und Vorhersage hinaus und empfiehlt konkrete Handlungsoptionen, indem sie deren Auswirkungen simuliert und bewertet.
Funktionsweise: Auf Basis von Vorhersagemodellen und Optimierungsalgorithmen werden verschiedene Entscheidungsszenarien durchgespielt. Das System berechnet, welche Maßnahme zu den besten Ergebnissen führt – unter Berücksichtigung definierter Ziele und Nebenbedingungen.
Unternehmensbeispiel: Eine Airline nutzt präskriptive Analytik zur dynamischen Preisgestaltung: Das System berechnet in Echtzeit den Ticketpreis, der Auslastung und Umsatz pro Flug bestmöglich ausbalanciert – unter Berücksichtigung von Nachfrage, Buchungsstand und Wettbewerberpreisen.
Anwendungsfelder:
- Dynamische Preisgestaltung
- Supply-Chain-Optimierung
- Kapazitätsplanung im Gesundheitswesen
- Portfoliooptimierung im Finanzwesen
Abgrenzung: Prädiktive Analytik sagt voraus, was passieren wird. Präskriptive Analytik sagt, was getan werden sollte. Letztere setzt prädiktive Modelle voraus und ergänzt sie um Optimierungslogik.
Verwandte Begriffe: Prädiktive Analytik, Deskriptive Analytik, Maschinelles Lernen
+ Predictive Maintenance
Predictive Maintenance (vorausschauende Instandhaltung) nutzt Sensor- und Betriebsdaten, um den Zustand von Maschinen zu bewerten und Ausfälle vorherzusagen, bevor sie eintreten. Gewartet wird nicht nach festem Kalender, sondern dann, wenn die Daten es nahelegen.
Funktionsweise: Sensoren erfassen laufend Größen wie Vibration, Temperatur, Strom oder Druck. Modelle des maschinellen Lernens erkennen darin Abweichungen vom Normalzustand (Anomalieerkennung) und schätzen die verbleibende Nutzungsdauer – häufig mit Methoden der Überlebenszeitanalyse (Survival Analysis), die auch zensierte Daten (Maschinen, die noch nie ausgefallen sind) korrekt verarbeiten.
Unternehmensbeispiel: Ein Nutzfahrzeughersteller wertet die Telemetriedaten seiner Flotte aus. Ein Modell schätzt für jede Komponente die Ausfallwahrscheinlichkeit der nächsten Wochen; der Service plant Werkstatttermine so, dass Reparaturen in ohnehin geplante Standzeiten fallen und ungeplante Ausfälle deutlich zurückgehen.
Anwendungsfelder:
- Zustandsüberwachung von Produktionsanlagen und Flotten
- Prognose der verbleibenden Nutzungsdauer (Remaining Useful Life)
- Ersatzteil- und Wartungsplanung
- Reduzierung ungeplanter Stillstände
Abgrenzung: Prädiktive Analytik ist der Oberbegriff für datenbasierte Vorhersagen aller Art; Predictive Maintenance ist deren Anwendung auf den Maschinenzustand. Reine Anomalieerkennung meldet Auffälligkeiten, sagt aber noch keinen Ausfallzeitpunkt vorher.
Verwandte Begriffe: Prädiktive Analytik, Überlebenszeitanalyse (Survival Analysis), Anomalieerkennung (Anomaly Detection), Zeitreihenanalyse
+ Process Mining
Process Mining rekonstruiert und analysiert Geschäftsprozesse aus den digitalen Spuren, die sie in IT-Systemen hinterlassen. Aus Ereignisprotokollen (Event Logs) von ERP-, MES- oder Ticketsystemen entsteht ein objektives Bild, wie Prozesse tatsächlich ablaufen – nicht, wie sie im Handbuch stehen.
Funktionsweise: Jeder Prozessschritt hinterlässt einen Log-Eintrag mit Vorgangsnummer, Aktivität und Zeitstempel. Process-Mining-Werkzeuge fügen diese Einträge zu Prozesspfaden zusammen und visualisieren alle tatsächlich durchlaufenen Varianten. Darauf aufbauend lassen sich Durchlaufzeiten messen, Schleifen und Engpässe erkennen sowie Abweichungen vom Sollprozess (Conformance Checking) und deren Ursachen statistisch untersuchen.
Unternehmensbeispiel: Ein Automobilzulieferer analysiert seinen Auftragsdurchlauf vom Eingang bis zur Auslieferung. Das Process Mining zeigt, dass ein Großteil der Verspätungen auf eine manuelle Freigabeschleife zwischen Vertrieb und Arbeitsvorbereitung zurückgeht – ein Schritt, der im offiziellen Prozess gar nicht vorgesehen war.
Anwendungsfelder:
- Durchlaufzeit- und Engpassanalyse in Produktion und Verwaltung
- Ursachenanalyse für Qualitätsabweichungen und Verspätungen
- Conformance Checking gegen Soll-Prozesse
- Vorbereitung von Automatisierungs- und Digitalisierungsprojekten
Abgrenzung: Klassische Prozessberatung stützt sich auf Interviews und Workshops; Process Mining misst den Ist-Prozess vollständig aus Systemdaten. Business Intelligence (BI) aggregiert Kennzahlen, macht aber die Prozesspfade dahinter nicht sichtbar.
Verwandte Begriffe: Business Intelligence (BI), Datenpipeline, Statistische Prozesslenkung (Statistical Process Control), Mustererkennung
+ Prompt / Prompt Engineering
Ein Prompt ist die Eingabe, die einem KI-Sprachmodell gegeben wird – eine Frage, Anweisung oder ein Kontext, auf dessen Basis das Modell eine Ausgabe generiert. Prompt Engineering bezeichnet die systematische Optimierung dieser Eingaben, um die Qualität der Ausgaben zu maximieren.
Funktionsweise: Sprachmodelle sind stark kontextabhängig. Kleine Änderungen in der Formulierung eines Prompts können die Ausgabe grundlegend verändern. Prompt Engineering nutzt diesen Effekt gezielt: durch klare Rollenanweisungen, Beispiele, Formatvorgaben oder schrittweises Schlussfolgern (Chain-of-Thought).
Unternehmensbeispiel: Ein Team der Rechtsabteilung nutzt täglich ein LLM zur Vertragsprüfung. Mit einem gut gestalteten Prompt ("Analysiere diesen Vertrag als erfahrener Anwalt. Liste alle Klauseln, die für uns nachteilig sein könnten, mit Begründung und Seitenzahl.") erhält es strukturierte, verwertbare Ausgaben – statt generischer Zusammenfassungen.
Wichtige Techniken:
- Zero-Shot: Aufgabe direkt stellen, ohne Beispiele
- Few-Shot: Wenige Beispiele als Vorlage mitgeben
- Chain-of-Thought: Modell Schritt für Schritt denken lassen
- System Prompt: Grundlegende Rolle und Verhalten des Modells definieren
- Structured Output: Ausgabeformat vorgeben (JSON, Tabelle, Liste)
Abgrenzung: Prompt Engineering verändert nur die Eingabe – das Modell selbst bleibt unverändert. Fine-Tuning verändert das Modell durch weiteres Training. Für viele Anwendungsfälle ist Prompt Engineering der schnellere, kostengünstigere erste Ansatz.
Verwandte Begriffe: Large Language Model, Fine-Tuning, RAG
+ Punktwolke (Point Cloud)
Eine Punktwolke ist eine Menge von Messpunkten im dreidimensionalen Raum, die jeweils Koordinaten und häufig weitere Attribute wie Intensität, Farbe oder Klassenzugehörigkeit tragen. Sie ist das typische Rohdatenformat von LiDAR-Systemen, terrestrischen Laserscannern und photogrammetrischen Verfahren.
Funktionsweise: Ein Laserscanner misst die Laufzeit ausgesandter Impulse und leitet daraus Entfernungen ab; zusammen mit Position und Orientierung des Sensors ergeben sich absolute 3D-Koordinaten. Die entstehenden Datensätze umfassen häufig Milliarden Punkte und werden in Formaten wie LAS/LAZ gespeichert. Zur Auswertung werden die Punkte gefiltert, ausgedünnt und klassifiziert, etwa in Boden, Vegetation, Gebäude oder Leitungen; hierfür werden neben regelbasierten Verfahren zunehmend neuronale Netze eingesetzt, die direkt auf den Punktdaten arbeiten.
Unternehmensbeispiel: Ein Netzbetreiber lässt seine Freileitungen aus dem Hubschrauber mit LiDAR erfassen. Aus der klassifizierten Punktwolke werden Leiterseile und Vegetation getrennt und die verbleibenden Abstände berechnet, sodass Rückschnittarbeiten dort geplant werden, wo Grenzwerte tatsächlich unterschritten sind.
Anwendungsfelder:
- Vermessung und Bestandsdokumentation von Anlagen und Gebäuden
- Vegetationskontrolle an Leitungen, Gleisen und Straßen
- Erstellung digitaler Gelände- und Oberflächenmodelle
- Rückführung von Bestandsscans in CAD (Computer-Aided Design)-Modelle
- Qualitäts- und Maßprüfung in der Fertigung
Verwandte Begriffe: PDAL, CAD (Computer-Aided Design), Fernerkundung (Remote Sensing), Bildsegmentierung (Image Segmentation)
+ Python
Python ist eine universelle, interpretierte Programmiersprache und die am weitesten verbreitete Sprache der Datenwissenschaft. Ihre gut lesbare Syntax und ein umfangreiches Ökosystem an Bibliotheken machen sie zum Standardwerkzeug für Datenanalyse, Machine Learning und Automatisierung.
Funktionsweise: Python-Code wird von einem Interpreter ausgeführt und bindet für rechenintensive Aufgaben hochoptimierte Bibliotheken ein, die intern in C++ oder C implementiert sind – etwa NumPy für numerische Berechnungen, Pandas für Tabellendaten oder PyTorch für Deep Learning. So verbindet die Sprache schnelle Entwicklung mit hoher Rechenleistung.
Unternehmensbeispiel: Ein Pharmaunternehmen automatisiert die Auswertung seiner klinischen Datenexporte mit Python: Ein Skript liest die Rohdaten ein, prüft sie auf Plausibilität, berechnet Kennzahlen und erzeugt standardisierte Berichte – reproduzierbar statt manuell in Tabellenkalkulationen.
Anwendungsfelder:
- Datenanalyse und -aufbereitung
- Entwicklung und Training von Machine-Learning-Modellen
- Datenpipelines, Automatisierung und APIs
- Wissenschaftliches Rechnen und Prototyping
Verwandte Begriffe: Pandas, PyTorch, Datenwissenschaft (Data Science)
+ PyTorch
PyTorch ist ein Open-Source-Framework für Deep Learning, ursprünglich von Meta entwickelt und heute unter dem Dach der PyTorch Foundation der Linux Foundation. Es ist das in der Forschung und zunehmend auch in der Industrie meistgenutzte Framework zum Entwickeln und Trainieren neuronaler Netze.
Funktionsweise: PyTorch rechnet mit Tensoren (mehrdimensionalen Arrays) auf CPUs und GPUs und baut den Berechnungsgraphen dynamisch zur Laufzeit auf – Modelle werden als gewöhnlicher Python-Code geschrieben und lassen sich entsprechend leicht debuggen. Automatisches Differenzieren (Autograd) liefert die Gradienten für das Training; Bibliotheken wie torchvision oder Hugging Face Transformers setzen darauf auf.
Unternehmensbeispiel: Ein Agrarunternehmen trainiert mit PyTorch ein Modell zur Erkennung von Pflanzenkrankheiten auf Drohnenbildern. Das Team startet mit einem vortrainierten Bildmodell aus dem PyTorch-Ökosystem und passt es per Transfer Learning mit eigenen, annotierten Feldaufnahmen an.
Anwendungsfelder:
- Entwicklung und Training neuronaler Netze für Bild, Text und Zeitreihen
- Forschung und Prototyping neuer Modellarchitekturen
- Feinabstimmung vortrainierter Modelle (Computer Vision, LLMs)
- Deployment über TorchScript, ONNX oder Serving-Frameworks
Abgrenzung: TensorFlow ist das zweite große Deep-Learning-Framework; PyTorch gilt als flexibler und forschungsnäher, TensorFlow als traditionell stark im produktiven Serving. Die Wahl ist heute oft eine Frage von Team-Erfahrung und Ökosystem.
Verwandte Begriffe: TensorFlow, Deep Learning, Neuronales Netzwerk
+ R (Programmiersprache)
R ist eine Programmiersprache und Umgebung für statistische Berechnungen und Datenvisualisierung, entwickelt von Statistikern für Statistiker. In Biostatistik, Agrarforschung und Pharmaindustrie ist R vielfach der Standard für methodisch anspruchsvolle Auswertungen.
Funktionsweise: R bringt statistische Verfahren – von Regressionsmodellen über Versuchsauswertung bis zur Überlebenszeitanalyse – als Kernfunktionalität mit; das CRAN-Archiv ergänzt über 20.000 von der Community beigesteuerte Pakete, das Tidyverse moderne Werkzeuge für Datenaufbereitung und Grafik. Analysen entstehen typischerweise als Skripte oder reproduzierbare Berichte (R Markdown/Quarto) in der Entwicklungsumgebung RStudio.
Unternehmensbeispiel: Ein Agrarunternehmen wertet seine Feldversuche in R aus: gemischte Modelle für die Versuchsdesigns, standardisierte Grafiken je Standort und ein automatisch erzeugter Versuchsbericht. Dieselben Skripte laufen jedes Jahr erneut über die neuen Versuchsdaten.
Anwendungsfelder:
- Statistische Auswertung von Versuchen und Studien (u. a. regulatorisch in der Pharmabranche)
- Explorative Datenanalyse und Visualisierung
- Reproduzierbare Berichte und interaktive Anwendungen mit R Shiny
- Biostatistik und Bioinformatik
Abgrenzung: Gegenüber Python liegt die Stärke von R in Statistik und Visualisierung; Python dominiert bei Deep Learning und Software-Engineering. Viele Teams nutzen beide Sprachen nebeneinander.
Verwandte Begriffe: R Shiny, Python, Statistischer Rückschluss
+ R Shiny
R Shiny ist ein Web-Framework für die Programmiersprache R, mit dem sich interaktive Datenanwendungen und Dashboards direkt aus R-Code erstellen lassen – ohne Kenntnisse in HTML, CSS oder JavaScript. Entwickelt wird es vom Unternehmen Posit (früher RStudio); inzwischen existiert mit Shiny for Python ein Ableger für Python.
Funktionsweise: Eine Shiny-App besteht aus einer UI-Definition (Eingabeelemente, Diagramme, Tabellen) und einer Server-Funktion mit der Berechnungslogik. Das Framework verbindet beide reaktiv: Ändert der Nutzer einen Filter oder Parameter, werden genau die abhängigen Ausgaben neu berechnet. Bereitgestellt werden Apps über Posit Connect, Shiny Server oder Container.
Unternehmensbeispiel: Ein Agrarunternehmen stellt seinen Versuchsleitern eine Shiny-App bereit, in der sie Feldversuchsdaten nach Standort, Sorte und Jahr filtern und statistische Auswertungen als interaktive Grafiken abrufen. Die Statistiker pflegen dafür nur ihren R-Code – eine separate Webentwicklung entfällt.
Anwendungsfelder:
- Interaktive Auswertungs-Dashboards für Fachanwender
- Bereitstellung statistischer Modelle als bedienbare Anwendung
- Prototyping von Datenprodukten vor der vollständigen Umsetzung
- Begleit-Apps zu Studien und Versuchsreihen
Verwandte Begriffe: R (Programmiersprache), Business Intelligence (BI), Datenwissenschaft (Data Science)
+ Random Forest
Random Forest ist ein Ensemble-Verfahren des maschinellen Lernens, das viele Entscheidungsbäume auf zufälligen Teilmengen der Daten und Merkmale trainiert und deren Vorhersagen mittelt oder per Mehrheitsentscheid kombiniert. Das Verfahren ist einfach anzuwenden, wenig anfällig für Overfitting und liefert ohne aufwendiges Tuning brauchbare Ergebnisse.
Funktionsweise: Jeder Baum wird auf einer Bootstrap-Stichprobe der Trainingsdaten trainiert; an jedem Knoten steht zudem nur eine zufällige Auswahl der Merkmale zur Verfügung. Diese doppelte Zufälligkeit sorgt dafür, dass sich die Bäume untereinander unterscheiden; ihre gemittelte Vorhersage ist stabiler als die jedes Einzelbaums. Nebenbei liefert das Verfahren Kennzahlen zur Wichtigkeit einzelner Merkmale.
Unternehmensbeispiel: Ein Forstdienstleister klassifiziert Baumarten aus Fernerkundungs- und Geländedaten. Ein Random-Forest-Modell verarbeitet die heterogenen Merkmale zuverlässig und zeigt zugleich, welche Spektralkanäle die Klassifizierung am stärksten treiben.
Anwendungsfelder:
- Klassifikation von Landnutzung und Vegetation aus Fernerkundungsdaten
- Ausfall- und Qualitätsprognosen in der Fertigung
- Regression auf tabellarischen Daten mit vielen Merkmalen
- Feature Importance als Einstieg in die Modellinterpretation
Abgrenzung: Im Unterschied zum sequentiellen Gradient Boosting entstehen die Bäume beim Random Forest unabhängig voneinander – das macht ihn toleranter gegenüber verrauschten Daten und gegenüber der Wahl der Hyperparameter; bei sorgfältigem Tuning liegt Boosting jedoch oft vorn.
Verwandte Begriffe: Gradient Boosting, Überwachtes Lernen, Klassifizierung
+ Raum-zeitliche Statistik (Spatio-temporal Statistics)
Raum-zeitliche Statistik ist ein Teilgebiet der Statistik, das Daten analysiert, die gleichzeitig eine räumliche und eine zeitliche Dimension besitzen, etwa Messreihen von Sensoren an festen Standorten oder Satellitenaufnahmen derselben Fläche über mehrere Jahre. Sie modelliert Abhängigkeiten in beiden Dimensionen zusammen, statt Raum und Zeit getrennt zu betrachten.
Funktionsweise: Grundlage ist die Beobachtung, dass benachbarte Orte und aufeinanderfolgende Zeitpunkte ähnliche Werte aufweisen (räumliche und zeitliche Autokorrelation). Modelle wie Kriging mit Zeitkomponente, raum-zeitliche Gauß-Prozesse oder hierarchische Bayes-Modelle schätzen daraus Werte für nicht beobachtete Orte und Zeitpunkte samt Unsicherheit. Wird diese Autokorrelation ignoriert, unterschätzen klassische Verfahren die Streuung und liefern zu enge Konfidenzintervalle.
Unternehmensbeispiel: Ein Agrarunternehmen erfasst Bodenfeuchte über ein Netz von Feldsensoren und ergänzt sie durch wöchentliche Satellitenindizes. Ein raum-zeitliches Modell interpoliert daraus eine flächendeckende Feuchtekarte je Kalenderwoche, auch für Teilflächen ohne Sensor, und dient als Grundlage für die Bewässerungsplanung.
Anwendungsfelder:
- Ertrags- und Bestandsentwicklung auf landwirtschaftlichen Flächen
- Umwelt- und Immissionsmonitoring (Luft, Wasser, Boden)
- Ausbreitungsanalysen in Epidemiologie und Pflanzenschutz
- Auslastungs- und Nachfrageprognosen im städtischen Raum
- Qualitätssicherung verteilter Sensornetze
Abgrenzung: Eine reine Zeitreihenanalyse behandelt jede Messstelle isoliert; die raum-zeitliche Statistik nutzt zusätzlich die Information benachbarter Standorte und liefert dadurch auch für datenarme Orte belastbare Schätzungen.
Verwandte Begriffe: Statistischer Rückschluss, Fernerkundung (Remote Sensing), Räumliche Optimierung (Spatial Optimization), Signalverarbeitung
+ Räumliche Optimierung (Spatial Optimization)
Räumliche Optimierung bezeichnet die mathematische Optimierung von Entscheidungen mit geografischem Bezug, etwa der Wahl von Standorten, der Aufteilung von Flächen oder der Planung von Routen. Ziel ist eine Lösung, die eine Kennzahl wie Kosten, Fahrzeit oder Abdeckung unter räumlichen Nebenbedingungen optimiert.
Funktionsweise: Die Aufgabe wird als Optimierungsmodell mit Entscheidungsvariablen, Zielfunktion und Nebenbedingungen formuliert. Klassische Formen sind Facility Location, Set Covering, Gebietsaufteilung und Tourenplanung. Kleine Instanzen lösen exakte Verfahren der gemischt-ganzzahligen Programmierung; für große Netze kommen Heuristiken und Metaheuristiken zum Einsatz. Entfernungen und Fahrzeiten stammen dabei aus Straßennetzen oder GIS-Daten, nicht aus Luftlinienentfernungen.
Unternehmensbeispiel: Ein Logistikdienstleister prüft, wie viele Umschlagpunkte er in einer Region benötigt und wo diese liegen sollten. Das Optimierungsmodell wählt aus mehreren hundert Kandidatenflächen die Kombination, die alle Kunden innerhalb einer zugesagten Lieferzeit erreicht und dabei die Summe aus Standort- und Transportkosten minimiert.
Anwendungsfelder:
- Standort- und Netzplanung für Lager, Filialen und Servicepunkte
- Gebietsaufteilung für Vertrieb und Außendienst
- Tourenplanung und Flottendisposition
- Flächennutzungs- und Anbauplanung in der Landwirtschaft
- Planung von Sensor- und Messnetzen
Abgrenzung: Die Standortanalyse (Location Analysis) beschreibt und bewertet Standorte anhand von Marktdaten; die räumliche Optimierung trifft daraus eine Auswahlentscheidung mit einem formalen Zielkriterium.
Verwandte Begriffe: Präskriptive Analytik, Standortanalyse (Location Analysis), Reinforcement Learning, Raum-zeitliche Statistik (Spatio-temporal Statistics)
+ Regression
Regression ist eine Klasse von Verfahren des überwachten Lernens und der Statistik, die den Zusammenhang zwischen Eingangsgrößen und einer kontinuierlichen Zielgröße modelliert, um numerische Werte vorherzusagen. Typische Zielgrößen sind Mengen, Preise, Temperaturen oder Zeitdauern.
Funktionsweise: Ein Regressionsmodell lernt aus historischen Datenpaaren eine Funktion, die Eingaben auf die Zielgröße abbildet – von der klassischen linearen Regression über Polynom- und Regularisierungsvarianten (Ridge, Lasso) bis zu nichtlinearen Verfahren wie Random Forest oder Gradient Boosting. Die Güte wird über Fehlermaße wie MAE oder RMSE auf zurückgehaltenen Testdaten bewertet.
Unternehmensbeispiel: Ein Agrarunternehmen schätzt den Stickstoffbedarf einzelner Teilflächen aus Bodenproben, Satellitenindizes und Wetterdaten. Das Regressionsmodell liefert je Teilfläche eine konkrete Düngemenge für die teilflächenspezifische Ausbringung.
Anwendungsfelder:
- Ertrags-, Absatz- und Nachfrageprognosen
- Kalibrierung von Sensor- und Messdaten
- Schätzung von Prozessparametern in der Fertigung
- Preis- und Kostenmodellierung
Abgrenzung: Bei der Klassifizierung wird eine diskrete Kategorie vorhergesagt, bei der Regression ein kontinuierlicher Zahlenwert. Die Logistische Regression ist trotz ihres Namens ein Klassifikationsverfahren.
Verwandte Begriffe: Überwachtes Lernen, Prädiktive Analytik, Logistische Regression (Logistic Regression)
+ Reinforcement Learning
Reinforcement Learning (RL, dt. bestärkendes Lernen) ist ein Lernparadigma des maschinellen Lernens, bei dem ein Agent durch Interaktion mit einer Umgebung lernt, Entscheidungen zu treffen, die eine langfristige Belohnung maximieren.
Funktionsweise: Der Agent beobachtet den Zustand der Umgebung, wählt eine Aktion, erhält eine Belohnung (positiv oder negativ) und aktualisiert seine Strategie (Policy) entsprechend. Über viele Iterationen lernt er, welche Aktionsfolgen zu den besten Ergebnissen führen.
Unternehmensbeispiel: Ein Roboter in einem Lager lernt per Reinforcement Learning, wie er Pakete effizient greifen und transportieren kann – ohne explizite Programmierung jeder Bewegung. Durch Millionen von simulierten Versuchen optimiert er seinen Greifarm-Einsatz.
Anwendungsfelder:
- Robotersteuerung und autonome Systeme
- Autonomes Fahren
- Spieleoptimierung (AlphaGo, AlphaZero)
- Optimierung von Lieferketten und Ressourcenplanung
- Training von LLMs (RLHF)
Abgrenzung: Beim überwachten Lernen lernt das Modell von beschrifteten Beispielen. Beim Reinforcement Learning lernt es durch eigenes Handeln und Feedback – ohne vorher gezeigt zu bekommen, was richtig ist.
Verwandte Begriffe: Maschinelles Lernen, Fine-Tuning, Neuronales Netzwerk
+ Retrieval-Augmented Generation (RAG)
Retrieval-Augmented Generation (RAG) ist eine Architektur, die Large Language Models mit einer externen Wissensdatenbank kombiniert. Bevor das Modell eine Antwort generiert, sucht es relevante Informationen in einer indexierten Wissensbasis und nutzt diese als Kontext.
Funktionsweise:
- Die Anfrage des Nutzers wird in ein Embedding umgewandelt.
- Die Vektordatenbank sucht die semantisch ähnlichsten Dokumente oder Passagen.
- Diese Dokumente werden zusammen mit der ursprünglichen Anfrage als Kontext an das LLM übergeben.
- Das Modell generiert eine Antwort auf Basis der gelieferten Informationen.
Unternehmensbeispiel: Ein Maschinenbauunternehmen hat Tausende interne Wartungshandbücher, Serviceberichte und technische Spezifikationen. Ein RAG-System ermöglicht es Technikern, in natürlicher Sprache Fragen zu stellen ("Welches Drehmoment wird für Schraube M12 bei Modell X verwendet?") und präzise Antworten aus den tatsächlichen Dokumenten zu erhalten – mit Quellenangabe.
Vorteile:
- Reduziert Halluzinationen erheblich
- Kein erneutes Training bei neuen Informationen nötig
- Antworten sind auf verifizierbare Quellen zurückführbar
- Kostengünstiger als Fine-Tuning für wissensbasierte Anwendungen
Abgrenzung: RAG ergänzt das Modell mit externem Wissen zur Laufzeit. Fine-Tuning verankert Wissen dauerhaft im Modell durch Training. RAG ist flexibler und aktueller, Fine-Tuning besser geeignet für Stil- oder Verhaltensanpassungen.
Verwandte Begriffe: Large Language Model, Embedding, Halluzination, Vektordatenbank
+ Self-Organizing Map (SOM)
Eine Self-Organizing Map (SOM, dt. selbstorganisierende Karte) ist ein unüberwacht lernendes neuronales Netz, das hochdimensionale Daten auf ein meist zweidimensionales Gitter abbildet und dabei die Nachbarschaftsstruktur der Daten erhält. Ähnliche Datenpunkte landen auf der Karte nahe beieinander, wodurch sich Cluster und Muster visuell erschließen lassen.
Funktionsweise: Jeder Gitterknoten trägt einen Gewichtsvektor in der Dimension der Eingangsdaten. Beim Training wird für jeden Datenpunkt der ähnlichste Knoten (Best Matching Unit) bestimmt; dieser und seine Gitternachbarn werden in Richtung des Datenpunkts angepasst. Über viele Iterationen ordnet sich die Karte so, dass die Topologie der Daten im Gitter erhalten bleibt.
Unternehmensbeispiel: Ein Maschinenbauunternehmen bildet Tausende Betriebszustände seiner Anlagenflotte auf einer SOM ab. Auf der Karte zeichnen sich Regionen für Normalbetrieb, Anfahrphasen und untypische Zustände ab – Auffälligkeiten lassen sich auf einen Blick lokalisieren.
Anwendungsfelder:
- Visualisierung hochdimensionaler Sensor- und Prozessdaten
- Explorative Datenanalyse und Clustering
- Anomalieerkennung über Distanz zur Karte
- Kunden- und Produktsegmentierung
Abgrenzung: Anders als klassische Verfahren der Dimensionsreduktion (Dimensionality Reduction) wie PCA erzeugt die SOM eine diskrete, gitterbasierte Abbildung, die vor allem der visuellen Exploration dient.
Verwandte Begriffe: Unüberwachtes Lernen, Clustering, Neuronales Netzwerk, Dimensionsreduktion (Dimensionality Reduction)
+ SHAP (SHapley Additive exPlanations)
SHAP (SHapley Additive exPlanations) ist ein Verfahren der Explainable AI (XAI), das die Vorhersage eines Machine-Learning-Modells fair auf die Beiträge der einzelnen Eingangsmerkmale aufteilt. Es basiert auf den Shapley-Werten aus der kooperativen Spieltheorie.
Funktionsweise: Für jede einzelne Vorhersage berechnet SHAP, wie viel jedes Merkmal – gemittelt über alle möglichen Merkmalskombinationen – zur Abweichung vom Durchschnittsergebnis beiträgt. Die Beiträge summieren sich exakt zur Modellvorhersage, was die Erklärung in sich konsistent macht. Für Baumverfahren wie Gradient Boosting existiert mit TreeSHAP eine exakte, schnelle Berechnung; die verbreitete Open-Source-Implementierung ist die Python-Bibliothek shap.
Unternehmensbeispiel: Ein Pharmaunternehmen betreibt ein Modell zur Vorhersage von Chargenausfällen. SHAP-Analysen zeigen pro Charge, welche Prozessparameter das Ausfallrisiko getrieben haben – die Verfahrenstechnik erhält damit konkrete Ansatzpunkte statt einer Black-Box-Zahl.
Anwendungsfelder:
- Erklärung einzelner Modellentscheidungen gegenüber Fachabteilungen und Auditoren
- Globale Merkmalswichtigkeit und Modell-Debugging
- Plausibilitätsprüfung vor der Produktivsetzung
- Dokumentationspflichten in regulierten Branchen
Abgrenzung: LIME nähert das Modell lokal durch ein einfaches Ersatzmodell an; SHAP liefert dank spieltheoretischer Fundierung konsistentere, aber rechenintensivere Erklärungen.
Verwandte Begriffe: Explainable AI (XAI), LIME (Local Interpretable Model-agnostic Explanations), Gradient Boosting
+ Signalverarbeitung
Signalverarbeitung bezeichnet Methoden zur Verarbeitung und Analyse von Daten, die als kontinuierliche oder diskrete Signale vorliegen – z. B. Zeitreihen, Audiodaten, Bilder oder Sensormessungen.
Funktionsweise: Signale werden gefiltert (Rauschen entfernt), transformiert (z. B. Fourier-Transformation für Frequenzanalyse), segmentiert und auf aussagekräftige Merkmale reduziert, die dann für weitere Analysen oder ML-Modelle genutzt werden.
Unternehmensbeispiel: Ein Windparkbetreiber analysiert Vibrationssignale der Turbinenlager in Echtzeit. Signalverarbeitungsalgorithmen erkennen Frequenzveränderungen, die auf beginnenden Verschleiß hindeuten – bevor ein menschlicher Techniker etwas bemerkt.
Anwendungsfelder:
- Predictive Maintenance durch Schwingungsanalyse
- Spracherkennung (Audioverarbeitung)
- EKG- und EEG-Analyse in der Medizin
- Radar- und Sonarsignalverarbeitung
Verwandte Begriffe: Mustererkennung, Zeitreihenanalyse, Industrie 4.0
+ Smart City
Eine Smart City nutzt digitale Technologien und Datenanalyse, um städtische Infrastruktur effizienter zu gestalten, Ressourcen zu schonen und die Lebensqualität der Bevölkerung zu verbessern.
Funktionsweise: Sensornetzwerke, IoT-Geräte und vernetzte Systeme erfassen kontinuierlich Daten zu Verkehr, Energie, Wasser, Abfall und Umwelt. Diese Daten fließen in Analyseplattformen, die Echtzeitentscheidungen oder automatisierte Steuerungseingriffe ermöglichen.
Anwendungsfelder:
- Adaptive Verkehrssteuerung zur Vermeidung von Staus
- Intelligente Straßenbeleuchtung (nur bei Bedarf aktiv)
- Bedarfsgerechte Müllabfuhr (Sensoren melden volle Behälter)
- Echtzeit-Überwachung von Luftqualität und Lärm
- Digitale Bürgerdienste und Partizipationsplattformen
Unternehmensbeispiel: Eine mittelgroße Kommune verknüpft die Zähldaten ihrer Ampelanlagen mit Fahrplan- und Wetterdaten, um die Grüne Welle auf den Hauptachsen an die tatsächliche Belastung anzupassen. Dieselben Daten nutzt die Stadtplanung, um Engstellen zu erkennen und Radwege dort auszubauen, wo sie den Autoverkehr spürbar entlasten. Die Auswertung läuft auf einer zentralen Plattform, an die weitere Sensorik – etwa Luftmessstationen – schrittweise angebunden wird.
Verwandte Begriffe: Industrie 4.0, Internet of Things (IoT), Zeitreihenanalyse
+ SQL
SQL (Structured Query Language) ist die Standardsprache zur Abfrage und Verwaltung relationaler Datenbanken. In den 1970er-Jahren bei IBM entwickelt und in den 1980er-Jahren von ANSI und ISO standardisiert, ist SQL bis heute die Grundfertigkeit jeder Datenarbeit – vom Reporting bis zur Aufbereitung von Trainingsdaten.
Funktionsweise: SQL ist deklarativ: Die Abfrage beschreibt, welches Ergebnis gewünscht ist (Filter, Verknüpfungen, Aggregationen), und die Datenbank bestimmt den effizienten Ausführungsweg selbst. Kernoperationen sind SELECT-Abfragen mit JOINs über Tabellen hinweg sowie Befehle zum Anlegen und Ändern von Tabellen und Daten. Moderne Warehouses und Abfrage-Engines führen SQL auch über sehr große, verteilte Datenbestände aus.
Unternehmensbeispiel: Ein Maschinenbauunternehmen beantwortet Fragen wie "Welche Ersatzteile wurden im letzten Quartal je Region am häufigsten verkauft?" mit einer einzigen SQL-Abfrage über Auftrags- und Artikeltabellen – Sekunden statt manueller Auswertung mehrerer Exporte.
Anwendungsfelder:
- Abfragen und Reporting auf strukturierten Daten
- Datenaufbereitung im Data Warehouse (z. B. mit dbt)
- Ad-hoc-Analysen durch Fachanwender und Data Scientists
- Datenqualitätsprüfungen und Datenmigration
Verwandte Begriffe: Data Warehouse, dbt, Strukturierte Daten
+ Standortanalyse (Location Analysis)
Standortanalyse ist die datenbasierte Bewertung geografischer Standorte hinsichtlich ihrer Eignung für eine bestimmte Nutzung, etwa eine Filiale, ein Werk oder einen Servicestandort. Sie verbindet Geodaten, Markt- und Bewegungsdaten zu einer vergleichbaren Bewertung mehrerer Kandidaten.
Funktionsweise: Zunächst werden für jeden Kandidatenstandort Merkmale aus verschiedenen Quellen zusammengeführt: Einwohner- und Kaufkraftdaten, Wettbewerbsstandorte, Erreichbarkeit im Straßen- und ÖPNV-Netz, Flächennutzung, Passantenfrequenz. Anschließend schätzt ein statistisches Modell oder ein Verfahren des maschinellen Lernens die erwartete Zielgröße wie Umsatz, Kundenzahl oder Auslastung aus den Merkmalen bestehender Standorte und überträgt sie auf die Kandidaten. Die Ergebnisse werden als Karte und als Rangliste ausgegeben.
Unternehmensbeispiel: Ein Handelsunternehmen mit 80 bestehenden Filialen trainiert ein Modell auf den Umsätzen dieser Standorte und deren Umfeldmerkmalen. Für 300 potenzielle Neustandorte prognostiziert das Modell anschließend den erwarteten Umsatz und weist zugleich aus, welche Kandidaten hauptsächlich Umsatz bestehender Filialen umverteilen würden.
Anwendungsfelder:
- Expansions- und Filialnetzplanung im Handel
- Geomarketing und Einzugsgebietsanalyse
- Standortwahl für Produktions- und Servicestandorte
- Bewertung von Gewerbe- und Entwicklungsflächen
- Versorgungsplanung im öffentlichen Sektor
Verwandte Begriffe: Räumliche Optimierung (Spatial Optimization), Prädiktive Analytik, ArcGIS, Smart City
+ StarDist
StarDist ist eine quelloffene Deep-Learning-Methode zur Segmentierung von Zellkernen und ähnlich geformten Objekten in mikroskopischen Bildern, die jedes Objekt als sternkonvexes Polygon beschreibt. Diese Formannahme macht das Verfahren besonders zuverlässig bei dicht gepackten, annähernd runden Kernen.
Funktionsweise: Ein neuronales Netz auf Basis der U-Net-Architektur sagt für jedes Pixel zwei Größen vorher: die Wahrscheinlichkeit, zum Inneren eines Objekts zu gehören, und die Abstände zum Objektrand in einer festen Anzahl radialer Richtungen. Aus diesen Abständen entsteht je Pixel ein Polygonvorschlag; eine Non-Maximum-Suppression wählt daraus die endgültigen Objekte aus. Weil jedes Objekt eigenständig als Polygon vorliegt, bleiben berührende Kerne getrennt, wo pixelweise Segmentierung sie klassischerweise verschmelzen lässt. StarDist gibt es für 2D und 3D und ist in Werkzeuge wie Fiji/ImageJ, napari und QuPath eingebunden.
Unternehmensbeispiel: Ein Auftragslabor quantifiziert Zellkerne in Gewebeschnitten für eine präklinische Studie. StarDist trennt auch in zelldichten Regionen die einzelnen Kerne, sodass Kernzahl pro Fläche und Markerintensität je Kern reproduzierbar über alle Schnitte hinweg bestimmt werden.
Anwendungsfelder:
- Zellkernsegmentierung in Histologie und Fluoreszenzmikroskopie
- Quantitative Auswertung von Gewebeschnitten in der Präklinik
- 3D-Segmentierung in Volumendatensätzen
- Vorverarbeitung für Zellverfolgung und Klassifikation
- Erzeugung von Trainings- und Referenzannotationen
Verwandte Begriffe: Cellpose, Bildsegmentierung (Image Segmentation), U-Net, CNN (Convolutional Neural Network)
+ Statistische Prozesslenkung (Statistical Process Control)
Statistische Prozesslenkung (Statistical Process Control, SPC) überwacht Fertigungsprozesse mit statistischen Mitteln, um Abweichungen früh zu erkennen und die Qualität stabil zu halten. Kernwerkzeug sind Qualitätsregelkarten (Control Charts), die Messwerte gegen statistisch hergeleitete Eingriffsgrenzen stellen.
Funktionsweise: Aus dem laufenden Prozess werden Stichproben gemessen (z. B. Maße, Kräfte, Temperaturen). Solange die Werte innerhalb der Eingriffsgrenzen zufällig streuen, gilt der Prozess als beherrscht. Systematische Muster – Trends, Sprünge, Ausreißer – deuten auf besondere Ursachen hin (etwa Werkzeugverschleiß oder eine Materialcharge) und lösen eine Ursachenanalyse aus. Kennzahlen wie cp/cpk beschreiben, wie sicher der Prozess die Toleranzen einhält.
Unternehmensbeispiel: Ein Automobilzulieferer überwacht Bohrungsdurchmesser in der Zerspanung. Regelkarten je Fertigungslinie erkennen eine schleichende Drift durch Werkzeugverschleiß Tage, bevor Ausschuss entsteht – das Werkzeug wird im geplanten Wartungsfenster getauscht statt nach einem Qualitätsvorfall.
Anwendungsfelder:
- Überwachung kritischer Merkmale in der Serienfertigung
- Prozessfähigkeitsanalysen (cp/cpk) bei Neuanläufen
- Ursachenanalyse bei Qualitätsabweichungen
- Grundlage für datengestützte Qualitätsregelkreise
Abgrenzung: SPC arbeitet mit wenigen, gezielt gewählten Merkmalen und transparenten statistischen Regeln; Anomalieerkennung mit maschinellem Lernen kann viele Signale gleichzeitig überwachen und ergänzt SPC, ersetzt aber nicht dessen in Qualitätsnormen verankerte Methodik.
Verwandte Begriffe: Statistischer Rückschluss, Anomalieerkennung (Anomaly Detection), Zeitreihenanalyse, Process Mining
+ Statistischer Rückschluss
Statistischer Rückschluss bezeichnet Methoden, mit denen aus einer Stichprobe Aussagen über eine größere Grundgesamtheit getroffen werden – unter Berücksichtigung von Unsicherheit und Variabilität.
Funktionsweise: Auf Basis von Stichprobendaten werden Schätzer (z. B. Mittelwert, Varianz) berechnet, Hypothesen getestet (z. B. "Hat Maßnahme A einen Effekt?") und Konfidenzintervalle bestimmt, die den Bereich angeben, in dem der wahre Wert bei gewähltem Sicherheitsniveau erwartet wird.
Unternehmensbeispiel: Ein Pharmaunternehmen testet ein neues Medikament an 500 Patienten. Statistischer Rückschluss ermöglicht die Aussage: "Auf dem 95-%-Niveau ist das Medikament statistisch signifikant wirksamer als das Placebo" – auf Basis der Stichprobe, nicht der gesamten Bevölkerung.
Wichtige Konzepte:
- Hypothesentest und p-Wert
- Konfidenzintervalle
- Bayes-Statistik vs. frequentistische Statistik
- A/B-Tests in Marketing und Produktentwicklung
Verwandte Begriffe: Deskriptive Analytik, Datenwissenschaft, Prädiktive Analytik
+ Strukturierte Daten
Strukturierte Daten sind Daten, die in einem klar definierten Schema organisiert sind – typischerweise in Tabellenform mit festen Spalten und Datentypen. Sie sind einfach zu speichern, abzufragen und zu analysieren.
Funktionsweise: Strukturierte Daten lassen sich direkt in relationalen Datenbanken (SQL) speichern. Jede Zeile repräsentiert einen Datensatz, jede Spalte ein Attribut mit definiertem Typ (Text, Zahl, Datum etc.).
Unternehmensbeispiel: Ein Hersteller von Pflanzenschutzmitteln führt Chargendaten aus der Produktion, Laborwerte der Qualitätskontrolle und Lieferscheine in einer relationalen Datenbank zusammen. Weil alle drei Quellen dasselbe Schema für Chargennummer und Zeitstempel verwenden, lässt sich eine auffällige Laborprobe per SQL-Abfrage bis zur Produktionsschicht und zum eingesetzten Rohstoff zurückverfolgen. Auswertungen, die zuvor aus einzelnen Tabellen von Hand zusammengesucht wurden, entstehen so als wiederholbare Abfrage.
Beispiele: Kundendatenbanken, Transaktionsdaten, Produktkataloge, Messwerte aus Produktionsanlagen.
Abgrenzung: Unstrukturierte Daten wie E-Mails, Bilder oder Social-Media-Posts folgen keinem festen Schema und erfordern spezielle Verarbeitung. Semistrukturierte Daten (JSON, XML) haben eine flexible, aber erkennbare Struktur.
Verwandte Begriffe: Unstrukturierte Daten, Data Warehouse, Data Wrangling
+ Support Vector Machine (SVM)
Eine Support Vector Machine (SVM) ist ein Verfahren des überwachten Lernens, das Datenpunkte durch eine Trennfläche mit maximalem Abstand zu den nächstgelegenen Punkten beider Klassen separiert. Diese nächstgelegenen Punkte – die Stützvektoren – geben dem Verfahren seinen Namen.
Funktionsweise: Die SVM sucht die Hyperebene, die den Randabstand (Margin) zwischen den Klassen maximiert; nur die Stützvektoren bestimmen ihre Lage. Nicht linear trennbare Daten werden über den sogenannten Kernel-Trick implizit in einen höherdimensionalen Raum abgebildet, in dem eine lineare Trennung möglich wird – gängige Kernel sind der RBF- und der polynomielle Kernel. Varianten existieren auch für Regression (SVR) und Ausreißererkennung (One-Class SVM).
Unternehmensbeispiel: Ein Anbieter von Laborautomatisierung klassifiziert Spektraldaten von Proben mit wenigen hundert gelabelten Messungen. Eine SVM mit RBF-Kernel erreicht auf dem kleinen, hochdimensionalen Datensatz eine zuverlässige Trennung, wo datenhungrigere Verfahren zu Overfitting neigen.
Anwendungsfelder:
- Klassifizierung kleiner, hochdimensionaler Datensätze (Spektren, Genexpressionsdaten)
- Textklassifikation nach TF-IDF-Vektorisierung
- Ausreißer- und Neuheitserkennung (One-Class SVM)
- Qualitätsklassifikation in Labor und Fertigung
Abgrenzung: Gegenüber neuronalen Netzen benötigen SVMs deutlich weniger Trainingsdaten und Rechenleistung, skalieren aber schlechter auf sehr große Datensätze und liefern keine direkten Klassenwahrscheinlichkeiten.
Verwandte Begriffe: Überwachtes Lernen, Klassifizierung, Anomalieerkennung (Anomaly Detection)
+ Surrogate Model (Ersatzmodell)
Ein Surrogate Model (Ersatzmodell) ist ein schnelles, datengetriebenes Näherungsmodell für eine aufwendige Berechnung oder einen teuren Versuch – typischerweise für Simulationen wie FEM (Finite-Elemente-Methode) oder CFD (Strömungssimulation). Es liefert in Millisekunden Ergebnisse, für die die Originalsimulation Stunden benötigt.
Funktionsweise: Zunächst wird die Originalsimulation für eine begrenzte Zahl von Parameterkombinationen ausgeführt. Auf diesen Ergebnissen wird ein Modell des maschinellen Lernens trainiert – je nach Datenlage ein Gauß-Prozess, Gradient Boosting oder ein Neuronaler Operator –, das den Zusammenhang zwischen Eingangsparametern und Simulationsergebnis lernt. Das trainierte Ersatzmodell ersetzt die Simulation dann in Optimierungsschleifen, Sensitivitätsanalysen oder interaktiven Auslegungswerkzeugen.
Unternehmensbeispiel: Ein Automobilzulieferer legt ein Strukturbauteil aus. Statt für jede Geometrievariante eine FEM-Rechnung von mehreren Stunden zu starten, prüft ein Ersatzmodell tausende Varianten in Minuten und schlägt die vielversprechendsten für die finale Simulation vor – die Entwicklungsschleife verkürzt sich von Wochen auf Tage.
Anwendungsfelder:
- Beschleunigung FEM- und CFD-gestützter Produktentwicklung
- Parameteroptimierung und Sensitivitätsanalysen
- Echtzeitfähige Modelle für digitale Zwillinge
- Versuchsplanung mit weniger physischen Prototypen und Prüfläufen
Abgrenzung: Ein Ersatzmodell nähert die Ergebnisse eines bestimmten Simulationsaufbaus an, meist als einzelne Kenngrößen; ein Neuronaler Operator (Neural Operator) sagt ganze Ergebnisfelder vorher und verallgemeinert über Geometrien und Auflösungen hinweg.
Verwandte Begriffe: Gauß-Prozess (Gaussian Process), Neuronaler Operator (Neural Operator), CAD (Computer-Aided Design), Maschinelles Lernen
+ Tabular Foundation Models
Tabular Foundation Models sind vortrainierte Machine-Learning-Modelle auf Basis der Transformer-Architektur, die Vorhersagen auf tabellarischen Daten ohne aufgabenspezifisches Training treffen können. Bekanntester Vertreter ist die TabPFN-Modellfamilie.
Funktionsweise: Das Modell wird einmalig auf einer großen Zahl synthetischer Tabellenaufgaben vortrainiert. Für eine neue Aufgabe erhält es die Trainingszeilen und die zu prognostizierenden Zeilen gemeinsam als Eingabe und sagt die Zielwerte in einem einzigen Vorwärtsdurchlauf vorher (In-Context Learning) – ohne Gradiententraining und ohne Hyperparameter-Tuning. Das funktioniert derzeit vor allem bei kleinen bis mittelgroßen Tabellen.
Unternehmensbeispiel: Ein Ingenieurdienstleister muss aus nur 400 dokumentierten Versuchsläufen die Ausfallneigung einer Baugruppe schätzen. Ein Tabular Foundation Model liefert auf dem kleinen Datensatz in Sekunden ein konkurrenzfähiges Modell, wo klassisches Training samt Hyperparameter-Suche deutlich länger gedauert hätte.
Anwendungsfelder:
- Prognosen auf kleinen und mittleren tabellarischen Datensätzen
- Schnelle Baselines und Machbarkeitsstudien in Data-Science-Projekten
- Anwendungsfälle mit teurer Datenerhebung (Laborversuche, Feldstudien)
- AutoML-Pipelines als starke Standardkomponente
Abgrenzung: Anders als Gradient Boosting oder Random Forest wird kein Modell je Aufgabe trainiert; das Wissen steckt im Vortraining. Bei sehr großen Tabellen bleiben klassische Verfahren derzeit meist die erste Wahl.
Verwandte Begriffe: Transformer-Architektur, Strukturierte Daten, Transfer Learning, Gradient Boosting
+ TensorFlow
TensorFlow ist eine Open-Source-Bibliothek für maschinelles Lernen, die ursprünglich vom Google-Brain-Team entwickelt wurde. Sie ermöglicht die Entwicklung, das Training und das Deployment von ML-Modellen auf verschiedenen Plattformen – von mobilen Geräten bis zu Cloud-Clustern.
Funktionsweise: TensorFlow repräsentiert Berechnungen als gerichtete Graphen, in denen Knoten mathematische Operationen und Kanten Datentensoren darstellen. Die Bibliothek optimiert diese Berechnungen automatisch für verfügbare Hardware (CPU, GPU, TPU).
Ökosystem:
- TensorFlow Core: Grundlegende ML-Operationen
- Keras: High-Level API für schnelles Modellprototyping
- TensorFlow Lite (heute LiteRT): Optimiert für mobile und Edge-Geräte
- TensorFlow.js: ML im Browser via JavaScript
- TensorFlow Serving: Deployment von Modellen in der Produktion
Unternehmensbeispiel: Ein Landmaschinenhersteller trainiert ein Bildmodell, das Unkraut von Kulturpflanzen unterscheidet, und lässt es direkt auf dem Steuergerät einer Feldspritze laufen. Trainiert wird auf GPU-Servern über die Keras-API; für den Einsatz auf dem Gerät wird das Modell nach LiteRT konvertiert und quantisiert, damit es im verfügbaren Speicher- und Zeitbudget bleibt. Die Entscheidung zwischen TensorFlow und PyTorch fiel hier über die Deployment-Kette, nicht über die Modellarchitektur – beide Frameworks bilden die benötigten Netze ab.
Abgrenzung: TensorFlow ist eines von mehreren führenden ML-Frameworks. PyTorch (Meta) ist besonders in der Forschung beliebt. Scikit-learn eignet sich für klassisches ML. Keras abstrahiert TensorFlow für einfachere Anwendung.
Verwandte Begriffe: Deep Learning, Neuronales Netzwerk, Maschinelles Lernen
+ Text Mining
Text Mining (Textanalyse) bezeichnet die automatische Extraktion strukturierter Informationen aus unstrukturierten Texten mithilfe von NLP- und Data-Mining-Methoden.
Funktionsweise: Texte werden tokenisiert, linguistisch analysiert und auf Muster untersucht. Ergebnisse können Klassifizierungen (z. B. Stimmung: positiv/negativ), extrahierte Entitäten (Namen, Orte, Daten) oder thematische Cluster sein.
Unternehmensbeispiel: Ein Konsumgüterhersteller analysiert täglich Tausende Online-Bewertungen und Social-Media-Kommentare. Text Mining identifiziert automatisch, welche Produkteigenschaften positiv, welche negativ bewertet werden – ohne manuelles Lesen.
Anwendungsfelder:
- Kundenfeedback-Analyse
- Marktforschung und Wettbewerbsbeobachtung
- Automatische Dokumentenklassifizierung
- Forensik und Compliance-Überwachung
- News-Monitoring
Abgrenzung: Text Mining extrahiert Informationen aus bestehendem Text. Generative KI erstellt neuen Text. NLP ist der technische Unterbau, auf dem Text Mining aufbaut.
Verwandte Begriffe: NLP, Data Mining, Unstrukturierte Daten
+ TF-IDF
TF-IDF (Term Frequency – Inverse Document Frequency) ist ein statistisches Gewichtungsverfahren, das angibt, wie kennzeichnend ein Wort für ein einzelnes Dokument innerhalb einer größeren Dokumentensammlung ist.
Funktionsweise: Die Term Frequency misst, wie oft ein Begriff in einem Dokument vorkommt. Die Inverse Document Frequency senkt das Gewicht von Begriffen, die in nahezu allen Dokumenten des Korpus auftauchen, etwa Funktions- und Formelwörter oder Textbausteine. Das Produkt beider Größen fällt dort hoch aus, wo ein Begriff im einzelnen Dokument häufig, im Gesamtbestand aber selten ist. Jedes Dokument wird dadurch zu einem dünn besetzten Zahlenvektor, den Verfahren des maschinellen Lernens direkt verarbeiten können.
Unternehmensbeispiel: Ein Maschinenbauunternehmen wertet mehrere Zehntausend Wartungsberichte aus. TF-IDF hebt je Bericht die charakteristischen Fehlerbegriffe hervor, während allgemeine Wörter wie "Anlage" oder "geprüft" kaum ins Gewicht fallen. Auf dieser Grundlage lassen sich Berichte nach Fehlerbild gruppieren und wiederkehrende Schwachstellen sichtbar machen.
Anwendungsfelder:
- Dokumentensuche und Relevanz-Ranking
- Automatische Schlagwortextraktion
- Textklassifizierung und Themenzuordnung
- Erkennung ähnlicher oder doppelter Dokumente
- Merkmalserzeugung für nachgelagerte Modelle
Abgrenzung: Bag of Words zählt Wortvorkommen ungewichtet. TF-IDF ergänzt diese Zählung um ein Maß für die Unterscheidungskraft eines Begriffs im Korpus.
Verwandte Begriffe: Bag of Words, Text Mining, Natural Language Processing (NLP), Feature Engineering
+ Tibco Spotfire
Tibco Spotfire – seit dem Übergang an die Cloud Software Group nur noch als Spotfire vermarktet – ist eine kommerzielle Business-Intelligence- und Analyseplattform für die interaktive Visualisierung und Exploration großer Datenbestände. Sie ist besonders in datenintensiven Branchen wie Life Science, Chemie und Energie verbreitet.
Funktionsweise: Spotfire verbindet sich mit Datenbanken, Dateien und Streaming-Quellen und stellt die Daten in verknüpften, interaktiven Visualisierungen dar: Eine Auswahl in einem Diagramm filtert alle anderen mit (Brushing/Linking). Für weitergehende Analysen lassen sich R- und Python-Skripte einbetten, sodass statistische Modelle direkt in Dashboards nutzbar werden.
Unternehmensbeispiel: Ein Pharmaunternehmen analysiert Hochdurchsatz-Screening-Daten in Spotfire: Forscher filtern Millionen Messpunkte interaktiv nach Substanzklassen und erkennen Wirkmuster visuell, während eingebettete R-Skripte Dosis-Wirkungs-Kurven berechnen.
Anwendungsfelder:
- Explorative Analyse großer Forschungs- und Labordatensätze
- Self-Service-Dashboards für Fachabteilungen
- Prozess- und Qualitätsmonitoring in der Fertigung
- Kombination visueller Analyse mit eingebetteter Statistik (R/Python)
Abgrenzung: Gegenüber Power BI ist Spotfire stärker auf explorative, wissenschaftsnahe Analysen ausgerichtet; Power BI ist stärker im Standard-Reporting und in der Integration in Microsoft-Umgebungen.
Verwandte Begriffe: Business Intelligence (BI), Power BI, Deskriptive Analytik
+ Token / Tokenisierung
Ein Token ist die kleinste Verarbeitungseinheit eines Sprachmodells. Tokenisierung bezeichnet den Prozess, einen Text in diese Einheiten zu zerlegen. Tokens sind weder zwingend Wörter noch einzelne Buchstaben – sie liegen typischerweise dazwischen.
Funktionsweise: Moderne Tokenizer (z. B. Byte Pair Encoding, BPE) zerlegen Text in häufig vorkommende Zeichenfolgen. Das Wort "Tokenisierung" könnte z. B. in "Token", "is", "ierung" aufgeteilt werden. Jeder Token wird einer Zahl (ID) zugeordnet, die das Modell verarbeitet.
Warum Tokens wichtig sind:
- Die Kontextlänge eines LLMs wird in Tokens gemessen (z. B. 128.000 Tokens ≈ 100.000 Wörter englischer Text; deutscher Text benötigt pro Wort mehr Tokens)
- API-Kosten werden pro Token berechnet
- Tokens beeinflussen, wie ein Modell Text "sieht" – Tippfehler oder ungewöhnliche Schreibweisen können die Tokenisierung stören
Unternehmensbeispiel: Ein Unternehmen plant, lange Verträge (30 Seiten ≈ 15.000 Tokens) von einem LLM analysieren zu lassen. Das Wissen über Tokens hilft bei der Kostenplanung und der Auswahl des richtigen Modells.
Abgrenzung: Tokens sind das "Vokabular" des Modells – nicht zu verwechseln mit semantischen Embeddings, die die Bedeutung eines Texts in Vektoren kodieren.
Verwandte Begriffe: Large Language Model, Embedding, NLP
+ Transfer Learning
Transfer Learning bezeichnet die Methode, ein bereits vortrainiertes Modell als Ausgangspunkt für eine neue Aufgabe zu verwenden – anstatt ein Modell von Grund auf zu trainieren.
Funktionsweise: Ein großes Modell wird zunächst auf einem allgemeinen, umfangreichen Datensatz trainiert (Pretraining). Die erlernten Repräsentationen werden dann auf eine spezifischere Aufgabe übertragen – entweder durch Fine-Tuning (das Modell wird weiter angepasst) oder Feature Extraction (die Repräsentationen werden direkt genutzt).
Unternehmensbeispiel: Ein Startup möchte ein Modell zur medizinischen Bilderkennung entwickeln. Statt Millionen von Trainingsbildern zu benötigen, nutzt es ein vortrainiertes Bilderkennungsmodell (z. B. ResNet) und passt es mit einigen tausend Röntgenaufnahmen an – Transfer Learning reduziert den Aufwand erheblich.
Vorteile:
- Deutlich geringerer Datenbedarf für neue Aufgaben
- Erheblich geringere Trainingskosten
- Schnellerer Weg zu qualitativ guten Modellen
Abgrenzung: Transfer Learning ist das Prinzip, vorhandenes Wissen zu übertragen. Fine-Tuning ist eine konkrete Methode, mit der Transfer Learning umgesetzt wird.
Verwandte Begriffe: Fine-Tuning, Large Language Model, Deep Learning
+ Transformer-Architektur
Die Transformer-Architektur ist die technische Grundlage der meisten modernen KI-Sprachmodelle, darunter GPT, Claude, BERT und viele andere. Sie wurde 2017 von Google in der wegweisenden Publikation "Attention Is All You Need" vorgestellt und hat frühere Architekturen wie RNNs und LSTMs in den meisten NLP-Aufgaben verdrängt.
Funktionsweise: Der Kernmechanismus ist der Self-Attention-Mechanismus: Das Modell lernt für jeden Teil eines Texts, welche anderen Teile relevant sind – unabhängig von deren Position im Text. Dies ermöglicht das Erfassen weitreichender Abhängigkeiten (z. B. ein Pronomen und das zugehörige Nomen am Anfang eines langen Satzes). Transformer können zudem hochgradig parallelisiert trainiert werden, was das Training auf riesigen Datensätzen erst praktikabel macht.
Unternehmensbeispiel: Der Transformer ist die Architektur hinter jedem modernen LLM-gestützten Assistenten. Ohne Transformer kein GPT, kein Claude, kein Gemini – und damit keine der modernen KI-Anwendungen, die Unternehmen heute einsetzen.
Wichtige Varianten:
- Encoder-only (z. B. BERT): Gut für Textverstehen und Klassifizierung
- Decoder-only (z. B. GPT, Claude): Gut für Textgenerierung
- Encoder-Decoder (z. B. T5, BART): Gut für Übersetzung und Zusammenfassung
Abgrenzung: Die Transformer-Architektur ist der Bauplan. Ein Large Language Model ist die konkrete Umsetzung – ein Transformer, der auf riesigen Textmengen trainiert wurde.
Verwandte Begriffe: Large Language Model, Deep Learning, NLP
+ U-Net
U-Net ist eine CNN-Architektur für die semantische Bildsegmentierung, die einen kontrahierenden Encoder-Pfad mit einem expandierenden Decoder-Pfad kombiniert und beide über Skip Connections koppelt.
Funktionsweise: Der Encoder verkleinert das Bild schrittweise und erfasst dabei den Kontext, der Decoder vergrößert die Merkmalskarten wieder auf die ursprüngliche Auflösung. Die Skip Connections reichen feine Ortsinformationen aus den frühen Schichten direkt an den Decoder weiter, wodurch Kanten scharf bleiben. Ausgegeben wird eine Wahrscheinlichkeitskarte je Klasse und Bildpunkt. Die Architektur stammt aus der biomedizinischen Bildverarbeitung und wurde 2015 an der Universität Freiburg vorgestellt; sie kommt in Verbindung mit Datenaugmentierung schon mit wenigen annotierten Bildern aus.
Unternehmensbeispiel: Ein Agrardienstleister leitet Feldgrenzen und Fahrgassen aus Satellitenbildern ab. Ein U-Net segmentiert die Flächen pixelgenau; die sehr großen Szenen werden dabei über gekachelte Inferenz verarbeitet.
Anwendungsfelder:
- Flächensegmentierung in Satelliten- und Drohnenbildern
- Zell- und Gewebesegmentierung in der Mikroskopie
- Riss- und Defektflächenerkennung in der Materialprüfung
- Extraktion von Straßen, Gebäuden und Gewässern
- Vorverarbeitung für flächenbezogene Auswertungen
Verwandte Begriffe: Bildsegmentierung (Image Segmentation), CNN (Convolutional Neural Network), Gekachelte Inferenz (Tiled Inference), Fernerkundung (Remote Sensing)
+ Überlebenszeitanalyse (Survival Analysis)
Die Überlebenszeitanalyse (Survival Analysis) ist eine statistische Methodenfamilie zur Modellierung der Zeit bis zum Eintritt eines Ereignisses – etwa Maschinenausfall, Therapieversagen oder Kundenabwanderung. Ihre Besonderheit ist der korrekte Umgang mit zensierten Daten, also Beobachtungen, bei denen das Ereignis bis zum Ende des Beobachtungszeitraums noch nicht eingetreten ist.
Funktionsweise: Zentrale Größen sind die Überlebensfunktion (Wahrscheinlichkeit, dass das Ereignis bis Zeitpunkt t noch nicht eingetreten ist) und die Hazard-Funktion (momentanes Ereignisrisiko zum Zeitpunkt t, gegeben bisheriges "Überleben"). Klassische Verfahren sind der Kaplan-Meier-Schätzer und die Cox-Regression, die den Einfluss von Kovariaten auf das Risiko quantifiziert; daneben existieren Machine-Learning-Varianten wie Random Survival Forests.
Unternehmensbeispiel: Ein Maschinenbauunternehmen modelliert die Zeit bis zum Ausfall von Hydraulikpumpen aus Betriebsstunden, Lastprofilen und Wartungshistorie. Viele Pumpen laufen am Analysestichtag noch – die Überlebenszeitanalyse verwertet auch diese zensierten Fälle und liefert belastbare Restlebensdauer-Schätzungen für die Wartungsplanung.
Anwendungsfelder:
- Predictive Maintenance und Restlebensdauer-Schätzung (RUL)
- Klinische Studien und Pharmaforschung (Zeit bis Ereignis)
- Kundenabwanderung (Churn) über die Zeit
- Zuverlässigkeitsanalyse von Bauteilen und Systemen
Abgrenzung: Eine gewöhnliche Regression auf die Ereigniszeit müsste zensierte Fälle verwerfen oder verzerrt behandeln; die Überlebenszeitanalyse ist genau für diese Datenlage konstruiert.
Verwandte Begriffe: Statistischer Rückschluss, Prädiktive Analytik, Zeitreihenanalyse, Regression
+ Überwachtes Lernen
Überwachtes Lernen ist das am häufigsten eingesetzte Lernparadigma im maschinellen Lernen. Das Modell lernt eine Abbildung von Eingabe auf Ausgabe, indem es auf Beispielen trainiert wird, bei denen die korrekte Ausgabe bekannt ist.
Funktionsweise: Der Trainingsdatensatz enthält Paare aus Eingabe (Features) und bekannter Ausgabe (Label). Das Modell passt seine Parameter iterativ an, um den Unterschied zwischen Vorhersage und tatsächlicher Ausgabe zu minimieren. Nach dem Training generalisiert es auf neue, ungesehene Daten.
Unternehmensbeispiel: Ein E-Mail-Anbieter trainiert ein Spam-Filter-Modell auf Millionen beschrifteter E-Mails ("Spam" / "kein Spam"). Das Modell lernt, welche Merkmale (Absender, Betreff, Inhalt) für Spam charakteristisch sind, und filtert neue E-Mails zuverlässig.
Hauptaufgaben:
- Klassifizierung: Ausgabe ist eine Kategorie
- Regression: Ausgabe ist ein kontinuierlicher Wert
Abgrenzung: Überwachtes Lernen benötigt beschriftete Daten – die oft teuer und aufwendig zu erstellen sind. Unüberwachtes Lernen kommt ohne Beschriftungen aus, liefert aber weniger direkt steuerbare Ergebnisse.
Verwandte Begriffe: Klassifizierung, Unüberwachtes Lernen, Feature Engineering
+ Unstrukturierte Daten
Unstrukturierte Daten sind Daten ohne festes Schema oder Datenbankformat. Sie machen den Großteil aller täglich generierten Daten aus und enthalten oft wertvolle Informationen – erfordern aber spezielle Verarbeitungsmethoden.
Beispiele: E-Mails, Dokumente, Social-Media-Posts, Bilder, Videos, Audiodateien, Sensorrohsignale.
Funktionsweise: Um unstrukturierte Daten analysierbar zu machen, werden sie durch NLP (für Text), Bilderkennung (für Bilder) oder Signalverarbeitung (für Audio/Sensor) in strukturierte oder vektorisierte Formate überführt.
Unternehmensbeispiel: Ein Großteil der Informationen in einem Pharmaunternehmen steckt in unstrukturierten Forschungsberichten, E-Mails und klinischen Notizen. Erst durch NLP und Text Mining werden diese Informationen systematisch nutzbar.
Abgrenzung: Strukturierte Daten passen in Tabellen und sind direkt abfragbar. Unstrukturierte Daten brauchen Vorverarbeitung, bieten dafür aber oft reichhaltigere Informationen.
Verwandte Begriffe: Strukturierte Daten, Text Mining, NLP
+ Unüberwachtes Lernen
Unüberwachtes Lernen bezeichnet ML-Verfahren, bei denen das Modell Muster und Strukturen in Daten erkennt, ohne dass diese mit Beschriftungen (Labels) versehen wurden. Das Modell entdeckt die Struktur der Daten eigenständig.
Funktionsweise: Ohne vorgegebene Antworten sucht der Algorithmus nach inhärenten Strukturen – Ähnlichkeiten, Gruppierungen, Redundanzen oder Abhängigkeiten in den Daten.
Wichtige Methoden:
- Clustering: Gruppierung ähnlicher Datenpunkte
- Dimensionsreduktion (PCA, t-SNE, UMAP): Hochdimensionale Daten visualisierbar machen
- Autoencoders: Komprimierte Repräsentationen erlernen
- Assoziationsanalyse: Häufige Itemkombinationen finden (z. B. "Wer X kauft, kauft oft auch Y")
Unternehmensbeispiel: Ein Einzelhändler analysiert Kaufverhaltensdaten ohne vorab definierte Kundensegmente. Unüberwachtes Lernen entdeckt eigenständig fünf klar abgrenzbare Kundengruppen, die anschließend gezielt angesprochen werden.
Abgrenzung: Beim überwachten Lernen gibt es für jeden Trainingsdatenpunkt eine bekannte Antwort. Beim unüberwachten Lernen gibt es diese Antworten nicht – das Modell erschließt Struktur selbst.
Verwandte Begriffe: Clustering, Überwachtes Lernen, Reinforcement Learning
+ Vektordatenbank
Eine Vektordatenbank ist ein spezialisiertes Datenbanksystem, das darauf ausgelegt ist, hochdimensionale Vektoren (z. B. Embeddings) effizient zu speichern und nach Ähnlichkeit zu durchsuchen.
Funktionsweise: Anstatt nach exakten Treffern zu suchen (wie SQL), führt eine Vektordatenbank eine Ähnlichkeitssuche durch (Approximate Nearest Neighbor Search). Sie findet die Vektoren, die einem Anfrage-Vektor am ähnlichsten sind – in Millisekunden, auch bei Millionen von Einträgen.
Unternehmensbeispiel: Ein Medienunternehmen speichert alle Artikel als Embeddings in einer Vektordatenbank. Wenn ein Leser einen Artikel liest, findet das Empfehlungssystem sofort die zehn inhaltlich ähnlichsten Artikel – ohne Stichwortübereinstimmung.
Bekannte Lösungen: Pinecone, Weaviate, Qdrant, Milvus, pgvector (PostgreSQL-Erweiterung).
Anwendungsfelder:
- Semantische Suche
- RAG-Systeme
- Empfehlungssysteme
- Duplikaterkennung in großen Datensätzen
Abgrenzung: Klassische Datenbanken suchen nach exakten Werten. Vektordatenbanken suchen nach semantischer Ähnlichkeit. Sie sind kein Ersatz für relationale Datenbanken, sondern eine Ergänzung für KI-Anwendungen.
Verwandte Begriffe: Embedding, RAG, Large Language Model
+ Vision Foundation Models
Vision Foundation Models sind große, auf riesigen Bildmengen vortrainierte Bildmodelle (z. B. die DINO-Modellfamilie), die allgemeine visuelle Merkmale gelernt haben und sich mit wenigen gelabelten Beispielen an neue Aufgaben anpassen lassen.
Funktionsweise: Das Modell wird selbstüberwacht auf Millionen unbeschrifteter Bilder vortrainiert – es lernt ohne Labels, welche Bildmerkmale bedeutsam sind. Für eine konkrete Aufgabe (Fehlererkennung, Segmentierung) dient das vortrainierte Modell als Merkmalsextraktor oder wird per Fine-Tuning mit wenigen hundert gelabelten Beispielen angepasst. Der Beschriftungsaufwand sinkt gegenüber einem von Grund auf trainierten Modell um Größenordnungen.
Unternehmensbeispiel: Ein Zulieferer führt eine visuelle Qualitätsprüfung für ein neues Bauteil ein. Statt zehntausende Fehlerbilder zu sammeln, passt das Team ein Vision Foundation Model mit wenigen hundert Beispielbildern an – die Prüfung erreicht in Wochen statt Monaten Serienreife und erkennt auch seltene Fehlerbilder zuverlässig.
Anwendungsfelder:
- Visuelle Qualitätsprüfung mit wenigen Trainingsbeispielen
- Bildsegmentierung und Objekterkennung in Industrie und Fernerkundung
- Anomalie- und Fehlererkennung auf Bilddaten
- Bildsuche und Ähnlichkeitsvergleich in großen Bildbeständen
Abgrenzung: Ein klassisches CNN wird pro Aufgabe von Grund auf oder per Transfer Learning trainiert und braucht deutlich mehr gelabelte Daten. Ein Vision Language Model (VLM) verbindet Bildverständnis zusätzlich mit Sprache.
Verwandte Begriffe: Vision Language Model (VLM), Fine-Tuning, Transfer Learning, Bilderkennung
+ Vision Language Model (VLM)
Ein Vision Language Model (VLM) ist ein KI-Modell, das Bilder und Text gemeinsam verarbeitet: Es kann Bildinhalte beschreiben, Fragen zu Bildern beantworten und Informationen aus visuell strukturierten Dokumenten wie Zeichnungen, Formularen oder Tabellen extrahieren.
Funktionsweise: Ein Bildencoder wandelt das Bild in Embeddings um, die ein Large Language Model (LLM) zusammen mit dem Text-Prompt verarbeitet. So versteht das Modell Layout, Text und Bildinhalt im Zusammenhang und antwortet in natürlicher Sprache – etwa mit einer strukturierten Extraktion aller Positionen eines gescannten Lieferscheins.
Unternehmensbeispiel: Ein Maschinenbauer digitalisiert Bestellungen, Lieferscheine und technische Datenblätter, die als PDF oder Scan eingehen. Ein VLM extrahiert Positionen, Maße und Toleranzen direkt aus dem Dokumentbild – auch bei Tabellen und eingebetteten Zeichnungen, an denen klassische Texterkennung scheitert.
Anwendungsfelder:
- Automatisches Auslesen von Dokumenten (Bestellungen, Lieferscheine, Datenblätter)
- Fragen und Antworten zu Bildern und technischen Zeichnungen
- Beschreibung und Verschlagwortung großer Bildbestände
- Visuelle Prüfprotokolle mit Begründung in natürlicher Sprache
Abgrenzung: Ein Multimodales Modell ist der Oberbegriff für Modelle mit mehreren Eingabearten; VLM bezeichnet die Kombination aus Bild und Sprache. Ein Vision Foundation Model liefert visuelle Merkmale ohne Sprachverständnis.
Verwandte Begriffe: Multimodales Modell, Large Language Model (LLM), Vision Foundation Models, Natural Language Processing (NLP)
+ Web Crawling
Web Crawling ist das automatisierte und systematische Abrufen von Webseiten durch ein Programm, das ausgehend von Startadressen den enthaltenen Links folgt und die gefundenen Inhalte für die spätere Auswertung speichert.
Funktionsweise: Ein Crawler verwaltet eine Warteschlange offener Adressen, ruft Seiten ab, extrahiert aus dem HTML neue Links und legt sie zurück in die Warteschlange, wobei bereits besuchte Adressen herausgefiltert werden. Rücksichtsvolles Verhalten gehört zum Standard: Auswertung der robots.txt, begrenzte Abrufrate und eine identifizierbare User-Agent-Kennung. Seiten, deren Inhalt erst per JavaScript entsteht, benötigen einen Headless-Browser. Rechtlich sind Urheberrecht, Nutzungsbedingungen der Quelle und die DSGVO vorab zu klären.
Unternehmensbeispiel: Ein Maschinenbauunternehmen beobachtet die technischen Datenblätter des Wettbewerbs. Ein wöchentlicher Crawl erfasst die Produktseiten, erkennt geänderte Dokumente und stellt die Unterschiede dem Produktmanagement strukturiert bereit.
Anwendungsfelder:
- Aufbau von Textkorpora für Sprachmodelle und Text Mining
- Markt-, Sortiments- und Preisbeobachtung
- Überwachung regulatorischer Veröffentlichungen
- Anreicherung eigener Stammdaten aus öffentlichen Quellen
- Indexierung für unternehmensinterne Suchdienste
Abgrenzung: Web Crawling beschreibt die Beschaffung der Inhalte, Web Mining deren anschließende Auswertung. Scraping bezeichnet enger gefasst das gezielte Herauslösen bestimmter Felder aus einer bekannten Seitenstruktur.
Verwandte Begriffe: Web Mining, Text Mining, Daten extrahieren, Unstrukturierte Daten
+ Web Mining
Web Mining bezeichnet die Anwendung von Data-Mining-Methoden auf Daten aus dem World Wide Web, um Muster, Strukturen und Erkenntnisse zu extrahieren.
Funktionsweise: Web Mining gliedert sich in drei Bereiche: Web Content Mining (Inhalte von Webseiten analysieren), Web Structure Mining (Verlinkungsstrukturen auswerten) und Web Usage Mining (Nutzerverhalten auf Webseiten analysieren).
Unternehmensbeispiel: Ein E-Commerce-Unternehmen analysiert per Web Usage Mining, welche Pfade Nutzer durch den Online-Shop nehmen, bevor sie kaufen oder abbrechen. Die Erkenntnisse fließen direkt in UX-Optimierungen ein.
Anwendungsfelder:
- Suchmaschinenoptimierung (SEO)
- Wettbewerbs- und Preismonitoring
- Trendanalysen aus Social Media
- Nutzerverhalten und Conversion-Optimierung
Verwandte Begriffe: Text Mining, Web Crawling, Unstrukturierte Daten
+ Wissensentdeckung in Datenbanken (KDD)
Die Wissensentdeckung in Datenbanken (Knowledge Discovery in Databases, KDD) beschreibt den vollständigen, mehrstufigen Prozess der Extraktion von nützlichem Wissen aus großen Datensätzen – von der Rohdatenauswahl bis zur interpretierten Erkenntnis.
Funktionsweise: KDD ordnet die Arbeit mit großen Datenmengen in eine feste Abfolge von Schritten, die von den Rohdaten bis zur belastbaren Aussage führt. Die Schritte laufen nicht streng linear ab – was die Auswertung zeigt, führt regelmäßig zurück zur Auswahl oder zur Aufbereitung der Daten. Den größten Aufwand verursachen in der Praxis die vorbereitenden Schritte, nicht der eigentliche Algorithmus.
Prozessschritte:
- Datenselektion: Relevante Daten aus vorhandenen Quellen auswählen
- Vorverarbeitung: Bereinigung, Behandlung fehlender Werte, Konsistenzprüfung
- Transformation: Daten in geeignete Formate und Repräsentationen überführen
- Data Mining: Algorithmen anwenden (Clustering, Klassifizierung, Regression etc.)
- Interpretation & Evaluation: Ergebnisse auf fachliche Relevanz prüfen und kommunizieren
Unternehmensbeispiel: Ein Maschinenbauunternehmen will wissen, warum einzelne Baugruppen häufiger ausfallen als der Rest. Serviceberichte, Sensordaten und Stücklisten werden zu einem bereinigten Datensatz zusammengeführt; die anschließende Musteranalyse zeigt, dass die Ausfälle an eine bestimmte Kombination aus Lieferantencharge und Betriebstemperatur gebunden sind. Die Konstruktion prüft den Befund fachlich, und das Ergebnis fließt in die Wareneingangsprüfung ein.
Abgrenzung: Data Mining ist nur ein Schritt innerhalb des KDD-Prozesses – nämlich die algorithmische Mustersuche. KDD beschreibt den gesamten Wissensgenerierungsprozess.
Verwandte Begriffe: Data Mining, Data Wrangling, Datenwissenschaft
+ Wissensgraph (Knowledge Graph)
Ein Wissensgraph ist eine strukturierte Wissensbasis, die Entitäten (Produkte, Bauteile, Kunden, Normen) und ihre Beziehungen als Graph abbildet. Er verbindet Informationen aus verteilten Quellen zu einem abfragbaren Gesamtbild des Unternehmenswissens.
Funktionsweise: Fachwissen wird als Tripel modelliert – etwa: Bauteil A ist verbaut in Baugruppe B, Baugruppe B unterliegt Norm C. Gespeichert wird der Graph häufig in einer Graphdatenbank; Ontologien definieren die zulässigen Typen und Beziehungen. Abfragen folgen den Kanten über mehrere Schritte, und in Kombination mit RAG liefert der Graph Sprachmodellen belegbares Faktenwissen (GraphRAG).
Unternehmensbeispiel: Ein Automobilzulieferer verknüpft Stücklisten, Änderungsstände, Reklamationen und Lieferanten in einem Wissensgraphen. Bei einem Serienfehler zeigt eine Abfrage in Sekunden, in welchen weiteren Baugruppen dieselbe Komponente desselben Lieferanten im selben Zeitraum verbaut wurde.
Anwendungsfelder:
- Verknüpfung von Produkt-, Prozess- und Lieferantendaten
- Rückverfolgbarkeit und Ursachenanalyse bei Qualitätsproblemen
- Wissensmanagement: Expertenwissen abfragbar machen
- Faktenbasis für RAG-Systeme und Unternehmens-Chatbots
Abgrenzung: Eine Graphdatenbank ist die Speichertechnologie; der Wissensgraph ist das damit aufgebaute, semantisch modellierte Wissen. Eine Vektordatenbank findet Ähnliches über numerische Distanzen, ein Wissensgraph beantwortet Fragen über explizite Beziehungen.
Verwandte Begriffe: Graphdatenbank (Graph Database), Ontologien (Ontologies), Retrieval-Augmented Generation (RAG), Neo4j
+ XGBoost
XGBoost (Extreme Gradient Boosting) ist eine quelloffene Software-Bibliothek, die das Gradient-Boosting-Verfahren besonders schnell, speichereffizient und mit eingebauter Regularisierung implementiert. Sie gehört seit Jahren zu den meistgenutzten Werkzeugen für Machine Learning auf tabellarischen Daten.
Funktionsweise: XGBoost trainiert sequentiell Entscheidungsbäume auf die Fehler des bisherigen Gesamtmodells und optimiert dabei eine regularisierte Zielfunktion, die zu komplexe Bäume bestraft und Overfitting eindämmt. Technisch bietet die Bibliothek Parallelisierung, eine native Behandlung fehlender Werte und GPU-Unterstützung; Schnittstellen existieren u. a. für Python und R.
Unternehmensbeispiel: Ein Pharmaunternehmen priorisiert Wirkstoffkandidaten anhand tabellarischer Molekül- und Assay-Daten. Ein XGBoost-Modell ordnet Tausende Kandidaten nach Erfolgswahrscheinlichkeit und reduziert so die Zahl teurer Laborversuche.
Anwendungsfelder:
- Prognosemodelle auf strukturierten Daten (Ertrag, Ausfall, Nachfrage)
- Scoring- und Ranking-Systeme
- Machine-Learning-Wettbewerbe und schnelles Prototyping
- Baseline-Modelle in Data-Science-Projekten
Abgrenzung: XGBoost ist eine konkrete Implementierung; LightGBM und CatBoost setzen dasselbe Grundprinzip mit anderen Schwerpunkten um (Geschwindigkeit bei sehr großen Daten bzw. Umgang mit kategorialen Merkmalen).
Verwandte Begriffe: Gradient Boosting, Random Forest, Maschinelles Lernen
+ Zeitreihenanalyse
Die Zeitreihenanalyse umfasst statistische und algorithmische Methoden zur Untersuchung von Daten, die zeitlich geordnet und in regelmäßigen Abständen erhoben wurden. Ziel ist es, Muster zu verstehen, Anomalien zu erkennen und zukünftige Werte vorherzusagen.
Funktionsweise: Zeitreihendaten weisen typische Strukturen auf: Trend (langfristige Richtung), Saisonalität (wiederkehrende Muster), Zyklen und Rauschen. Gängige Methoden wie ARIMA, SARIMA oder neuronale Ansätze (LSTM, Transformer) modellieren diese Strukturen und nutzen sie für Prognosen.
Unternehmensbeispiel: Ein Energieversorgungsunternehmen prognostiziert den stündlichen Strombedarf auf Basis historischer Verbrauchsdaten, Temperatur und Kalenderereignissen. Die Zeitreihenanalyse ermöglicht eine präzise Produktionsplanung und verhindert teure Überkapazitäten.
Anwendungsfelder:
- Nachfrageprognosen im Handel
- Anomalieerkennung in Produktionsprozessen
- Finanzmarkt- und Aktienanalyse
- Vorhersage des Wartungsbedarfs (Predictive Maintenance)
- Epidemiologische Modellierung
Abgrenzung: Zeitreihenanalyse ist eine spezialisierte Form der Datenanalyse, die die zeitliche Abhängigkeit zwischen Beobachtungen explizit modelliert – im Gegensatz zu klassischen ML-Modellen, die Datenpunkte als unabhängig betrachten.
Verwandte Begriffe: Prädiktive Analytik, Signalverarbeitung, Maschinelles Lernen
Zuletzt aktualisiert: 2026 | Supper & Supper GmbH, Berlin