Computer Vision & Bilderkennung
Wie Maschinen lernen, die Welt zu sehen – von Pixeln zu Bedeutung
Definition & Grundlagen
Künstliche Intelligenz
Computer Vision ist ein Kernbereich der KI und nutzt Machine Learning, um aus visuellen Daten eigenständig zu lernen.
Bildverarbeitung
Bilder werden als numerische Matrizen (Pixelwerte 0–255) gespeichert. Computer sehen Zahlen – keine Objekte. Die Interpretation ist das Ziel.
Bilderkennung
Unteraufgabe von CV: Ein System klassifiziert, was auf einem Bild zu sehen ist – z. B. „Katze“, „Auto“ oder „Tumor“.
Große Datenmengen
Trainiert wird auf Millionen gelabelter Bilder – wie ImageNet mit 14+ Mio. Bildern in 20.000 Kategorien.
Von der Kamera zur Entscheidung – 5 Schritte
Bilderfassung
Kamera, Sensor oder Videostream liefert Rohdaten
Vorverarbeitung
Normalisierung, Rauschreduktion, Größenanpassung
Merkmalsextraktion
Kanten, Farben, Texturen und Formen werden erkannt
Klassifikation
Das Modell ordnet das Bild einer Kategorie zu
Entscheidung
Ausgabe: Label, Bounding Box, Aktion oder Alarm
Das Herzstück moderner Bilderkennung
CNNs sind neuronale Netze, optimiert für Bilddaten. Ihre Faltungsschichten (Conv Layers) extrahieren automatisch Merkmale – von einfachen Kanten bis zu komplexen Strukturen wie Gesichtern oder Fahrzeugen.
🔬 Schichtenaufbau eines CNN
224×224 px
Von AlexNet bis Vision Transformer
| Modell | Jahr | Besonderheit | Top-1 (ImageNet) | Typ |
|---|---|---|---|---|
| AlexNet | 2012 | Erster Deep-Learning-Durchbruch mit GPU-Training | ~63 % | CNN |
| VGGNet | 2014 | Sehr tiefes Netz mit einfacher 3×3-Filterstruktur | ~74 % | CNN |
| ResNet-50 | 2015 | Residual-Verbindungen für 50–152 Schichten | ~76 % | CNN |
| EfficientNet | 2019 | Optimales Verhältnis Genauigkeit / Effizienz | ~84 % | CNN |
| Vision Transformer (ViT) | 2020 | Attention-basiert, kein Faltungsoperator | ~88 % | Transformer |
Computer Vision verändert zahlreiche Branchen
Autonomes Fahren
Fahrzeuge erkennen Fußgänger, Schilder und andere Autos in Echtzeit – z. B. Tesla, Waymo.
Medizinische Diagnostik
KI analysiert Röntgenbilder und MRTs zur Erkennung von Tumoren, Frakturen und Hautkrebs.
Kassenloser Einzelhandel
Amazon Go erfasst Produkte automatisch, wenn Kunden sie aus dem Regal nehmen.
Präzisionslandwirtschaft
Drohnen analysieren Felder, erkennen Schädlinge und optimieren Bewässerung per Bildanalyse.
Gesichtserkennung
Smartphone-Entsperrung, Grenzkontrollen und Sicherheitssysteme nutzen biometrische Bilderkennung.
Qualitätskontrolle
CV-Systeme erkennen Produktionsfehler schneller und genauer als das menschliche Auge.
Wohin entwickelt sich Computer Vision?
Edge Computing & 5G
Bildanalyse direkt auf dem Gerät ohne Cloud – ermöglicht Echtzeit-Reaktionen für autonome Systeme.
3D-Vision & AR/VR
Neue Sensoren erfassen dreidimensionale Umgebungen präziser – unverzichtbar für Robotik und Mixed Reality.
Quantencomputing
Könnte komplexe Bildanalysen bis zu 100× beschleunigen und neue Möglichkeiten in der Mustererkennung eröffnen.
Multimodale KI
Systeme wie GPT-4o kombinieren Bild- und Sprachverständnis – Computer „sehen“ und „verstehen“ gleichzeitig.
Anwendung des Gelernten in der Praxis
CV-System für ein Krankenhaus entwerfen
📋 Szenario
Ein Krankenhaus möchte ein KI-basiertes Computer-Vision-System zur automatischen Analyse von Röntgenbildern einführen, um Lungenentzündungen schneller zu erkennen. Euer Team wurde beauftragt, ein Konzept für dieses System zu entwickeln – von der Datenerfassung bis zur ethischen Absicherung.
🎭 Rollen in der Gruppe
KI-Ingenieurin
Wählt das Modell (CNN vs. ViT) und erklärt den Trainingsansatz
Mediziner
Bewertet medizinische Anforderungen & Genauigkeitsziele
Ethik-Beauftragte/r
Analysiert Risiken, Bias und Datenschutzfragen
Datenspezialist/in
Plant die Datensammlung, Labeling und Qualitätssicherung
Präsentator/in
Fasst Ergebnisse zusammen und stellt sie vor
📝 Aufgabenschritte
Problem analysieren
Was genau soll das System erkennen? Welche Eingaben (Bilder) und Ausgaben (Diagnosen) sind nötig? Definiert den genauen Anwendungsfall.
Datenplanung
Woher kommen die Trainingsdaten? Wie viele Bilder braucht ihr? Wie werden sie gelabelt (gesunde Lunge vs. Entzündung)? Welche Qualitätsstandards gelten?
Modellauswahl & Pipeline
CNN oder Vision Transformer? Begründet die Wahl. Skizziert die komplette CV-Pipeline: von Bilderfassung bis zur Ausgabe der Diagnose.
Risiken & Ethik
Was passiert, wenn das System falsch liegt (falsch-negativ vs. falsch-positiv)? Wie geht ihr mit Datenschutz, Bias und dem Vertrauen der Ärzte um?
Präsentation vorbereiten
Erstellt eine kurze Übersicht (Stichpunkte oder Skizze auf Papier/Whiteboard), die ihr der Klasse präsentiert.
📦 Abgabe & Präsentation
- Eine skizzierte CV-Pipeline für das Röntgenbild-System (als Zeichnung oder Stichpunkte)
- Begründete Modellwahl: CNN oder Vision Transformer – warum?
- Mindestens 3 konkrete Risiken/ethische Fragen mit eurem Lösungsvorschlag
- Beschreibung eures Datensatzes: Woher, wie viele Bilder, wie gelabelt?
- 10-minütige Kurzpräsentation vor der Klasse mit anschließender Diskussion
Klicke auf eine Frage, um die Antwort aufzuklappen
Häufige Fragen und kurze Erklärungen wichtiger Fachbegriffe
Wie viel Rechenleistung braucht CV?
Für das Training großer Modelle werden oft GPUs oder spezialisierte Hardware (TPUs) verwendet. Für einfache Anwendungen reicht aber oft schon ein normaler Laptop oder ein Smartphone.
Ist CV immer zu 100 % korrekt?
Nein. Jedes Modell macht Fehler. Wichtig sind gute Trainingsdaten, Tests mit realistischen Beispielen und ein verantwortungsvoller Einsatz – vor allem in sicherheitskritischen Bereichen.
Was ist mit Datenschutz?
Bei Bildern von Personen müssen DSGVO und lokale Gesetze beachtet werden. Häufig werden Bilder anonymisiert oder nur mit ausdrücklicher Einwilligung verwendet.
Wird der Mensch überflüssig?
Computer Vision unterstützt Menschen, ersetzt sie aber selten komplett. In der Medizin trifft z. B. weiterhin eine Ärztin oder ein Arzt die endgültige Entscheidung.
📘 Glossar – wichtige Begriffe
Neuronales Netz
Ein Modell, das aus vielen künstlichen „Neuronen“ besteht, die miteinander verbunden sind und gemeinsam Muster in Daten lernen.
Convolution (Faltung)
Mathematischer Filter, der über ein Bild gleitet und lokale Muster wie Kanten oder Ecken hervorhebt.
Feature (Merkmal)
Auffällige Eigenschaft im Bild, z. B. eine bestimmte Kante, eine Textur oder ein typisches Muster eines Objekts.
Label
Die Beschriftung eines Trainingsbildes, z. B. „Katze“ oder „Lungenentzündung“ – ohne Label kann das Modell nicht sinnvoll lernen.
Genauigkeit
Gibt an, wie viel Prozent der Vorhersagen korrekt sind. Sie allein reicht nicht – oft sind auch Recall und Precision wichtig.
Bias
Verzerrung in den Daten oder im Modell, die dazu führt, dass bestimmte Gruppen systematisch benachteiligt werden.
Trainingsdaten
Beispieldaten, aus denen das Modell lernt. Ihre Qualität und Vielfalt entscheiden maßgeblich über die Leistung des Systems.
Overfitting
Das Modell lernt die Trainingsdaten „auswendig“ und funktioniert dann auf neuen, unbekannten Bildern schlechter.