Bilderkennung

Computer Vision & Bilderkennung – Unterrichtsvortrag
🎓 Unterrichtsvortrag · KI & Machine Learning

Computer Vision & Bilderkennung

Wie Maschinen lernen, die Welt zu sehen – von Pixeln zu Bedeutung

👁️
Was ist Computer Vision?

Definition & Grundlagen

Definition: Computer Vision ist ein Teilgebiet der Künstlichen Intelligenz, das Maschinen befähigt, visuelle Daten – Bilder und Videos – zu erfassen, zu analysieren und zu verstehen. Ziel ist es, Computern eine ähnliche Wahrnehmung wie das menschliche Sehsystem zu verleihen.
🧠

Künstliche Intelligenz

Computer Vision ist ein Kernbereich der KI und nutzt Machine Learning, um aus visuellen Daten eigenständig zu lernen.

📷

Bildverarbeitung

Bilder werden als numerische Matrizen (Pixelwerte 0–255) gespeichert. Computer sehen Zahlen – keine Objekte. Die Interpretation ist das Ziel.

🔍

Bilderkennung

Unteraufgabe von CV: Ein System klassifiziert, was auf einem Bild zu sehen ist – z. B. „Katze“, „Auto“ oder „Tumor“.

📊

Große Datenmengen

Trainiert wird auf Millionen gelabelter Bilder – wie ImageNet mit 14+ Mio. Bildern in 20.000 Kategorien.

⚙️
Die CV-Pipeline

Von der Kamera zur Entscheidung – 5 Schritte

1

Bilderfassung

Kamera, Sensor oder Videostream liefert Rohdaten

2

Vorverarbeitung

Normalisierung, Rauschreduktion, Größenanpassung

3

Merkmalsextraktion

Kanten, Farben, Texturen und Formen werden erkannt

4

Klassifikation

Das Modell ordnet das Bild einer Kategorie zu

5

Entscheidung

Ausgabe: Label, Bounding Box, Aktion oder Alarm

🕸️
Convolutional Neural Networks

Das Herzstück moderner Bilderkennung

CNNs sind neuronale Netze, optimiert für Bilddaten. Ihre Faltungsschichten (Conv Layers) extrahieren automatisch Merkmale – von einfachen Kanten bis zu komplexen Strukturen wie Gesichtern oder Fahrzeugen.

🔬 Schichtenaufbau eines CNN

Input
Rohbild
224×224 px
Conv Layer
Kanten & einfache Muster
ReLU
Aktivierungsfunktion
Pooling
Dimensions-reduktion
Deep Layers
Komplexe Merkmale
Fully Connected
Alle Merkmale zusammen
Output
Klasse + Wahrsch.
Translationsinvarianz: CNNs erkennen Objekte unabhängig davon, wo sie sich im Bild befinden. Ein trainiertes Modell findet ein Auto links, rechts oder in der Bildmitte gleichermaßen.
🏆
Bekannte Modelle im Vergleich

Von AlexNet bis Vision Transformer

ModellJahrBesonderheitTop-1 (ImageNet)Typ
AlexNet2012Erster Deep-Learning-Durchbruch mit GPU-Training~63 %CNN
VGGNet2014Sehr tiefes Netz mit einfacher 3×3-Filterstruktur~74 %CNN
ResNet-502015Residual-Verbindungen für 50–152 Schichten~76 %CNN
EfficientNet2019Optimales Verhältnis Genauigkeit / Effizienz~84 %CNN
Vision Transformer (ViT)2020Attention-basiert, kein Faltungsoperator~88 %Transformer
🚀
Reale Anwendungen

Computer Vision verändert zahlreiche Branchen

🚗

Autonomes Fahren

Fahrzeuge erkennen Fußgänger, Schilder und andere Autos in Echtzeit – z. B. Tesla, Waymo.

🏥

Medizinische Diagnostik

KI analysiert Röntgenbilder und MRTs zur Erkennung von Tumoren, Frakturen und Hautkrebs.

🛒

Kassenloser Einzelhandel

Amazon Go erfasst Produkte automatisch, wenn Kunden sie aus dem Regal nehmen.

🌾

Präzisionslandwirtschaft

Drohnen analysieren Felder, erkennen Schädlinge und optimieren Bewässerung per Bildanalyse.

🔒

Gesichtserkennung

Smartphone-Entsperrung, Grenzkontrollen und Sicherheitssysteme nutzen biometrische Bilderkennung.

🏭

Qualitätskontrolle

CV-Systeme erkennen Produktionsfehler schneller und genauer als das menschliche Auge.

🔮
Zukunft & Trends

Wohin entwickelt sich Computer Vision?

Edge Computing & 5G

Bildanalyse direkt auf dem Gerät ohne Cloud – ermöglicht Echtzeit-Reaktionen für autonome Systeme.

🌐

3D-Vision & AR/VR

Neue Sensoren erfassen dreidimensionale Umgebungen präziser – unverzichtbar für Robotik und Mixed Reality.

⚛️

Quantencomputing

Könnte komplexe Bildanalysen bis zu 100× beschleunigen und neue Möglichkeiten in der Mustererkennung eröffnen.

🤝

Multimodale KI

Systeme wie GPT-4o kombinieren Bild- und Sprachverständnis – Computer „sehen“ und „verstehen“ gleichzeitig.

⚠️ Ethische Herausforderungen: Datenschutz bei Gesichtserkennung, Bias in Trainingsdaten, Missbrauch durch Deepfakes und Massenüberwachung sind zentrale gesellschaftliche Fragen.
👥
Praktische Gruppenaufgabe

Anwendung des Gelernten in der Praxis

👥 Gruppenarbeit
💡 Fallstudie

CV-System für ein Krankenhaus entwerfen

4–5 Personen pro Gruppe  ·  45 Minuten Bearbeitungszeit  ·  10 Minuten Präsentation je Gruppe

📋 Szenario

Ein Krankenhaus möchte ein KI-basiertes Computer-Vision-System zur automatischen Analyse von Röntgenbildern einführen, um Lungenentzündungen schneller zu erkennen. Euer Team wurde beauftragt, ein Konzept für dieses System zu entwickeln – von der Datenerfassung bis zur ethischen Absicherung.

🎭 Rollen in der Gruppe

👩‍💻
KI-Ingenieurin

Wählt das Modell (CNN vs. ViT) und erklärt den Trainingsansatz

👨‍⚕️
Mediziner

Bewertet medizinische Anforderungen & Genauigkeitsziele

⚖️
Ethik-Beauftragte/r

Analysiert Risiken, Bias und Datenschutzfragen

📊
Datenspezialist/in

Plant die Datensammlung, Labeling und Qualitätssicherung

🎤
Präsentator/in

Fasst Ergebnisse zusammen und stellt sie vor

📝 Aufgabenschritte

1
Problem analysieren

Was genau soll das System erkennen? Welche Eingaben (Bilder) und Ausgaben (Diagnosen) sind nötig? Definiert den genauen Anwendungsfall.

⏱ 8 min
2
Datenplanung

Woher kommen die Trainingsdaten? Wie viele Bilder braucht ihr? Wie werden sie gelabelt (gesunde Lunge vs. Entzündung)? Welche Qualitätsstandards gelten?

⏱ 8 min
3
Modellauswahl & Pipeline

CNN oder Vision Transformer? Begründet die Wahl. Skizziert die komplette CV-Pipeline: von Bilderfassung bis zur Ausgabe der Diagnose.

⏱ 10 min
4
Risiken & Ethik

Was passiert, wenn das System falsch liegt (falsch-negativ vs. falsch-positiv)? Wie geht ihr mit Datenschutz, Bias und dem Vertrauen der Ärzte um?

⏱ 10 min
5
Präsentation vorbereiten

Erstellt eine kurze Übersicht (Stichpunkte oder Skizze auf Papier/Whiteboard), die ihr der Klasse präsentiert.

⏱ 9 min

📦 Abgabe & Präsentation

  • Eine skizzierte CV-Pipeline für das Röntgenbild-System (als Zeichnung oder Stichpunkte)
  • Begründete Modellwahl: CNN oder Vision Transformer – warum?
  • Mindestens 3 konkrete Risiken/ethische Fragen mit eurem Lösungsvorschlag
  • Beschreibung eures Datensatzes: Woher, wie viele Bilder, wie gelabelt?
  • 10-minütige Kurzpräsentation vor der Klasse mit anschließender Diskussion
🧩
Quiz – Teste dein Wissen

Klicke auf eine Frage, um die Antwort aufzuklappen

1
Was bedeutet CNN im Kontext von Computer Vision?
CNN steht für Convolutional Neural Network – ein neuronales Netz, das speziell für die Verarbeitung von Bilddaten entwickelt wurde und Faltungsoperatoren einsetzt.
2
Was ist Translationsinvarianz und warum ist sie wichtig?
CNNs erkennen Objekte unabhängig von ihrer Position im Bild. Ein Auto wird erkannt, egal ob es links, rechts oder in der Mitte ist – das macht das Modell robust für reale Szenarien.
3
Nenne drei reale Anwendungsbereiche von Computer Vision.
Mögliche Antworten: Autonomes Fahren, medizinische Diagnostik, Gesichtserkennung, Präzisionslandwirtschaft, Qualitätskontrolle, kassenloser Handel – und viele weitere.
4
Welches Modell brachte 2012 den Deep-Learning-Durchbruch bei der Bilderkennung?
AlexNet – entwickelt von Alex Krizhevsky, gewann 2012 den ImageNet-Wettbewerb mit großem Vorsprung und markierte den Beginn der modernen Deep-Learning-Ära.
5
Was ist der Hauptunterschied zwischen CNN und Vision Transformer (ViT)?
CNNs nutzen Faltungsoperatoren zur lokalen Merkmalsextraktion. Vision Transformers (ViT) verwenden Attention-Mechanismen, die globale Zusammenhänge im gesamten Bild gleichzeitig erfassen – ohne Faltung.
6
Was versteht man unter einem „falsch-negativen“ Ergebnis in der medizinischen Bildanalyse?
Ein falsch-negatives Ergebnis bedeutet, dass das System eine Krankheit nicht erkennt, obwohl sie vorhanden ist. In der Medizin kann das besonders gefährlich sein, da ein kranker Patient als gesund eingestuft wird.
FAQ & zentrale Begriffe

Häufige Fragen und kurze Erklärungen wichtiger Fachbegriffe

⏱️

Wie viel Rechenleistung braucht CV?

Für das Training großer Modelle werden oft GPUs oder spezialisierte Hardware (TPUs) verwendet. Für einfache Anwendungen reicht aber oft schon ein normaler Laptop oder ein Smartphone.

🧪

Ist CV immer zu 100 % korrekt?

Nein. Jedes Modell macht Fehler. Wichtig sind gute Trainingsdaten, Tests mit realistischen Beispielen und ein verantwortungsvoller Einsatz – vor allem in sicherheitskritischen Bereichen.

🔐

Was ist mit Datenschutz?

Bei Bildern von Personen müssen DSGVO und lokale Gesetze beachtet werden. Häufig werden Bilder anonymisiert oder nur mit ausdrücklicher Einwilligung verwendet.

🎯

Wird der Mensch überflüssig?

Computer Vision unterstützt Menschen, ersetzt sie aber selten komplett. In der Medizin trifft z. B. weiterhin eine Ärztin oder ein Arzt die endgültige Entscheidung.

📘 Glossar – wichtige Begriffe

🧠
Neuronales Netz

Ein Modell, das aus vielen künstlichen „Neuronen“ besteht, die miteinander verbunden sind und gemeinsam Muster in Daten lernen.

🌀
Convolution (Faltung)

Mathematischer Filter, der über ein Bild gleitet und lokale Muster wie Kanten oder Ecken hervorhebt.

📦
Feature (Merkmal)

Auffällige Eigenschaft im Bild, z. B. eine bestimmte Kante, eine Textur oder ein typisches Muster eines Objekts.

🏷️
Label

Die Beschriftung eines Trainingsbildes, z. B. „Katze“ oder „Lungenentzündung“ – ohne Label kann das Modell nicht sinnvoll lernen.

🎯
Genauigkeit

Gibt an, wie viel Prozent der Vorhersagen korrekt sind. Sie allein reicht nicht – oft sind auch Recall und Precision wichtig.

⚖️
Bias

Verzerrung in den Daten oder im Modell, die dazu führt, dass bestimmte Gruppen systematisch benachteiligt werden.

🧪
Trainingsdaten

Beispieldaten, aus denen das Modell lernt. Ihre Qualität und Vielfalt entscheiden maßgeblich über die Leistung des Systems.

🧷
Overfitting

Das Modell lernt die Trainingsdaten „auswendig“ und funktioniert dann auf neuen, unbekannten Bildern schlechter.

Unterrichtsvortrag: Computer Vision & Bilderkennung · Erstellt mit KI-Unterstützung · 2026

Quellen: IBM, DataCamp, MathWorks, Lamarr Institute, DigitalOcean, FocalX, Linvelo