Wissen von A bis Z

Computer Vision

Computer Vision ist der Versuch, Computern beizubringen, nicht nur Pixel zu zählen, sondern zu verstehen, ob sie gerade eine Katze oder ein Toastbrot betrachten.

Computer Vision (CV) ist das Teilgebiet der KI und der Informatik, das sich mit der automatisierten Verarbeitung und Interpretation visueller Informationen beschäftigt — Bilder, Videos, 3D-Punktwolken, medizinische Aufnahmen. Klassische Aufgaben sind Bildklassifikation, Objekterkennung, semantische und Instance-Segmentierung, Pose Estimation, Tracking, Tiefenschätzung, optische Zeichenerkennung (OCR) und 3D-Rekonstruktion. Moderne CV-Systeme basieren überwiegend auf tiefen neuronalen Netzen — Convolutional Neural Networks (ResNet, EfficientNet), Vision Transformers (ViT), DETR, SAM (Segment Anything Model) und multimodalen Modellen wie CLIP.

Eingesetzt wird Computer Vision in autonomen Fahrzeugen, Industrie-4.0-Anwendungen (Qualitätskontrolle, Lagerautomatisierung), Medizinbildgebung (Radiologie, Pathologie, Endoskopie), Robotik, Landwirtschaft (Drohnenanalyse), Smart-Home-Sensorik, Gesichtserkennung, AR/VR, Sportanalyse, Sicherheitstechnik und Content-Moderation in sozialen Netzwerken. Frameworks und Bibliotheken sind OpenCV (klassisch), PyTorch und TensorFlow für Modelle, Detectron2 (Meta), MMDetection (OpenMMLab), Ultralytics YOLO, NVIDIA DeepStream, Azure AI Vision und Google Vision AI.

Klassische manuelle Inspektion ist langsam, ermüdend und subjektiv; CV liefert konsistente, schnelle und reproduzierbare Bewertungen großer Bilddatenmengen. Vor der Deep-Learning-Welle waren CV-Systeme stark auf handgepflegte Features wie SIFT, SURF, HOG angewiesen; tiefe Netze haben die Leistung in fast allen Benchmarks dramatisch verbessert.

Historisch beginnt das Feld mit den frühen Arbeiten von Larry Roberts am MIT (1963, "Block-World"-Wahrnehmung) und David Marrs einflussreicher computational theory of vision (1982). Praxisrelevante Algorithmen wie Hough-Transformation, Canny-Edge-Detector, SIFT (David Lowe, 1999) und Viola-Jones-Gesichtserkennung (2001) prägten die "klassische Phase" von CV. 2012 markierte AlexNets ImageNet-Sieg den Übergang zu Deep-Learning-CV; 2017 leitete das Mask R-CNN-Paper die moderne Instance-Segmentierung ein, und 2023 hat das Segment-Anything-Modell (SAM) von Meta eine vollständig promptbare, universelle Segmentierung gezeigt.

Geprägt wurde das Feld von einer langen Reihe von Forscher:innen, darunter Yann LeCun (CNNs), Andrew Zisserman, Jitendra Malik, Fei-Fei Li (ImageNet), Kaiming He (ResNet) und das Meta AI-Team. ImageNet wurde maßgeblich von Fei-Fei Li (Stanford) initiiert und über mehrere Jahre durch eine massive Annotation-Kampagne mit Hilfe von Amazons Mechanical Turk aufgebaut. Lange Zeit war das Projekt umstritten — viele Kollegen hielten den Aufwand für übertrieben. Mit AlexNets Sieg auf der ImageNet Challenge 2012 wurde der Datensatz dann schlagartig zum Symbol für eine ganze Forschungsära.

Zurück