Bäume in besiedelten Gebieten werden zunehmend als wichtige Indikatoren für Nachhaltigkeit, Klimaanpassung und Lebensqualität anerkannt. Bestehende Datensätze sind jedoch oft unvollständig und liefern selten taxonomische Informationen, die über von öffentlichen Stellen gepflanzte Bäume hinausgehen. Deshalb stützen sich viele Studien und Planungen nach wie vor auf grobe Grünflächenindikatoren wie die Baumkronenbedeckung, anstatt auf detaillierte Informationen auf Baumebene.
Um diese Lücke zu schließen, haben Forschende von HeiGIT und Partnerinstituten ein großflächiges Baumbestandsregister auf Gattungsebene für Baden-Württemberg erstellt, ein Bundesland mit einer Fläche von 35.700 km² und 11,3 Millionen Einwohnern. Die Region umfasst große Ballungsräume wie Stuttgart, Mannheim und Karlsruhe sowie kleinere Städte inmitten von Wald- und Agrarlandschaften.
Der Datensatz beschränkt sich auf nicht bewaldete Gebiete und umfasst Wohn- und Gewerbegebiete, Verkehrskorridore, landwirtschaftliche Flächen mit vereinzelten Bäumen sowie städtische Grünflächen, sowohl auf öffentlich verwaltetem als auch auf privatem Gelände. Er enthält Angaben zu Baumstandorten, Kronengeometrie, Höhe und Gattungsbezeichnungen, die mittels Multisensor-Fernerkundung und Deep Learning ermittelt wurden.

Untersuchungsgebiet: Baden-Württemberg Stadt-Maske, Gitter und Ort des GreenHIll LiDAR reference survey in drei Städten: Mannheim, Karlsruhe, Freiburg.
Die Bäume wurden anhand von hochauflösenden Luftbildern und Daten zur Kronenhöhe unter Verwendung von Deep Learning kartiert, wobei terrestrische LiDAR-Vermessungen als Trainingsdaten dienten. Das daraus resultierende Inventar umfasst zehn Klassen auf Gattungsebene, darunter Sammelkategorien für sonstige Laubbäume und Nadelbäume, bei denen eine feinere Unterscheidung anhand der Luftbilder nicht möglich ist. Auf unabhängigen Testgebieten erzielte das Modell einen mAP@0.5 von 0,647 für die Baumerkennung und einen Makro-F1-Wert von 0,627 für die 10-Klassen-Gattungsklassifizierung, was zu einem finalen Bestand von 16,3 Millionen Bäumen im gesamten kartierten Gebiet führte.
Das zugehörige Code-Repository und die Trainingsannotationen ermöglichen es den Nutzer*innen, diesen Workflow neu zu trainieren oder an andere Regionen, Sensoren oder taxonomische Schemata anzupassen. Mögliche Erweiterungen umfassen die Einbeziehung saisonaler oder mehrjähriger Bilddaten zur Erfassung phänologischer Signaturen, die Integration zusätzlicher Spektralbänder oder Zeitreihenindizes (z. B. monatlicher NDVI) zur verbesserten Gattungsunterscheidung sowie die Erweiterung des Labelsatzes, sobald mehr Referenzdaten verfügbar werden. Der Workflow eignet sich zudem für multimodale und multitemporale Fusion, beispielsweise durch die Kombination von RGB- und NIR-Bildern, Höhenangaben und Zeitreihenindizes, um die Gattungsunterscheidung und die zeitliche Stabilität weiter zu verbessern.
Der Datensatz unterstützt eine Reihe von Anwendungen in den Bereichen Stadtökologie, Stadtplanung, Biodiversitätsuntersuchung und Umweltgesundheit. Über die Bereitstellung eines landesweiten Datensatzes hinaus bietet diese Arbeit einen skalierbaren operativen Entwurf für ein sich weiterentwickelndes Baumbestandsregister, das im Laufe der Zeit durch bessere Bilddaten, umfangreichere lokale Referenzdaten und gezieltes Nachtrainieren systematisch verbessert werden kann.
Der gesamte Code, der für die Datenvorverarbeitung, das Modelltraining und die landesweite Inferenz verwendet wurde, ist verfügbar auf GitHub unter der Lizenz AGPL-3.0.
Quelle: Grinblat, Y., Tost, H., Benedyk, A. et al. A genus-labeled dataset of individual trees outside forests in Baden-Württemberg, Germany. Sci Data (2026). https://doi.org/10.1038/s41597-026-08400-y
Titelbild: Subtitles with 5 channels 640×640 px: (a) urban, (b) urban greenspace and (c) negative cases.



