Camera traps have become one of the most important tools for wildlife monitoring, enabling the collection of large amounts of ecological data without disturbing animal behavior. However, the growing volume of camera-trap recordings has made manual species identification increasingly impractical, motivating the adoption of automated deep learning approaches. This thesis investigates two complementary directions for improving automated wildlife species recognition from camera-trap videos. First, it evaluates whether video-based deep learning architectures can exploit temporal information and animal motion patterns to achieve higher classification performance than traditional image-based approaches. Second, it proposes a Bayesian framework for integrating site-specific ecological prior knowledge into the classification process, combining visual evidence with species occurrence probabilities derived from camera-trap locations. To support these objectives, a complete preprocessing pipeline is developed, including animal detection, multi-object tracking, crop extraction, and temporal frame sampling. Experimental evaluations are conducted on a camera-trap video dataset collected in the Brazilian Amazon and compare multiple image-based and video-based architectures under challenging real-world conditions characterized by class imbalance and environmental variability. The results provide insights into the benefits of temporal modeling for species recognition and demonstrate the potential of ecological prior information to improve prediction reliability. The proposed framework contributes to the development of more accurate and ecologically informed wildlife monitoring systems.
Le fototrappole rappresentano oggi uno degli strumenti più importanti per il monitoraggio della fauna selvatica, consentendo la raccolta di grandi quantità di dati ecologici senza interferire con il comportamento naturale degli animali. Tuttavia, il crescente volume di registrazioni rende l’identificazione manuale delle specie sempre meno sostenibile, favorendo l’adozione di approcci automatici basati sul deep learning. Questa tesi esplora due direzioni complementari per migliorare il riconoscimento automatico delle specie animali a partire da video acquisiti tramite fototrappole. In primo luogo, viene valutata l’efficacia di architetture di deep learning per video nel modellare le informazioni temporali e i pattern di movimento degli animali, rispetto ai tradizionali approcci basati su singole immagini. In secondo luogo, viene proposto un framework bayesiano per l’integrazione di conoscenza ecologica a priori specifica del sito di acquisizione, combinando l’evidenza visiva prodotta dal classificatore con le probabilità di presenza delle specie associate alle diverse località. A supporto di tali obiettivi è stata sviluppata una pipeline completa di preprocessing, comprendente il rilevamento degli animali, il tracciamento multi-oggetto, l’estrazione dei ritagli (crop) e il campionamento temporale dei frame. Le valutazioni sperimentali sono condotte su un dataset di video da fototrappola raccolti nella foresta amazzonica brasiliana e confrontano diverse architetture image-based e video-based in condizioni realistiche, caratterizzate da forte sbilanciamento delle classi e variabilità ambientale. I risultati evidenziano il contributo della modellazione temporale al riconoscimento delle specie e mostrano il potenziale dell’integrazione di conoscenza ecologica a priori nel migliorare l’affidabilità delle predizioni. Nel complesso, il lavoro contribuisce allo sviluppo di sistemi di monitoraggio faunistico più accurati e consapevoli del contesto ecologico.
Video-based species recognition and prior knowledge integration for camera-trap wildlife monitoring
CAPOFERRI, LUCA
2025/2026
Abstract
Camera traps have become one of the most important tools for wildlife monitoring, enabling the collection of large amounts of ecological data without disturbing animal behavior. However, the growing volume of camera-trap recordings has made manual species identification increasingly impractical, motivating the adoption of automated deep learning approaches. This thesis investigates two complementary directions for improving automated wildlife species recognition from camera-trap videos. First, it evaluates whether video-based deep learning architectures can exploit temporal information and animal motion patterns to achieve higher classification performance than traditional image-based approaches. Second, it proposes a Bayesian framework for integrating site-specific ecological prior knowledge into the classification process, combining visual evidence with species occurrence probabilities derived from camera-trap locations. To support these objectives, a complete preprocessing pipeline is developed, including animal detection, multi-object tracking, crop extraction, and temporal frame sampling. Experimental evaluations are conducted on a camera-trap video dataset collected in the Brazilian Amazon and compare multiple image-based and video-based architectures under challenging real-world conditions characterized by class imbalance and environmental variability. The results provide insights into the benefits of temporal modeling for species recognition and demonstrate the potential of ecological prior information to improve prediction reliability. The proposed framework contributes to the development of more accurate and ecologically informed wildlife monitoring systems.| File | Dimensione | Formato | |
|---|---|---|---|
|
Thesis_Luca_Capoferri.pdf
solo utenti autorizzati a partire dal 22/06/2027
Descrizione: Documento di tesi finale - Luca Capoferri
Dimensione
16.28 MB
Formato
Adobe PDF
|
16.28 MB | Adobe PDF | Visualizza/Apri |
|
Executive_Summary__Luca_Capoferri.pdf
solo utenti autorizzati a partire dal 22/06/2027
Descrizione: Executive Summary - Luca Capoferri
Dimensione
3.32 MB
Formato
Adobe PDF
|
3.32 MB | Adobe PDF | Visualizza/Apri |
I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.
https://hdl.handle.net/10589/260057