Autonomous navigation has been revolutionizing the agricultural field for the past few years, where compact, low-cost agricultural robots (AgroBots) must operate reliably under harsh conditions such as perceptual occlusions, different crops, terrain, and weather. Classical pipelines separate perception and control modules, losing information at their interface and relying on an imprecise dynamic model. Direct end-to-end reinforcement learning removes this split at the cost of complex, hand-crafted reward functions, often producing policies hard to deploy. This research presents Phantom (Pre-trained Hierarchical Agricultural Navigation Trajectory Oriented Model), a two-stage hierarchical learning process for wheeled robots that combines the best of those approaches. In the first stage, a controller is trained with expert demonstrations through imitation learning. In the second stage, this controller is frozen and a perception module is trained by Proximal Policy Optimization to map LiDAR observations into the frozen latent space. The system is developed within an extended, heavily randomized TerraSentia simulation environment implemented in Isaac Lab, and is validated both in simulation and through real-world field experiments. In simulation, Phantom reaches full success rate with simple, mostly sparse rewards. Field experiments are conducted on three different navigation tasks, achieving strong performance and surpassing its baselines.

La navigazione autonoma sta rivoluzionando il settore agricolo negli ultimi anni: robot agricoli compatti e a basso costo devono operare in modo sicuro in condizioni avverse quali occlusioni, colture, terreni e condizioni atmosferiche che variano nel tempo. Le classiche architetture separano i moduli di percezione e di controllo, perdendo informazioni alla loro interfaccia e affidandosi a un modello dinamico impreciso del robot. Applicare direttamente un sistema end-to-end tramite il paradigma del Reinforcement Learning elimina questa separazione dei moduli al costo di complesse reward functions, producendo spesso delle policy difficili da implementare nei sistemi reali. Questa ricerca presenta Phantom (Pre-trained Hierarchical Agricultural \Navigation Trajectory Oriented Model), un processo di apprendimento gerarchico a due stadi per robot con ruote che combina il meglio di questi due approcci. Nel primo stadio, un regolatore viene addestrato con dimostrazioni di esperti tramite Imitation Learning. Nel secondo stadio, questo regolatore viene congelato e un modulo di percezione viene addestrato tramite Proximal Policy Optimization in modo da mappare le osservazioni LiDAR nello spazio latente congelato. Il sistema è sviluppato all'interno di un ambiente di simulazione implementato in Isaac Lab fortemente avanzato. Phantom è stato validato sia in simulazione sia attraverso esperimenti sul campo. In simulazione, Phantom raggiunge il pieno tasso di successo tramite semplici (e per lo più sparse) reward functions. Gli esperimenti sul campo sono condotti su tre diversi problemi di navigazione, ottenendo prestazioni notevoli e superando le proprie baseline.

Phantom: a hierarchical learning process for agricultural navigation

De ROSA, DAVIDE JARIK
2025/2026

Abstract

Autonomous navigation has been revolutionizing the agricultural field for the past few years, where compact, low-cost agricultural robots (AgroBots) must operate reliably under harsh conditions such as perceptual occlusions, different crops, terrain, and weather. Classical pipelines separate perception and control modules, losing information at their interface and relying on an imprecise dynamic model. Direct end-to-end reinforcement learning removes this split at the cost of complex, hand-crafted reward functions, often producing policies hard to deploy. This research presents Phantom (Pre-trained Hierarchical Agricultural Navigation Trajectory Oriented Model), a two-stage hierarchical learning process for wheeled robots that combines the best of those approaches. In the first stage, a controller is trained with expert demonstrations through imitation learning. In the second stage, this controller is frozen and a perception module is trained by Proximal Policy Optimization to map LiDAR observations into the frozen latent space. The system is developed within an extended, heavily randomized TerraSentia simulation environment implemented in Isaac Lab, and is validated both in simulation and through real-world field experiments. In simulation, Phantom reaches full success rate with simple, mostly sparse rewards. Field experiments are conducted on three different navigation tasks, achieving strong performance and surpassing its baselines.
ING - Scuola di Ingegneria Industriale e dell'Informazione
22-lug-2026
2025/2026
La navigazione autonoma sta rivoluzionando il settore agricolo negli ultimi anni: robot agricoli compatti e a basso costo devono operare in modo sicuro in condizioni avverse quali occlusioni, colture, terreni e condizioni atmosferiche che variano nel tempo. Le classiche architetture separano i moduli di percezione e di controllo, perdendo informazioni alla loro interfaccia e affidandosi a un modello dinamico impreciso del robot. Applicare direttamente un sistema end-to-end tramite il paradigma del Reinforcement Learning elimina questa separazione dei moduli al costo di complesse reward functions, producendo spesso delle policy difficili da implementare nei sistemi reali. Questa ricerca presenta Phantom (Pre-trained Hierarchical Agricultural \Navigation Trajectory Oriented Model), un processo di apprendimento gerarchico a due stadi per robot con ruote che combina il meglio di questi due approcci. Nel primo stadio, un regolatore viene addestrato con dimostrazioni di esperti tramite Imitation Learning. Nel secondo stadio, questo regolatore viene congelato e un modulo di percezione viene addestrato tramite Proximal Policy Optimization in modo da mappare le osservazioni LiDAR nello spazio latente congelato. Il sistema è sviluppato all'interno di un ambiente di simulazione implementato in Isaac Lab fortemente avanzato. Phantom è stato validato sia in simulazione sia attraverso esperimenti sul campo. In simulazione, Phantom raggiunge il pieno tasso di successo tramite semplici (e per lo più sparse) reward functions. Gli esperimenti sul campo sono condotti su tre diversi problemi di navigazione, ottenendo prestazioni notevoli e superando le proprie baseline.
File allegati
File Dimensione Formato  
2026_07_DeRosa_Tesi.pdf

accessibile in internet per tutti

Descrizione: Testo della tesi
Dimensione 41.16 MB
Formato Adobe PDF
41.16 MB Adobe PDF Visualizza/Apri
2026_07_DeRosa_ExecutiveSummary.pdf

accessibile in internet per tutti

Descrizione: Executive Summary
Dimensione 1.97 MB
Formato Adobe PDF
1.97 MB Adobe PDF Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/261508