Optimización de rutas de entrega mediante aprendizaje por refuerzo aplicado a drones de reparto urbano
10 de septiembre de 2025
- keytel pumaylle ramirez
- aron omar pizarro cahuana
Keywords:aprendizaje por refuerzodroneslogisticaoptimizacion de rutasultima milla
Resumen
La planificación de rutas para flotas de drones de reparto es un problema de optimización con restricciones que cambian durante la propia ejecución del vuelo: el viento varía, aparecen zonas de espacio aéreo restringido y la carga de batería se degrada de forma no lineal. Este trabajo evalúa si el aprendizaje por refuerzo profundo ofrece ventajas frente a los algoritmos clásicos de planificación cuando esas condiciones no se conocen de antemano.
El estudio forma parte de la línea de investigación Vortex de Dizzgo Research.
Planteamiento del problema
Formulamos la asignación de entregas como un problema de enrutamiento de vehículos con ventanas de tiempo y restricción energética. A diferencia de la formulación estándar, el coste de cada arco no es fijo: depende de condiciones de viento que el agente solo observa parcialmente al momento de decidir.
Las restricciones consideradas son:
- Autonomía máxima por unidad, con consumo dependiente de carga y viento.
- Ventanas de tiempo asociadas a cada punto de entrega.
- Zonas de exclusión aérea que pueden activarse durante el vuelo.
- Capacidad de carga limitada por unidad.
Metodología
Entorno de simulación
Se construyó un entorno de simulación sobre una malla urbana de 8 × 8 km con 120 puntos de entrega distribuidos de forma no uniforme, replicando la densidad de un distrito comercial. El viento se modeló como un campo vectorial que varía cada 60 segundos de simulación.
Agente
El agente se entrenó mediante una arquitectura actor-crítico, recibiendo como observación el estado de la flota, la lista de entregas pendientes y una ventana local de condiciones ambientales. La función de recompensa penaliza el tiempo total de entrega, el consumo energético y el incumplimiento de ventanas de tiempo.
Líneas base
Se compararon tres estrategias:
- Vecino más cercano, como referencia mínima.
- Búsqueda de vecindad variable, representativa de los métodos heurísticos clásicos.
- Replanificación periódica, que recalcula la ruta óptima cada vez que cambia el entorno.
Escenarios
Cada estrategia se evaluó en 500 episodios bajo dos regímenes: condiciones estables y condiciones con perturbaciones frecuentes.
Resultados
En condiciones estables, la búsqueda de vecindad variable obtuvo el mejor tiempo total de entrega, superando al agente entrenado en un 4 %. El resultado es esperable: cuando el entorno no cambia, el problema se reduce a una optimización clásica bien estudiada.
En condiciones con perturbaciones frecuentes la relación se invierte:
| Estrategia | Tiempo total | Entregas fuera de ventana | Consumo energético |
|---|---|---|---|
| Vecino más cercano | +38 % | 22 % | +19 % |
| Vecindad variable | +11 % | 14 % | +7 % |
| Replanificación periódica | +6 % | 9 % | +12 % |
| Agente entrenado | referencia | 5 % | referencia |
El agente entrenado reduce el incumplimiento de ventanas de tiempo a casi la mitad frente a la replanificación periódica, con un consumo energético menor, ya que anticipa las condiciones adversas en lugar de reaccionar a ellas.
Discusión
La ventaja del enfoque aprendido no proviene de encontrar mejores rutas en el sentido combinatorio, sino de adoptar decisiones conservadoras ante la incertidumbre: el agente tiende a reservar margen energético cuando la observación local sugiere viento desfavorable, un comportamiento que las líneas base no pueden expresar.
Esa misma característica constituye su principal limitación. El agente fue entrenado sobre un modelo de viento sintético, y su desempeño depende de que las condiciones reales se asemejen a esa distribución. No disponemos aún de evidencia sobre su comportamiento ante perturbaciones fuera de distribución.
Limitaciones
- Los resultados provienen exclusivamente de simulación; no hay validación en vuelo real.
- El modelo de viento es sintético y probablemente más regular que las condiciones reales.
- No se modelaron fallos de hardware ni pérdidas de comunicación.
- El coste computacional de entrenamiento es considerablemente superior al de las líneas base.
Conclusiones
- El aprendizaje por refuerzo no aporta ventajas frente a los métodos clásicos cuando el entorno es estable.
- Bajo perturbaciones frecuentes, el agente reduce el incumplimiento de ventanas de tiempo del 9 % al 5 %.
- La ventaja observada proviene del comportamiento anticipatorio ante incertidumbre.
- Se requiere validación en entorno real antes de extraer conclusiones operativas.
Trabajo futuro
- Validación en un entorno controlado con unidades físicas.
- Evaluación del desempeño ante distribuciones de viento no vistas durante el entrenamiento.
- Incorporación de fallos de comunicación al modelo de simulación.
- Estudio de estrategias híbridas que combinen planificación clásica con corrección aprendida.