Reinforcement Learning · Toluca, MX
UrbanMind·X
Una ciudad que aprende a despejarse sola
UrbanMind·X
SISTEMA ACTIVO · RL · PPO · TOLUCA, MX
EVAL · 5 EPISODIOS / ESCENARIO

Una ciudad que aprende a despejarse sola.

Dos agentes de IA —un semáforo y los vehículos autónomos— se coordinan en una ciudad real —Toluca— y reducen el tiempo de espera de 303 a 66 segundos.

0%
reducción del tiempo de espera
303 s → 66 s
Espera · sistema completo
0
−237 s vs. semáforo fijo
Velocidad promedio
0
+18% de flujo más ágil
Throughput sostenido
0
autos/hora con menos espera
Escenarios evaluados
0
normal · pico · desbalanceado
La intersección real
El modelo en SUMO replica un cruce real de Toluca: el Blvd. José María Pino Suárez con la Av. Venustiano Carranza.
Blvd. José Ma. Pino Suárez × Av. Venustiano Carranza
Col. Universidad / Altamirano · Toluca de Lerdo, Edo. de México
Abrir en Google Maps ↗
Comparativa en simulación
El mismo cruce, con el mismo volumen de tráfico: sistema de semáforo fijo frente a UrbanMind X con aprendizaje por refuerzo.
Control
Sistema Tradicional
Semáforo de tiempo fijo · ciclos estáticos
Agente 1
Semáforo Inteligente
PPO · ciclos adaptados al flujo
UrbanMind X
Sistema Completo
PPO · semáforo inteligente + vehículos autónomos
Cada capa de inteligencia desploma la espera (línea verde), mientras el flujo de autos que cruzan se mantiene estable (línea azul).
espera (s) ↓ · autos/h →
El aporte de cada agente
Cuánto reduce la espera cada componente por separado, y cuánto logran juntos.
Más que la suma de sus partes

El semáforo por sí solo reduce la espera un 36.5%. Los vehículos autónomos solos, un 46.6%.

Juntos alcanzan 78.2% — por encima de cualquiera en solitario. No se suman: se potencian.

↗
Sinergia. Vehículos que anticipan el semáforo, frente a un semáforo que se adapta al flujo, producen una mejora combinada superior a la esperada.
Robustez ante distintas condiciones
El sistema completo mantiene su desempeño bajo alta densidad y tráfico desigual.
Curvas de aprendizaje
Evolución de la recompensa durante el entrenamiento de cada agente con PPO.
Semáforo Inteligente
Fase de aprendizaje · primeros 60k pasos · recompensa normalizada
ConvergióLa recompensa sube rápido en los primeros ~25k pasos y se estabiliza: el agente alcanza pronto su techo de aprendizaje.
Vehículos Autónomos
Fase de aprendizaje · primeros 60k pasos · semilla fija (reproducible)
MejoróLa recompensa sube con fuerza al inicio y se estabiliza; el agente sigue refinando su conducción durante el resto del entrenamiento.
El proceso experimental del semáforo
Cuatro configuraciones probadas para maximizar el agente. El techo de un semáforo de dos fases resultó ser ~36%.
Resultados completos
Métricas medidas directamente en SUMO sobre la intersección Carranza · Pino Suárez.
EscenarioEspera (s)ThroughputVelocidad (m/s)FrenadasMejora