Pourquoi la modélisation prédictive est-elle importante pour la sécurité routière?

Les accidents de la route demeurent l'une des principales causes de décès évitables dans le monde, et ils font plus de 1,3 million de victimes chaque année selon l'Organisation mondiale de la santé. Bien que les efforts traditionnels de sécurité visent à réagir aux accidents après qu'ils se produisent, une approche proactive fondée sur la modélisation prédictive peut transformer la façon dont les villes et les organismes de transport allouent les ressources.

L'idée fondamentale est de nature à être simple : traiter l'accident comme un événement spatial-temporel dont la probabilité peut être estimée à partir de données historiques, de conditions environnementales et de caractéristiques de l'infrastructure.Dans la pratique, la construction de ces modèles nécessite une intégration attentive de multiples flux de données, des algorithmes d'apprentissage automatique sophistiqués et une validation rigoureuse.

Concepts fondamentaux des modèles prédictifs pour les points chauds d'accident

Les modèles prévisionnels d'accidents de la circulation se divisent en deux grandes catégories : les modèles statistiques et les modèles d'apprentissage automatique. Des approches statistiques comme la régression de Poisson, la régression binomiale négative et les modèles bayésiens hiérarchiques sont utilisés depuis des décennies dans le domaine de la sécurité des transports. Elles offrent des intervalles d'interprétation et de confiance bien compris, mais elles sont souvent confrontées à des interactions non linéaires complexes présentes dans les données réelles.

Peu importe l'algorithme, tous les modèles prédictifs partagent un pipeline commun : ils transforment les données brutes d'entrée en un ensemble de caractéristiques (prédicateurs) qui sont en corrélation avec le risque d'accident, apprennent la cartographie entre les caractéristiques et les événements d'accident à partir des enregistrements historiques, puis produisent des scores de risque pour des périodes ou des emplacements non observés.

Sources de données clés pour la prévision des points chauds d'accident

Des données complètes et de grande qualité sont à la base de tout modèle prédictif efficace. Voici les sources de données les plus critiques utilisées dans la pratique :

Dossiers historiques d'accidents

Les rapports de police, les registres d'admission à l'hôpital et les demandes d'assurance constituent la principale source d'étiquettes d'accident, qui comprennent généralement l'horodatage, l'emplacement (latitude/longitude ou intersection de la rue), la gravité, le nombre de véhicules en cause, les conditions météorologiques et d'éclairage à l'époque, et des facteurs contributifs comme la vitesse ou l'alcool. Aux États-Unis, la National Highway Traffic Safety Administration (NHTSA) [ maintient le Système d'analyse des décès (FARS) et le Système d'échantillonnage des rapports d'accident (CRSS), qui sont largement utilisés pour la recherche.

Données sur le volume et le débit du trafic

Les données sur le volume de trafic proviennent de détecteurs de boucle inductifs, de capteurs radar, de caméras et de suivi de l'adresse MAC Bluetooth/Wi-Fi. Des agences comme Federal Highway Administration (FHWA) fournissent des statistiques sur le volume de trafic par l'intermédiaire du système de surveillance de la performance de l'autoroute (HPMS). Pour les prévisions en temps réel ou en temps quasi réel, les API des applications de navigation (Google Maps, Waze) et des fournisseurs de données sur les véhicules connectés offrent des mesures de vitesse et de densité de trafic à haute résolution.

Conditions météorologiques et environnementales

Les données météorologiques historiques peuvent être obtenues auprès de National Oceanic and Atmospheric Administration (NOAA) et des stations météorologiques locales de l'aéroport. Pour les applications en temps réel, les API météorologiques (p. ex. OpenWeatherMap, Weatherstack) fournissent les conditions actuelles. L'agrégation des variables météorologiques pour correspondre à la granularité temporelle des dossiers d'accident (heureusement ou quotidiennement) est une étape de prétraitement courante.

Infrastructure routière et géométrie

Les caractéristiques de la route elle-même influent fortement sur la probabilité d'un accident.Les variables clés comprennent le nombre de voies, la largeur de la voie, le type d'épaule, la présence médiane, la limite de vitesse, la courbure (horizontale et verticale), la densité d'intersection, les dispositifs de contrôle de la circulation (signaux d'arrêt, signaux de circulation, ronds-points) et la qualité de la chaussée.

Comportement des conducteurs et télématique

Avec la prolifération des smartphones et des dispositifs télématiques d'assurance, les données sur le comportement des conducteurs individuels — freinages courts, accélérations dues, accélérations, virages — sont désormais disponibles. Les mesures du comportement agrégé (p. ex. vitesse moyenne, pourcentage de vitesse du temps) au niveau du segment routier ou de la zone peuvent être de puissants prédicteurs.

Contexte spatial et démographique

Les caractéristiques de l'environnement bâti et de la population influent également sur le risque d'accident. L'utilisation des terres (résidentiel, commercial, industriel), la proximité des écoles, des hôpitaux, des centres commerciaux et des arrêts de transport en commun influent sur les habitudes de circulation et l'exposition des piétons.

Élaboration d'un modèle prédictif : étape par étape

L'élaboration d'un modèle de point chaud pour les accidents prêts à la production suit un processus systématique.

1. Collecte et intégration des données

Les dossiers d'accident résident souvent dans des bases de données policières comportant différents schémas; les données sur le volume de trafic peuvent provenir de plusieurs types de capteurs; les données météorologiques sont généralement stockées dans des bases de données de séries chronologiques. Un entrepôt de données unifié ou un lac de données qui harmonise les horodatages, les systèmes de référence de coordonnées (projection GIS) et les définitions d'attributs sont essentielles. Par exemple, il peut être nécessaire d'harmoniser les horodatages d'accident avec les observations météorologiques.

2. Nettoyage et prétraitement des données

Les données du monde réel sont mesquines. Les problèmes courants comprennent les valeurs manquantes (p. ex. conditions météorologiques inconnues), les enregistrements en double, les coordonnées incorrectes et les valeurs aberrantes (p. ex. valeurs de vitesse improbables). Le traitement des données manquantes exige un jugement de domaine : par exemple, si les conditions météorologiques sont absentes, on peut imputer à partir de la station la plus proche ou une moyenne climatologique. Les coordonnées géographiques qui se trouvent à l'extérieur de la zone d'étude doivent être corrigées ou rejetées.

3. Ingénierie des caractéristiques

Les données brutes fournissent rarement des caractéristiques directement utilisables. La transformation est nécessaire pour extraire des signaux prédictifs.

  • Caractéristiques temporaires: heure de jour, jour de semaine, mois, saison, indicateur de vacances, drapeau de l'heure de pointe.
  • Caractéristiques spatiales:[ distance jusqu'à l'intersection la plus proche, type d'intersection, courbure de la route (en utilisant des changements de roulement depuis le SIG), nombre de voies, limite de vitesse.
  • Agrégats météorologiques: Moyennes mobiles des précipitations, de la température, de la visibilité au cours des 1, 3 et 24 heures précédentes.
  • Caractéristiques de circulation: vitesse moyenne (par rapport à la limite de vitesse affichée), rapport volume-capacité, indice de congestion, variation de vitesse entre fenêtres chronologiques consécutives.
  • Densité historique des accidents:[ estimation de la densité des grains (KDE) d'accidents passés dans un rayon de 500 mètres ou le long du même segment de route pour capturer les zones à points chauds chroniques.
  • Termes d'interaction:[ p.ex. produit de la pluie et section haute courbure, ou combinaison de l'obscurité et du volume piétonnier.

Les connaissances des ingénieurs en sécurité routière peuvent indiquer les interactions qui comptent. Les méthodes automatisées de sélection des fonctions (p. ex., l'importance des caractéristiques des modèles basés sur les arbres, l'élimination des caractéristiques récursives) réduisent ensuite l'ensemble des candidats.

4. Sélection et formation des modèles

Le choix dépend de la taille des ensembles de données, des exigences d'interprétation, des ressources informatiques et de la nécessité d'inférences en temps réel.Un point de départ typique est XGBoost ou LightGBM[—les arbres à pente progressive qui manipulent bien les types de données mixtes, les valeurs manquantes et la non-linéarité, et qui fournissent des classements d'importance des caractéristiques.Pour les ensembles de données extrêmement importants comportant des millions d'observations, les modèles d'apprentissage profond comme les réseaux neuronaux récurrents (RNN) ou les réseaux neuronaux convolutionnels (RNC) sur les grilles spatiales peuvent saisir des modèles complexes.

5. Validation et évaluation

Les mesures de précision normalisées ne sont pas significatives pour les données hautement déséquilibrées. L'évaluation utilise plutôt des mesures adaptées à la prédiction d'événements rares : , , [F1‐score, Précision‐Reappel (PR) ASC[, F1‐score[, Reappel (sensibilité) à une précision fixe, et Précision moyenne (MAP)[. Pour l'identification des points chauds, les praticiens comparent souvent les zones à haut risque classées au sommet avec les lieux d'accident réels dans une période de blocage.

  • Split chromologique: train sur les années 2015–2019, test sur 2020.
  • Spatio spatio-spatiale: abritent des districts ou des régions entiers.
  • Fenêtre de roulement: train sur une fenêtre coulissante de 3 ans et test l'année suivante.

6. Déploiement et surveillance

Une fois validé, le modèle est déployé comme un service de notation qui ingère les données courantes (p. ex. flux météorologiques en temps réel, vitesse de circulation en direct) et qui produit des cotes de risque pour chaque segment ou intersection de route. Ces cotes peuvent être visualisées sur un tableau de bord de carte interactif pour les gestionnaires de trafic. Les alertes automatisées peuvent informer lorsqu'un segment dépasse un seuil dynamique. Directus offre un moteur CMS sans tête flexible qui peut servir de couche d'agrégation de données, stockant des prévisions historiques et permettant un développement rapide de frontend à l'aide de son API REST ou GraphQL. La performance du modèle doit être surveillée au fil du temps : la dérive conceptuelle (changements de comportement du conducteur, nouvelles routes, effets saisonniers) peut dégrader la précision.

Applications et avantages dans la pratique

Les modèles prédictifs ont dépassé la recherche pour se transformer en déploiement opérationnel dans de nombreuses villes.

  • Application de la loi : Les services de police utilisent des cartes à points chauds pour planifier les patrouilles et mettre en place des caméras de vitesse.Par exemple, la ville de Los Angeles a déployé un modèle prédictif qui a réduit les collisions mortelles de 20 % dans les zones à haut risque sur deux ans.
  • Améliorations de l'infrastructure: Les ministères des Transports priorisent les améliorations de la route – comme l'ajout de voies de virage, l'amélioration de la signalisation ou l'installation de ronds-points – en fonction du risque prévu, en optimisant les budgets limités.
  • Signaux d'avertissement dynamiques: Affichage des panneaux de message variables (VMS) Zone à risque d'accident élevé devant , pendant les heures de pointe ou les intempéries, en tirant parti des sorties du modèle en temps réel.
  • Sécurité du véhicule autonome: Les développeurs de voitures autoconduites utilisent ces modèles pour ajuster de façon préventive la vitesse et la distance de suivi dans les zones historiquement dangereuses.
  • Planification urbaine:[ Les urbanistes évaluent l'impact probable des nouveaux aménagements ou des remaniements routiers avant le début de la construction, en utilisant des simulations de modèles fondées sur des scénarios.

Le rendement économique est important : la Federal Highway Administration estime que chaque dollar dépensé pour améliorer la sécurité cible rapporte entre 4 $ et 20 $ d'économies résultant de la réduction des accidents.

Défis et limites

Malgré leur promesse, les modèles de points chauds d'accident sont confrontés à plusieurs défis importants.

Qualité et disponibilité des données

Les données sur le volume de trafic sont souvent rares, surtout sur les routes de faible classe. Les règlements sur la protection de la vie privée (RGPD, lois biométriques sur la protection de la vie privée au niveau de l'État) limitent l'accès aux données sur les emplacements à grain fin provenant des appareils mobiles.

Iquilibre de classe et événements rares

Les accidents sont rares par rapport au nombre d'heures de segment de route. Par exemple, une intersection urbaine typique peut voir un accident par plusieurs millions de kilomètres de véhicules. Les modèles formés sur de telles données biaisées prédisent souvent partout des probabilités nulles ou extrêmement faibles, ne distinguant pas les gradients de risque. L'apprentissage sensible aux coûts et l'aide de suréchantillonnage synthétique peuvent toutefois introduire des artefacts.

Non-stationnarité spatiale et temporelle

La relation entre les prédicteurs et le risque d'accident n'est pas constante dans l'espace ou le temps. Un modèle formé sur les données d'une ville peut ne pas généraliser. Dans une ville, des facteurs comme la limitation de vitesse ou la dégradation de la surface de la route évoluent.

Interprétabilité et équité

Les intervenants, y compris le public, les politiciens et les organismes d'application de la loi, doivent comprendre pourquoi un segment particulier de la route est signalé. Les modèles d'apprentissage en profondeur de la boîte noire manquent de transparence. Des techniques comme SHAP (Shapley Additive Explaintions) et LIME peuvent fournir des explications par prévision, mais elles ajoutent de la complexité.

Orientations futures et tendances émergentes

Le domaine évolue rapidement. Plusieurs développements à la fine pointe sont en passe d'améliorer la précision prédictive et la valeur opérationnelle.

Fusion de données multi-sources en temps réel

Grâce à l'expansion de la technologie du véhicule connecté (V2X), des données en temps réel sur les mouvements individuels du véhicule, le freinage dur et les événements quasi-mâss seront disponibles. L'intégration de ces flux avec des modèles historiques peut fournir une détection instantanée des points chauds.

Jumelles numériques et simulation

L'utilisation croissante de jumeaux numériques, des répliques virtuelles de réseaux routiers physiques, permet une simulation continue des scénarios de circulation et de sécurité. Un modèle prédictif intégré dans un jumeau numérique peut évaluer l'impact sur la sécurité des changements d'infrastructure (p. ex., en supprimant une voie) avant tout travail physique, en réduisant les coûts et le temps.

Renforcement de l'apprentissage pour l'allocation dynamique des ressources

Au lieu de prédire les points chauds, les agents d'apprentissage du renforcement (RL) peuvent optimiser l'endroit où envoyer des patrouilles d'application de la loi, déployer des caméras temporaires à vitesse ou ajuster les horaires des signaux de circulation pour réduire les risques. L'agent RL apprend une politique qui équilibre la détection des temps à risque élevé avec des contraintes de ressources.

Inférence causale et prévisions contrefaites

Au-delà de la corrélation, les modèles causaux peuvent répondre à -------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------

Commencer par Directus pour la gestion des données de trafic

Pour les organisations qui construisent des modèles prédictifs, la gestion de diverses sources de données constitue un obstacle majeur. Vous pouvez modéliser les stations météorologiques, les segments routiers, les dossiers d'accidents et les capteurs de circulation en tant que tables distinctes avec des liens relationnels, puis les exposer par une seule API pour votre pipeline de modélisation. Les tableaux de bord conviviaux peuvent être construits en utilisant l'application intégrée Directus ou des frontends personnalisés qui consomment l'API. Cela permet aux intervenants non techniques de visualiser les cartes et les rapports de points chauds tandis que les data savants se concentrent sur le développement de modèles. La flexibilité de Directus en fait un pilier idéal pour la couche de données d'une plateforme d'analyse de sécurité.

Les modèles prédictifs pour les points chauds d'accidents de la circulation ne sont pas une balle d'argent, mais ils représentent un changement puissant vers une sécurité routière proactive. En combinant une solide ingénierie des données, un apprentissage automatique sophistiqué et un déploiement réfléchi, les villes peuvent réduire de façon mesurable les collisions, les blessures et les décès.