Aller au contenu

Contrôles qualité

Le pipeline produit quatre niveaux de contrôle : préparation des entrées, exploration des seuils, conformité avant modèle et relecture après prédiction.

Conformité ReLUT

Chaque segment préparé est contrôlé selon les critères suivants :

Critère Seuil ou règle
colonnes requises lon, lat, timestamp, speed_kmh non nulles
coordonnées longitude entre -180 et 180, latitude entre -90 et 90
vitesse non négative
timestamps ordre croissant
nombre de lignes 2 à 10 000
durée moins de 30 jours
fréquence médiane moins de 20 secondes
gap maximal moins de 3 600 secondes

Ces contrôles sont exportés dans :

Output/reports/relut_validation_by_segment.csv
Output/reports/relut_validation_summary.json

Contrôles de nettoyage

Le fichier suivant résume les pertes et imputations :

Output/reports/cleaning_report.json

Il faut notamment relire :

  • le nombre de points retirés par précision GPS ;
  • le nombre de doublons supprimés ;
  • le nombre de vitesses manquantes ou inconnues ;
  • le nombre de vitesses plafonnées.

Contrôles exploratoires

Avant de figer les résultats, deux familles de sorties doivent être relues.

Spatial

Output/reports/spatial_eda_candidate_profile.csv
Output/reports/spatial_eda_threshold_sensitivity.csv

Ces fichiers servent à comprendre la contribution des signaux spatiaux : distance finale dans le buffer, passage près de l'activité, boucle géométrique et tortuosité. La comparaison entre spatial_candidate_broad et spatial_candidate_conservative doit être conservée tant que la méthode n'est pas validée sur un échantillon relu.

Les cartes de diagnostic de l'EDA spatiale peuvent être régénérées depuis le notebook 21 si une relecture détaillée est nécessaire, mais elles ne sont plus conservées par défaut dans Output/maps afin d'éviter les doublons avec les cartes de restitution consolidées.

Temporel

Output/reports/temporal_eda_waypoint_profile.csv
Output/reports/temporal_eda_segment_sensitivity.csv

Ces fichiers servent à vérifier la qualité des waypoints voiture et la sensibilité du découpage au seuil gap_minutes. Sur un jeu plus complet que le sample, un changement de ce seuil peut modifier le nombre de segments et donc le dernier point transmis au modèle.

Relecture après modèle

Les sorties de prédiction doivent être relues à trois niveaux.

Segment

prediction_summary_by_segment.csv donne pour chaque segment :

  • nombre de points ;
  • durée ;
  • distance totale ;
  • probabilité maximale ;
  • probabilité moyenne ;
  • timestamp du début prédit ;
  • durée prédite de recherche ;
  • distance restante au stationnement supposé.

Courbe temporelle

prediction_probability_examples.png montre la probabilité p(search) au fil du segment. C'est utile pour repérer :

  • un basculement net en fin de trajet ;
  • une probabilité élevée dès le début ;
  • des oscillations fortes ;
  • un plateau artificiel dû au post-traitement.

Cartes

Les cartes de restitution consolidées sont :

Output/maps/relut_full_leg_probability_sample.html
Output/maps/spatial_temporal_comparison_examples.html
Output/maps/territorial_h3_hotspots.html
Output/maps/routing_geometry_comparison.html

La carte prioritaire pour la relecture qualitative est relut_full_leg_probability_sample.html : elle affiche un échantillon de legs complètes originales, avec une couleur par segment selon la probabilité ReLUT de recherche de stationnement. Elle permet de vérifier si les probabilités fortes se situent dans un contexte plausible : approche de destination, boucle, ralentissement final, retour en arrière, quartier urbain, etc.

Critères d'alerte

Un segment doit être inspecté manuellement si :

  • la recherche commence dès les premières minutes ;
  • la durée prédite est proche du plafond configuré ;
  • la distance restante au début de recherche est très faible ou très élevée ;
  • la courbe de probabilité est élevée sur tout le trajet ;
  • le segment contient un grand gap temporel ;
  • la carte montre une trajectoire incohérente ou une fin hors réseau routier.